23 июля 2026 г.
Генерация картинок влезает в 16 ГБ видеопамяти: на BF16 тот же прогон просил 31,1 ГБ
23 июля Hugging Face встроила 4-битный движок Nunchaku прямо в Diffusers. Теперь квантованный чекпойнт грузится обычным from_pretrained(), а CUDA-ядра пакет kernels тянет с Hub при первом запуске: собирать их у себя не нужно. На RTX PRO 6000 прогон занял 2,27 с против 3,00 с на BF16, с torch.compile - 1,68 с. Пиковая видеопамять упала с 31,1 ГБ до 20,6 ГБ, а если текстовый энкодер тоже уложить в NF4 - до 16 ГБ.

Почему это важно: Раньше 4-битные чекпойнты Nunchaku жили в отдельной библиотеке, и под свою карту приходилось компилировать CUDA руками. Теперь это ставится одной строкой: diffusers, transformers, accelerate, kernels, bitsandbytes. Схем квантования две: svdq_w4a4 давит веса и активации до 4 бит с низкоранговой поправкой SVDQuant, awq_w4a16 оставляет активации в 16 битах на слоях модуляции. Железо решает многое. INT4 работает на Turing, Ampere и Ada - это RTX 30 и 40, A100, L40S. NVFP4 просит Blackwell: RTX 50, RTX PRO 6000, B200. За скорость платите универсальностью: без архитектурных fused-ядер Nunchaku Lite не догоняет оригинальный движок, отсюда и скромные 1,35x без компиляции. Фьюз QKV сам он не угадает, нужен конфиг под модель. И да, в таблице поддержки напротив Hopper стоит прочерк: на H100 это не заводится.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Что дальше: Готовых чекпойнтов пока три, все от сообщества: два ERNIE-Image-Turbo и Krea 2 Turbo. Возьмите свой обычный промпт, прогоните его на BF16 и на svdq_w4a4 и сравните две цифры: пиковую память и время шага - только так поймёте, влезет ли ваша модель в вашу карту.
Первоисточник