22 сентября 2026 г.
GGUF-модели перестанут раздуваться в памяти: Transformers загружает кванты llama.cpp
22 сентября Hugging Face добавил в Transformers загрузку GGUF-квантов llama.cpp без де-квантизации. Qwen3.5-4B в Q4_K_M занимает 2,74 GB вместо 8,42 GB в BF16.

Без совместимого `ggml-quantization` kernel Transformers де-квантовал GGUF при загрузке и съедал больше памяти. Теперь Qwen3.5 можно загрузить через `from_pretrained` с файлом GGUF, а Hugging Face советует начать с Q4_K_M.
Как поставить. Первый путь рассчитан на Mac с Apple Silicon, двумя последними релизами PyTorch, `transformers` из `main` и пакетом `kernels`. Загруженную модель можно отдать локальному OpenAI-совместимому клиенту через `transformers serve`.
Packed-путь пока работает через MPS, а padding и batching ещё требуют доработки.
Первоисточник
