18 сентября 2026 г.
Локальный запуск модели стал реальнее: Bonsai 2 занимает 5,9 ГБ
17 сентября 2026 года Bonsai 2 27B заняла 5,9 ГБ в сборке PTQ1_0 и сохранила 98,2% результата FP16-версии, пишет PrismML. Модель основана на Qwen3.8-27B, использует веса со значениями -1, 0 и +1 и держит контекст до 262 тысяч токенов. PrismML заявляет до 143 токенов/с на RTX 5090 и 46,8 токена/с на M5 Max.

Раньше FP16-версия занимала около 54 ГБ, теперь Bonsai 2 27B укладывается примерно в 5,9 ГБ. Предыдущая Ternary Bonsai сохраняла 95% качества, новая версия подняла показатель выше 98%.
Сравнение. В thinking-бенчмарке 17 сентября Bonsai 2 27B набрала 84,78 балла против 72,59 у IQ2_XXS и 85,18 у UD-Q4_K_XL. Сборки занимали 5,9, 9,4 и 17,6 ГБ соответственно, поэтому малая сборка почти догнала крупную по результату.
Поставить можно локально. На macOS и Linux PrismML предлагает выполнить три команды: `git clone`, `./setup.sh` и `./scripts/start_llama_server.sh`. Сервер откроется на `http://localhost:8080`. Для Bonsai 2 нужен fork llama.cpp от PrismML, обычная версия проекта эти файлы не запускает.
В GGUF доступны сборки PTQ1_0 на 5,95 ГБ и PQ2_0 на 7,21 ГБ. Модуль для работы с изображениями добавляет около 0,63 ГБ. На NVIDIA GPU модель работает через CUDA, на Mac, iPhone и iPad через MLX, а веса выпущены под Apache 2.0.
Скорость. На RTX 4090 PrismML указывает расход 0,714 мВт·ч на токен. Simon Willison 18 сентября получил на M5 Pro примерно 20 токенов/с в первом запуске и 44 после перезапуска.
Локальные замеры пока расходятся: на M5 Pro Simon Willison получил 20 токенов/с в первом запуске и 44 после перезапуска 18 сентября 2026 года.
Первоисточник
