16 сентября 2026 г.
Хранение ternary-моделей можно ужать: BITCOS обошёл five-trit packing при доле нулей выше 37,5%
BITCOS оказался компактнее five-trit packing в 26 из 29 проверенных ternary-моделей (статья Intel на arXiv, 14.09.2026). Формат делит веса на bitmap присутствия и компактный sign vector, поэтому его стоимость равна 2−z битам на вес при доле нулей z. В CAT-Q Qwen3-1.7B он достиг 1,485 бита на вес и уменьшил размер против 2-bit packing в 1,32 раза.

Раньше five-trit packing хранил ternary-веса с эффективной шириной 1,625 бита на вес из-за блоков по 128 элементов. BITCOS меняет только раскладку хранения готового checkpoint, retraining не нужен, а значения весов остаются теми же.
Главный выигрыш. В 29 моделях доля нулевых весов составила 29,7–51,5%. При доле выше 37,5% BITCOS становится компактнее five-trit packing. Так получилось у 26 моделей.
Скорость зависит от железа. Авторы подготовили optimized unpack sequences для AVX-512, AVX2 и Intel Xe2 GPUs. В тестовой интеграции с vLLM скорость декодирования выросла в 1,10–1,18 раза на 64-ядерном Emerald Rapids, в 1,02–1,15 раза на 24-ядерном Arrow Lake и до 1,27 раза на Intel Xe2 GPU. На 8-ядерном Lunar Lake BITCOS проиграл 2-bit kernel при любой проверенной доле нулей: при z=0,40 пропускная способность составила 28,9 против 74,7 GB/s.
Дальше ценность BITCOS будет определяться связкой модели и железа: на Emerald Rapids и Xe2 он ускоряет декодирование, а на Lunar Lake замедляет его.
Первоисточник
