25 августа 2026 г.
4 бита перестали стоить качества: HyperNova обошла свой несжатый оригинал на 7 бенчмарках из 9
4-битная HyperNova-60B выиграла или повторила собственный bfloat16-исходник на 7 бенчмарках из 9 при вчетверо меньшей памяти под веса.

Обычно 4 бита покупаются качеством. У HyperNova-60B вышло наоборот.
Multiverse Computing сжала свою 60B-модель в MXFP4 и прогнала девять бенчмарков против несжатого bfloat16-исходника. Семь тестов сжатая версия выиграла или повторила.
AA-LCR: 35.3 → 42.7. AIME 2025: 70.7 → 76.3. Aider: 38.2 → 40.9. Просели только два теста, и оба меньше чем на два пункта: MMLU-Pro и SciCode.
Метод. Quantization-Aware Healing учит 4-битного студента напрямую с оригинальной несжатой модели, а не с bfloat16-чекпойнта сжатой, как делали раньше. Чекпойнт сам лишь приближение оригинала, и его ошибки ставят студенту потолок качества.
На 9B-модели разница видна по шагам обучения. QAH выходит на пик 54.9 примерно за 100 шагов и дальше держится. Привычный QAT добирается до сопоставимых 54.6 только к 700-му шагу, а к 1200-му обваливается до 35.6, поэтому момент остановки приходится ловить руками.
Как запустить. `pip install vllm`, затем `vllm serve "MultiverseComputingCAI/Hypernova-60B-2605"`. Веса весят 32 ГБ против 65 ГБ у gpt-oss-120b и влезают в одну NVIDIA H200: заявленный расход видеопамяти меньше 40 ГБ, лицензия Apache 2.0. Через transformers модель поднимается вызовом AutoModelForCausalLM.from_pretrained с trust_remote_code=True.
Одна H200 выдаёт 5 210 токенов в секунду при 128 параллельных запросах. Первого токена ждать в среднем 4.85 секунды.
Опубликованные цифры описывают исследовательский пайплайн, а не скачиваемые веса: авторы предупреждают, что открытый релиз Hypernova-60B они дообучали сверх рецепта статьи.
Сам рецепт MXFP4-стадии выложен целиком: 400 шагов, глобальный батч 64, длина последовательности 32k, 8 нод H200 с шардингом FSDP2, данные из смеси NVIDIA Nemotron и SmolTalk 2. Бэкенд распределённого обучения оказался не деталью. На FSDP2 модель берёт 73.74 на GPQA Diamond, конфигурации DeepSpeed упираются в 65.15 на том же рецепте.
Первоисточник