13 августа 2026 г.
Модель в 150 млн параметров подобралась к GPT-5.6 Luna на ARC-AGI: 29,5% против 34,2%
Pathway показала рассуждающую модель BDH-CQ на 150 млн параметров: 29,5% на публичном сплите ARC-AGI-1 при $0,0007 за задачу против $0,008 у GPT-5.6 Luna.

В июле на лидерборде ARC Prize Luna в лёгком режиме брала 34,2% по $0,040 за задачу, и Pathway считала себя дешевле в 57 раз. 30 июля OpenAI срезала цену Luna на 80%, и превосходство сжалось до 11 раз.
Считали при этом по разным линейкам. $0,0007 у Pathway - не счёт от провайдера, а расчёт: 0,85 секунды H200 на задачу при ставке $3 за час аренды. Цифры конкурентов на том же графике взяты из API-прайсов и оценок железа, и авторы это оговаривают сами.
Экономию даёт архитектура. Рассуждающие модели вроде Luna думают текстом: каждый шаг рассуждения - это сгенерированные токены, за которые капает счёт и растёт задержка. BDH-CQ крутит те же итерации внутри рекуррентного скрытого состояния и промежуточный текст не выписывает вовсе.
Цена такой узости видна в цифрах. Обучающая смесь собрана из самого ARC-AGI-1 плюс RE-ARC, ConceptARC, ARC-Heavy и ARC-GEN100K: 150M-модель натаскана прицельно на этот класс головоломок. На операциях над набором панелей она даёт 10,4%, вложенность глубже четырёх уровней и последовательности длиннее шести не тянет.
Поставить у себя нельзя. Веса и код BDH-CQ не опубликованы, размерности и правила обновления названы проприетарными. Открыт предшественник - архитектура BDH (Dragon Hatchling) под MIT, 3475 звёзд на GitHub: `pip install -r requirements.txt` и `python train.py` обучают baseline на игрушечном датасете, готовых весов в репозитории нет. Из самого релиза запускается только генератор задач arc-task-gen под MIT: `generate_tasks.py` делает синтетические ARC-AGI-1-задачи в формате tasks.json.
Замер шёл на публичных 400 задачах, а не на закрытом наборе ARC Prize. Результат перепроверили Лукаш Кайзер, соавтор оригинальной статьи о трансформере, Ремигиуш Кинас из команды Bielik и Ричард Чжун из NYU - последние двое вслепую.
первоисточник