27 августа 2026 г.
Обвязка вокруг модели решает больше её самой: та же Opus 5 закрыла ARC-AGI-3 на 100%
NVIDIA не трогала модель: Claude Opus 5 в обвязке AVO подняла результат на ARC-AGI-3 с 30% до 100%.

Семь суток подряд агент NVIDIA правил одно ядро CUDA. Перебрал больше 500 направлений оптимизации, закоммитил 40 версий.
Модель при этом не меняли и не дообучали. Результат вытянул харнесс, обвязка вокруг модели. В AVO она собрана из трёх частей.
Три кирпича. Persistent memory переносит между попытками прошлые реализации, замеры, вывод компилятора и профайлера. Supervisor следит за стагнацией и ловит повторяющиеся непродуктивные круги. Сам цикл короткий: осмотреть, спланировать, сделать, замерить.
Раньше и теперь. Claude Opus 5 в одиночку брала на ARC-AGI-3 около 30%, лучший результат среди протестированных моделей. В обвязке AVO та же модель закрыла публичный сет из 25 сред (не соревновательный лидерборд ARC Prize) со счётом 100,00 RHAE: 183 уровня за 6 624 действия против 7 542 у прежнего лидера VISTA на той же Opus 5. NVIDIA пишет, что прямым замером вклада AVO эту пару чисел считать нельзя — настройка рассуждений и вся оснастка прогона были другими.
Главный кейс AVO не про игры, а про ядра. За те самые семь дней ядра multihead attention на NVIDIA DGX B200 обошли cuDNN до 3,5% и FlashAttention-4 до 10,5%. Перенос накопленного на grouped-query attention занял 30 минут и дал плюс 7,0% к cuDNN.
Скачать AVO нельзя. Adel El Hallak, VP of product в ИИ-подразделении NVIDIA, называет AVO не продуктом: в конце поста для разработчиков лежит одна статья на arXiv, кода и waitlist нет. Кирпичи для сборки харнессов компания раздаёт под брендом NeMo, значительная часть открыта.
Обвязка бьёт и по счёту. Модели OpenAI, бравшие на ARC-AGI-3 меньше 10%, утроили результат после правки харнесса. По данным исследования Databricks, неудачный харнесс удваивает стоимость прогона.
Первоисточник