14 августа 2026 г.
Разницу на ARC-AGI-3 делает не модель, а харнесс: 96,2% у того же Opus 5
Джереми Берман поднял Opus 5 на ARC-AGI-3 с 30,2% до 96,2%: модель та же, поменялся только харнесс.

Amjad Masad
@amasad
ARC-AGI-3 почти решён простым добавлением coding harness. Как и предсказывалось, кодинг генерализует LLM.
Я получил 96,2% на ARC-AGI-3 с Opus 5 и 99,3% pass@2. Программа - это по сути Claude Code + Opus 5 (high), одна команда действия и логи в файловой системе. Почти ничего специфичного для ARC. https://github.com/jerber/arc-code


Программа, которая почти ничего не знает про ARC, взяла 96,2% на ARC-AGI-3.
Внутри стоит Claude Code с Opus 5, одна команда действия и логи в файлах. Берман выложил код репозиторием arc-code и померил pass@2 в 99,3%.
На официальном лидерборде ARC-AGI-3 тот же Opus 5 держит 30,2% на 14.08.2026. Разницу делает харнесс: обвязка вокруг модели, которая решает, чем та ходит в игру, что помнит между ходами и куда пишет наблюдения.
Почему одна модель даёт и 30%, и 96%
Не единичный случай. Харнесс schema от Impossible Research поднял Claude Code с 42,83% до 98,98% на 25 публичных играх. Prime Agent с тем же Opus 5 показал 95,5% там, где официальный прогон давал 30,2%. Человеческий экспертный уровень в том замере равен 95,4%, а числа самозаявленные, ARC Prize их не проверял.
Дело и не в размере модели. Duck Harness выиграл Milestone 1 на Kaggle с открытой Qwen 3.6 27B и обошёлся примерно вдесятеро дешевле сопоставимых сборок на GPT-5.4.
OpenAI померила тот же эффект на своих настройках. GPT-5.6 Sol даёт 13,3% на официальном харнессе и 38,3% через Responses API, если сохранять reasoning между действиями и сжимать контекст вместо обрезки. Расход output-токенов на игру при этом падает примерно в 6 раз.
Официальный харнесс выбрасывал приватный reasoning после каждого действия и резал историю по 175 000 символов. Франсуа Шолле признал общедоступные настройки API допустимыми, если названы сами настройки и стоимость.
первоисточник