./новости · 30 июля 2026 г.
новость
Счёт на ARC-AGI-3 утроился без смены модели: хватило двух настроек harness
источник: @emollick · X·
машинная выжимка · сверена с источником

Ethan Mollick
@emollick
Модель + harness. Мы едва начали понимать, как лучше всего строить harness. Даже без улучшения моделей там огромный неиспользованный запас (а модели улучшаются).
Оказывается, GPT-5.6 Sol и правда SoTA на ARC-AGI-3. Понадобилось всего два изменения в настройках. Достаточно разрешить ей рассуждать и работать через несколько контекстных окон - с нашей канонической реализацией компактации. https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/

· 63,3 тыс. просмотров
29 июля @thsottiaux из OpenAI сообщил: GPT-5.6 Sol вышла на первое место в ARC-AGI-3 после двух изменений в настройках. Веса не трогали: модели разрешили рассуждать и работать через несколько контекстных окон подряд, склеивая их канонической компактацией OpenAI. По заголовку их разбора счёт вырос втрое.
Почему это важно: Раньше цифру на бенче читали как свойство модели: сменился результат - значит, приехали новые веса. Здесь веса те же, а место в таблице другое. Поменяли две вещи: сколько модели дают думать и как ей передают контекст между окнами. Итан Молик выносит из этого общий вывод: harness как инженерная дисциплина почти не освоен, запаса там больше, чем в очередном апдейте модели. Практик получает рычаг: разогнать своего агента можно без смены модели. Во сколько это обошлось по токенам, ни в твите, ни в цитате не сказано.
Что дальше: Проверить просто: взять одну свою задачу, прогнать её на одной модели в двух обвязках - короткое рассуждение в одном окне против длинного через компактацию - и сравнить точность с расходом токенов. Детали настроек OpenAI выложила в разборе по ссылке из цитаты.
первоисточник