./новости · 30 июля 2026 г.
новость
GPT-5.6 Sol проваливала ARC-AGI-3 из-за обвязки: две настройки API утроили результат
источник: @openai · X·
машинная выжимка · сверена с источником

OpenAI
@openai
GPT-5.6 Sol решала открытые задачи в математике. Почему же она буксовала на ARC-AGI-3, бенчмарке из 2D-головоломок? Мы разобрались. Обвязка не давала ей помнить то, что она уже поняла. Оказалось, две настройки API утраивают наш результат и при этом расходуют в 6 раз меньше output-токенов.
· 470,7 тыс. просмотров
Две настройки в API утроили счёт GPT-5.6 Sol на ARC-AGI-3 и срезали расход output-токенов в 6 раз. OpenAI разбиралась, почему модель, решающая открытые задачи математики, буксует на бенчмарке 2D-головоломок. Ответ оказался не в модели: обвязка не давала ей помнить выученное между шагами. Какие именно настройки, в твите не названы, есть видео на 109 секунд.
Почему это важно: Раньше слабый результат на бенчмарке читался как потолок модели: не тянет - значит, не тянет. Теперь OpenAI на своём же примере показала другое: тот же вес, та же задача, счёт втрое выше только за счёт того, как построена петля вызовов. Для практика это меняет порядок разбора. Модель мажет на вашей задаче - сначала проверьте, переживает ли контекст переход между шагами агента, и только потом меняйте модель. Заодно это ответ на вопрос о цене: в 6 раз меньше output-токенов при тройном результате - модель перестала переписывать одно и то же по кругу. Про то, во сколько прогонов обошёлся сам поиск этих настроек, в твите ни слова.
Что дальше: Возьмите свой агентный сценарий и прогоните его дважды: как есть и с сохранением состояния между шагами. Сравните две цифры - процент решённых задач и счёт за output-токены.
первоисточник
