./новости · 30 июля 2026 г.
новость
Балл на бенчмарке зависит от настроек прогона: GPT-5.6 Sol набрал на ARC-AGI-3 втрое больше
источник: @charliermarsh · X·
машинная выжимка · сверена с источником

Charlie Marsh
@charliermarsh
Я следил за этой работой изнутри, и она меня здорово увлекла. Если коротко: разрешите GPT-5.6 Sol сохранять рассуждения между ходами и сжимать контекст компакцией - и она набирает примерно втрое больше на публичном наборе ARC-AGI-3. https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/

· 11,8 тыс. просмотров
GPT-5.6 Sol набрала на публичном наборе ARC-AGI-3 примерно втрое больше, когда ей разрешили две вещи: сохранять рассуждения между ходами и сжимать контекст компакцией. Сама модель не менялась. Чарли Марш из OpenAI 30 июля 2026 пересказал внутренний разбор и дал ссылку на пост компании.
Почему это важно: Раньше на ARC-AGI-3 модель шла ход за ходом с чистого листа: она выбрасывала рассуждения прошлого хода, а длинный контекст упирался в окно. Теперь OpenAI включила две настройки: рассуждения переезжают в следующий ход, контекст сжимается. Модель та же, задачи те же, счёт втрое выше. Для практика вывод прямой: число в таблице лидеров меряет не только модель, но и обвязку вокруг неё, поэтому чужой балл без описания прогона мало что говорит про ваш агент. Во сколько токенов обошёлся тройной результат, в TL;DR не сказано.
Что дальше: Прогоните свой многоходовый сценарий дважды: с переносом рассуждений между ходами и без. Сравните и результат, и расход токенов на своей задаче, а не на публичном наборе.
первоисточник