29 июля 2026 г.
Тот же GPT-5.6 берёт ARC-AGI-3 заметно выше без смены модели: две настройки API дали рост втрое
Две настройки в API утроили счёт GPT-5.6 на бенчмарке ARC-AGI-3: OpenAI разобрала это в посте 29 июля 2026. Первая настройка сохраняет цепочку рассуждений между вызовами, вторая включает сжатие контекста. Модель не менялась, вырос и счёт, и эффективность прогона.

Почему это важно: Раньше агент на длинной задаче начинал думать заново на каждом вызове: рассуждения предыдущего шага в API не переносились, а разросшийся контекст приходилось резать вручную. Теперь OpenAI показывает, что оба места закрываются флагами, и разница на ARC-AGI-3 трёхкратная. Для практика это значит, что часть провалов агента - не потолок модели, а конфиг вызова. Абсолютных цифр счёта, стоимости прогонов и границ применимости в посте нет: есть только множитель.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Что дальше: Взять свой агентский цикл, прогнать одну и ту же задачу с сохранением рассуждений и сжатием контекста и без них, сравнить результат и потраченные токены.
Первоисточник