6 сентября 2026 г.
GPT-6 Astra прибавила в агентах, а не в рассуждении: Terminal-Bench 57,9 против 37,3 у Sol
За это OpenAI просит в 2,5 раза больше: $50 за миллион выходных токенов против $20 у Sol.

На длинном контексте Astra берёт 96,3% там, где Sol проседает до 73,8%.
Замер MRCR на отрезке 512K–1M проверяет одно: достаёт ли модель факт с дальнего конца окна. Окно у обеих моделей одинаковое, 1 050 000 токенов. Astra не получила больше места, она научилась пользоваться тем, что было.
Классика почти не двинулась. GPQA Diamond даёт 96,0% против 94,6%, BrowseComp — 91,5% против 90,4%. За прирост в один пункт платить в 2,5 раза больше не за что.
Агентные замеры разошлись. На Terminal-Bench 4.0 Astra берёт 57,9% против 37,3% у Sol, на SRE-Bench — 88,0% против 55,9%. Модель стала надёжнее доводить длинную работу до конца, а не рассуждать умнее.
Платить приходится и временем. В замере Artificial Analysis по агентам для кода Astra набрала 67 против 65 у Sol при цене $4,72 за задачу против $5,00. Времени на задачу ушло 26,8 минуты против 10,2, то есть в 2,6 раза дольше.
Цена включает второй счётчик. Запрос длиннее 272 тысяч входных токенов OpenAI считает по удвоенному тарифу: $20 за миллион входных и $75 за миллион выходных. Главный выигрыш Astra живёт ровно там, где включается этот множитель.
В Codex модель включается руками. Нужна версия CLI v0.153.1 или новее, в файле ~/.codex/config.toml пишется model = "gpt-6-astra" и reasoning_effort = "high". Разовый запуск делает команда codex exec --model gpt-6-astra.
Классические замеры упёрлись в потолок: у Astra на GPQA Diamond 96,0% из 100 возможных.
Первоисточник
