4 сентября 2026 г.
GPT-6 Astra доехала до списка моделей: на ARC-AGI 3 она берёт 98,6% против 7,8% у 5.6 Sol
Модель уже показывают в переключателе. Числа релиза: 98,6% на ARC-AGI 3 против 7,8% у 5.6 Sol.

The Rundown AI
@therundownai
6 Astra начинает появляться в переключателе моделей 👀
GPT-6 Astra здесь, и OpenAI называет её «скачком в возможностях на поколение вперёд». Несколько главных результатов на бенчмарках: - ARC-AGI 3 — 98,6% (!) против 7,8% у 5.6 Sol - Exploit-Bench (кибербезопасность) — 100% (!) - FrontierMath Tier 4 (v2) — 97,6% против 87,8% у Fable 5.1 - DeepSWE v1.1 — 74,1% против 67,4% у Fable 5.1 Новые рекорды индустрии в математике, науке, здоровье, работе с компьютером, коде, кибербезопасности и не только. Грег Брокман из OpenAI: «Добро пожаловать в эру AGI».

· 2,6 тыс. просмотров
Почти 91 пункт разницы на одном тесте: 98,6% у GPT-6 Astra против 7,8% у 5.6 Sol.
Модель начали показывать в переключателе моделей, а вместе с релизом объявлены четыре результата выше прежних рекордов.
Что в числах. Тесты, названные при релизе:
- ARC-AGI 3 — 98,6% против 7,8% у 5.6 Sol - Exploit-Bench — 100% - FrontierMath Tier 4 (v2) — 97,6% против 87,8% у Fable 5.1 - DeepSWE v1.1 — 74,1% против 67,4% у Fable 5.1
Шаг не как обычно. На FrontierMath прибавка 9,8 пункта, на DeepSWE 6,7. На ARC-AGI 3 разрыв почти в десять раз больше.
Для практика из четырёх ближе всего DeepSWE, где считают задачи с кодом. Там прибавка 6,7 пункта, и четверть задач модель всё ещё не закрывает.
Следующий сигнал — независимые прогоны на тех же бенчах.
Первоисточник