26 сентября 2026 г.
ИИ теперь думает перед ответом: в рейтинге моделей стало 10 сложных тестов
26 сентября Artificial Analysis сравнила свой индекс за два года: вместо 4 коротких экзаменов он включает 10 сложных проверок, в том числе агентные задачи и программирование.

Artificial Analysis
@artificialanlys
Два года назад в этот день Artificial Analysis сообщила, что OpenAI с o1-preview раздвинула границы интеллекта ИИ: это была первая reasoning-модель. Теперь все модели верхнего уровня используют reasoning tokens, чтобы «думать» перед ответом. Два года назад первая версия Artificial Analysis Intelligence Index измеряла четыре одношаговых экзамена: MMLU, GPQA, MATH и HumanEval. Они проверяли общие знания, науку, математику и базовое программирование. Сейчас в Intelligence Index v4.3 входят 10 сложных проверок, включая долгие агентные задачи, трудные задачи по коду и работу со знаниями.
o1-preview от OpenAI стала первой моделью, которая заметно сдвинула границу интеллекта языковых моделей после исходной GPT-4, вышедшей 18 месяцами ранее. После запуска GPT-4 от OpenAI в марте 2023 года десятки компаний бросились догонять OpenAI. Но до o1 следующего скачка интеллекта не было. Наши независимые оценки o1-preview подтверждают: o1 дала самый заметный скачок в Artificial Analysis Intelligence Index после GPT-4. Мы по-прежнему считаем, что сегодня o1 в целом не подходит для большинства продовых сценариев из-за скорости и цены.

· 7,7 тыс. просмотров
26 сентября Artificial Analysis сравнила свой индекс за два года: вместо 4 коротких экзаменов он включает 10 сложных проверок, в том числе агентные задачи и программирование.
Artificial Analysis связывает эту перемену с reasoning tokens, которые используют все модели верхнего уровня.
Первоисточник
