7 сентября 2026 г.
Подогнать модель под рейтинг стало труднее: 45% веса теперь на закрытых задачах
Artificial Analysis обновила Intelligence Index до v4.3 07.09.2026: доля закрытых задач в весе индекса выросла с 40% до 45%.

Artificial Analysis
@artificialanlys
Представляем Artificial Analysis Intelligence Index v4.3: Terminal-Bench обновлён до 4.0, добавлен AutomationBench-AA, бенчмарк на агентную автоматизацию рабочих процессов с закрытым тестовым набором. Это продолжение выкатки Intelligence Index v5. Чейнджлог (Index v4.2 → Index v4.3): ➤ Terminal-Bench: 2.1 → 4.0, переход на последнюю версию Terminal-Bench завершён ➤ 𝜏³-Banking заменён на AutomationBench-AA, нашу реализацию бенчмарка Zapier на автоматизацию бизнес-процессов Мы держим в приоритете полезность Intelligence Index, поэтому часть изменений, запланированных для Index v5, выносим раньше срока. Каждое изменение в v4.2 и v4.3 самоценно: индекс становится ближе к решению реальных задач, в нём больше закрытых тестовых наборов против подгонки, и меньше насыщения. Intelligence Index v4.3 поднимает сложность агентных задач по коду и расширяет типы проверяемых агентных сценариев. Для AutomationBench-AA мы используем held-out набор, сделанный вместе с @zapier, поэтому вес оценок с закрытыми задачами или ответами вырос с 40% до 45%. Веса категорий не изменились с v4.2: Agents 30%, Coding 20%, General 30%, Scientific Reasoning 20%. Подробности изменений: ➤ Terminal-Bench обновлён с 2.1 до 4.0: 66 многошаговых задач, в которых агент работает в песочнице через терминал, среди них разработка софта, машинное обучение, наука и операционные задачи. Версия 4.0 пересчитывает лимиты по вычислениям и времени, а также улучшает формулировки задач и верификацию. Мы перешли с харнесса Terminus 2 на mini-SWE-agent, минимальный и не привязанный к модели. Скоро добавим Terminal-Bench 4.0 и в наш Coding Agent Index, где мы тестируем пары «модель плюс харнесс». ➤ 𝜏³-Banking заменён на AutomationBench-AA: наша реализация AutomationBench от Zapier проверяет агентов на 657 бизнес-процессах в симулированных приложениях вроде Gmail, Slack, Salesforce и Jira. Агент должен выполнить задачу и при этом соблюсти бизнес-правила. AutomationBench-AA использует закрытый набор Zapier из 657 задач и построен на версии v1.0.6. Ключевые результаты: ➤ Claude Fable 5.1 и GPT-6 Astra возглавляют Intelligence Index: обе модели, Claude Fable 5.1 (max с fallback) и GPT-6 Astra (max), набирают 53 балла в Intelligence Index v4.3, дальше идут Claude Opus 5 (max, 51), Claude Fable 5 (с fallback, 50), Muse Spark 1.3 (max, 48) и GPT-5.6 Sol (max, 47) ➤ GLM-5.3 и Kimi K3 остаются лидерами среди моделей с открытыми весами (обе по 44): третья по силе открытая модель — GLM-5.3-Flash (42), за ней Qwen3.8 2.4T A95B (40) и DeepSeek V4 Pro 0813 (max, 36) ➤ На границе Парето «интеллект против стоимости задачи» стоят 4 лаборатории: большую часть фронтира по цене занимает OpenAI, все пять уровней reasoning effort недавно вышедшей GPT-6 Astra дают самую низкую стоимость задачи на своём уровне интеллекта. Остальную часть фронтира закрывают Claude Fable 5.1 (xhigh, max, 53), GLM-5.3-Flash (42) и MiMo-V2.5-Pro (26)

· 9,1 тыс. просмотров
Индекс, по которому сверяют модели, переписали дважды за неделю: v4.2 вышел 4 сентября, v4.3 появился 7-го.
Сравнивать баллы v4.2 и v4.3 в лоб больше нельзя. Половина агентной части индекса теперь другая.
Что поменялось. Terminal-Bench проехал с версии 2.1 сразу на 4.0: в нём осталось 66 задач, восемь выкинули как насыщенные или с публичными решениями, 19 переписали, лимиты CPU и памяти пересчитали. Таймаут агента подняли до восьми часов, каждую задачу гоняют по пять раз.
Харнесс тоже сменили. Вместо Terminus 2 замеры идут через mini-SWE-agent с потолком в 500 шагов и таймаутом команды 30 секунд.
Вместо 𝜏³-Banking в индекс встал AutomationBench-AA: 657 бизнес-воркфлоу в сорока симулированных приложениях, среди них Gmail, Slack и Salesforce. Задача засчитывается только тогда, когда агент выполнил цель и не нарушил ни одного правила. Одно нарушение обнуляет задачу.
Наверху теперь двое: Claude Fable 5.1 и GPT-6 Astra набрали по 53 балла. Следом идёт Opus 5 с 51. У открытых моделей потолок держат GLM-5.3 и Kimi K3 с 44 баллами.
Прогнать у себя. Terminal-Bench 4.0 запускается одной командой фреймворка Harbor: `harbor run -d terminal-bench/terminal-bench@4.0.0`. Версии перешли на semver, после смены окружения нужен перепрогон.
AutomationBench Zapier выложил на GitHub. Клонируете репозиторий, ставите зависимости через `uv sync`, кладёте ключ в OPENAI_API_KEY или ANTHROPIC_API_KEY и запускаете `uv run auto-bench --model gpt-5-mini`.
Публичный набор тут 600 задач по 100 на домен плюс 200 базовых, а лидерборд считают по закрытому набору, который сложнее и периодически обновляется. От своего прогона ждите совпадения по направлению, а не по цифрам.
Coding Agent Index, где меряют пары «модель плюс харнесс», компания обещает перевести на Terminal-Bench 4.0 следом.
* Meta Platforms Inc. признана в РФ экстремистской организацией, её деятельность запрещена; Facebook и Instagram заблокированы. Meta AI и другие продукты компании — продукты этой организации.
Первоисточник
