./новости · 6 августа 2026 г.
новость
Баллы моделей выросли без единого релиза: Artificial Analysis сменил судью на GPT-5.6 Luna
источник: @artificialanlys · X·
машинная выжимка · сверена с источником

Artificial Analysis
@artificialanlys
Мы обновили Artificial Analysis Intelligence Index до v4.1.1: этот патч подтягивает наши модели-грейдеры и приносит в Artificial Analysis свежую версию 𝜏³-Banking. Чтобы Artificial Analysis Intelligence Index оставался самой полезной сводной метрикой для разработчиков, мы регулярно обновляем набор включённых тестов и нашу независимую методологию. Сегодняшнее обновление небольшое: держим существующий набор тестов настолько надёжным, насколько это возможно. Порядок моделей в рейтинге почти не изменился, у многих баллы слегка выросли: грейдинг по обновлённым тестам стал устойчивее. Claude Opus 5 остаётся на первом месте с индексом 63. Ключевые изменения: ➤ 𝜏³-Banking теперь работает на v1.0.1 от @SierraPlatform: обновились задачи из апстрима и пайплайн грейдера, из-за чего ушли ошибки в оценке траекторий, где модель выбирается с неудачного пути ➤ HLE, AA-LCR и AA-Omniscience теперь оценивает GPT-5.6 Luna (medium) вместо GPT-4o, Qwen3 235B A22B 2507 и Gemini 3 Flash Preview соответственно. Эти проверки сведены под одну более сильную современную модель, которую мы выбрали за высокое совпадение с оценками людей при валидации грейдеров ➤ На баллах это сказалось слабо: большинство моделей сдвинулось меньше чем на пункт по Intelligence Index. Сильнее всех прибавила Muse Spark 1.2 (xhigh, +2,7 балла), верхушку рейтинга занимают те же модели Опубликованные баллы теперь считаются по v4.1.1, так что все результаты моделей на Artificial Analysis отражают эти изменения и используют нашу последнюю согласованную независимую методологию.

· 6,4 тыс. просмотров
Artificial Analysis 6 августа перевёл свой индекс интеллекта на версию v4.1.1. Баллы у моделей подросли, хотя сами модели никто не трогал: изменилась только проверка ответов. Claude Opus 5 остался первым с индексом 63, сильнее всех прибавила Muse Spark 1.2 в режиме xhigh - плюс 2,7 балла, остальные сдвинулись меньше чем на пункт.
Судью сменили. Раньше три теста индекса проверяли три разные модели-судьи: GPT-4o на HLE, Qwen3 235B A22B 2507 на AA-LCR, Gemini 3 Flash Preview на AA-Omniscience. Теперь все три отдали одной GPT-5.6 Luna в среднем режиме, её выбрали за совпадение с оценками людей.
Банковский тест починили. τ³-Banking переехал на версию v1.0.1 от Sierra: подтянулись задачи из апстрима и сам грейдер. Прежний засчитывал ошибку там, где агент сбивался с пути и всё-таки дотягивал задачу до конца.
Сравнивать старые баллы с новыми напрямую больше нельзя. На сайте Artificial Analysis все результаты уже пересчитаны по v4.1.1, а верхушка рейтинга осталась прежней.
Дальнейшие замеры моделей выходят уже по v4.1.1.
первоисточник