28 августа 2026 г.
Сингапурская Agnes подошла вплотную к Gemini: 49 баллов в индексе Artificial Analysis
Agnes 2.5 Pro Beta набрала 49 баллов в индексе Artificial Analysis против 40 у прошлой версии, но тратит на задачу вдвое больше токенов.

Artificial Analysis
@artificialanlys
Agnes 2.5 Pro Beta от Agnes AI набирает 49 баллов в Artificial Analysis Intelligence Index, на 9 больше, чем Agnes 2.5 Pro Alpha. Рост дали крупные прибавки в агентных задачах, но модель тратит примерно вдвое больше выходных токенов. Agnes AI (@agnesai_sapiens) — сингапурская ИИ-лаборатория: обучает полномодальные базовые модели и раздаёт их через бесплатный омни-модальный API. С 49 баллами в Intelligence Index Agnes 2.5 Pro Beta переводит Agnes из середины в эшелон рядом с фронтиром: сразу за Gemini 3.5 Flash (high, 52) и GPT-5.6 Luna (max, 52) и впереди MiniMax-M3 (45). Главные результаты: ➤ Agnes 2.5 Pro Beta набирает 49 баллов в Artificial Analysis Intelligence Index, прибавив 9 баллов к Agnes 2.5 Pro Alpha (40). Это ставит её сразу за Gemini 3.5 Flash (high, 52) и GPT-5.6 Luna (max, 52) и впереди MiniMax-M3 (45). ➤ Прыжок сделали агентные способности. Artificial Analysis Agentic Index вырос с 25 до 44: сразу за Gemini 3.7 Flash (high, 45), впереди Gemini 3.5 Flash (high, 40) и MiniMax-M3 (36). τ³-Banking почти утроился, с 12% до 36%, а GDPval-AA v2 поднялся с Elo 1171 до 1456 при человеческой базовой линии в 1000. ➤ На фронтирных тестах на рассуждение прибавка скромнее. Humanity's Last Exam растёт с 34% до 38%, GPQA Diamond с 88% до 91%, CritPt с 11% до 16%. ➤ AA-Omniscience улучшился с −25 до −11 за счёт отказов, а не выросшей точности. Agnes 2.5 Pro Beta берётся всего за 45% вопросов против 94% у Agnes 2.5 Pro Alpha, и доля галлюцинаций падает с 88% до 33%, но точность AA-Omniscience Accuracy падает вдвое, с 33% до 17%. ➤ За прибавку в интеллекте модель платит примерно вдвое большим числом токенов, чем предшественница. Agnes 2.5 Pro Beta тратит 50 тысяч выходных токенов на задачу Intelligence Index, больше чем вдвое против 24 тысяч у Agnes 2.5 Pro Alpha. Ещё о модели: ➤ Окно контекста: 1 млн токенов ➤ Максимум выходных токенов: 65 тысяч ➤ Входные модальности: текст и изображения ➤ Цены: $0,10 / $0,30 / $0,01 за 1 млн входных / выходных / кэшированных токенов ➤ Доступ: собственный API Agnes AI
Агентский замер Agnes прыгнул с 25 до 44 за одну версию.
Сингапурская лаборатория переехала из середины таблицы в соседи лидеров: 49 баллов общего индекса Artificial Analysis против 52 у Gemini 3.5 Flash и GPT-5.6 Luna и 45 у MiniMax-M3.
Раньше и теперь. Альфа-версия набирала 40 баллов и решала банковский тест τ³ на 12%. Бета берёт 36%, а рейтинг Elo в GDPval-AA v2 вырос с 1171 до 1456 при человеческой планке в 1000.
Рассуждающие тесты подросли скромнее: Humanity's Last Exam с 34% до 38%, GPQA Diamond с 88% до 91%, CritPt с 11% до 16%.
Показатель AA-Omniscience поднялся с −25 до −11 не из-за точности. Бета берётся всего за 45% вопросов против 94% у альфы, доля выдумок упала с 88% до 33%, а точность ответов снизилась с 33% до 17%.
Ум оплачен токенами. На одну задачу индекса бета тратит 50 тысяч выходных токенов вместо 24 тысяч у альфы. По прайсу Agnes миллион входных стоит $0,10, миллион выходных $0,30, попадание в кэш $0,01.
Модель раздают через собственный API Agnes: окно контекста 1 млн токенов, на выход до 65 тысяч, на вход текст и картинки.
Следующая веха: в индексе Artificial Analysis пока стоит бета, а не стабильная версия.
Первоисточник
