./новости · 6 августа 2026 г.
новость
Meta вплотную подошла к лидерам агентной работы: Muse Spark 1.2 стала пятой в GDPval
источник: @artificialanlys · X·
машинная выжимка · сверена с источником

Artificial Analysis
@artificialanlys
Meta выпустила Muse Spark 1.2. Это её третий релиз за четыре месяца: модель набирает 54 в Artificial Analysis Intelligence Index, заметно прибавляет в агентной работе со знаниями по сравнению с прошлыми версиями и ставит Meta рядом со SpaceXAI - они делят третье место среди американских лабораторий. Muse Spark 1.2 (xhigh) выходит на 54: это +3 к Muse Spark 1.1 (51) и +11 к Muse Spark 1.0 (43, апрель). Она фактически сравнялась с GPT-5.5 (xhigh, 55) и Grok 4.5 (high, 54) и немного отстаёт от нынешних лидеров: Claude Opus 5 (max, 61), Claude Fable 5 (max с фолбэком, 60), GPT-5.6 Sol (max, 59) и Kimi K3 (max, 57). Поздравляем @AIatMeta, @finkd и @alexandr_wang с релизом! Главное: ➤ Muse Spark 1.2 подбирается к лидерам в агентной работе со знаниями. На запуске Muse Spark 1.1 мы называли агентную работу самым явным её пробелом, теперь Muse Spark 1.2 его закрывает. Её Elo на GDPval-AA v2 вырос на 260 пунктов, до 1631: это 5-е место среди всех моделей, что мы измеряли, и выше Claude Opus 4.8 (max, 1588). Terminal-Bench 2.1 прибавил 2 пункта (78% → 80%), Tau3-Bench Banking тоже вырос на 2 пункта (25% → 27%). ➤ Одна из самых экономных моделей на своём уровне интеллекта. Задача Intelligence Index на Muse Spark 1.2 обходится в $0.40 при неизменной цене Meta $1.25/$4.25 за 1M токенов. В её кластере интеллекта дешевле только Grok 4.5 (high, $0.37) и GPT-5.6 Sol (medium, $0.39), а GPT-5.6 Terra (max, $0.51), Kimi K3 (max, $0.86) и GPT-5.5 (xhigh, $1.18) стоят дороже. Цена выросла относительно Muse Spark 1.1 ($0.29 за задачу) потому, что модель тратит больше токенов на задачу Intelligence Index. ➤ Модель чаще воздерживается от ответа. Показатель AA-Omniscience вырос с 18 до 22: доля галлюцинаций упала на 10 пунктов (38% → 28%), а доля попыток ответить снизилась с 82% до 67%. Такое частое воздержание (модель не отвечает, когда не уверена) даёт и низкую долю галлюцинаций, и более низкую точность (41% → 38%). ➤ В научных рассуждениях почти без изменений. CritPt заметно прибавил 3 пункта (15% → 18%), SciCode потерял 2 пункта (58% → 56%), Humanity's Last Exam - 1 пункт (45% → 44%). Прочее о модели: ➤ Контекстное окно: 1M токенов, как у Muse Spark 1.1 ➤ Цены: без изменений от Muse Spark 1.1, $1.25/$4.25 за 1M входных/выходных токенов, кэш-хиты со скидкой до $0.15 за 1M ➤ Доступность: на старте собственный API Meta

· 135,7 тыс. просмотров
Muse Spark 1.2 прибавила 260 Elo на замере реальных рабочих задач GDPval-AA v2 и встала пятой среди всех моделей, что прогнала Artificial Analysis. Рост с 1371 до 1631 вывел её выше Claude Opus 4.8 (1588). Meta открыла модель 5 августа 2026, третью за четыре месяца, и цену токенов не тронула: $1.25 за 1M входных, $4.25 за выходные.
Индекс сдвинулся. В общем зачёте Artificial Analysis модель набрала 54 против 51 у версии 1.1 и 43 у версии 1.0 в апреле. Впереди Claude Opus 5 с 61, Claude Fable 5 с 60 и ещё две модели уровня 57-59.
Прирост в агентах. Terminal-Bench 2.1 подрос с 78% до 80%, Tau3-Bench Banking - с 25% до 27%, научные замеры почти не сдвинулись. На запуске версии 1.1 агентная работа была главным провалом линейки, теперь по ней модель пятая.
Прогон одной задачи индекса стоит $0.40 против $0.29 у версии 1.1: прайс Meta не меняла, модель просто тратит больше токенов. У GPT-5.6 Terra та же задача обходится в $0.51, у Kimi K3 - в $0.86.
Взять модель можно только в собственном API Meta. Стандартный тариф - $1.25 за 1M входных токенов, $0.15 за кэшированные и $4.25 за выходные, промпты на обучение Meta не берёт. Тариф contributor дешевле в 12 раз по входу и в 21 раз по выходу ($0.10 и $0.20), но в обмен Meta получает право учиться на промптах и ответах.
Отвечать модель стала осторожнее: галлюцинации упали с 38% до 28%, но попыток ответить теперь 67% против 82%, а точность просела с 41% до 38%.
Пока Muse Spark 1.2 раздаётся только через собственный API Meta.
первоисточник