./новости · 31 июля 2026 г.
новость
Задача на DeepSeek обходится на 60% дешевле GPT-5.6 Luna: разница в индексе - 1 пункт
источник: @artificialanlys · X·
машинная выжимка · сверена с источником

Artificial Analysis
@artificialanlys
DeepSeek V4 Flash 0731 набирает 50 в Artificial Analysis Intelligence Index. Это на 10 пунктов больше, чем у DeepSeek V4 Flash (вышел в апреле 2026), и на 6 пунктов выше DeepSeek V4 Pro. Архитектура и цены у него те же, что у прошлого DeepSeek V4 Flash, и он попадает на нашу границу Парето по связке «интеллект против стоимости задачи». DeepSeek V4 Flash 0731 от @deepseek_ai отстаёт от GPT-5.6 Luna (max, 51) на один пункт индекса. Сегодня OpenAI срезала цену GPT-5.6 Luna на 80%, но даже после этого стоимость задачи у DeepSeek V4 Flash 0731 на первопартийном API DeepSeek выходит примерно на 60% ниже, чем у GPT-5.6 Luna (max), модели сопоставимого интеллекта. Главная причина: скидка около 98% за попадание в кэш на первопартийном API DeepSeek, куда агрессивнее, чем принятые по индустрии 90%. Новая модель заметно шагнула вперёд относительно прошлого поколения, DeepSeek V4 Flash (40), и подошла к GLM-5.2 (max, 51) на один пункт. До границы открытых весов, которую держит Kimi K3 (max, 57), остаётся 7 пунктов. Для сравнения: это вровень с недавно вышедшей Gemini 3.6 Flash (50) и на пункт ниже Muse Spark 1.1 (xhigh, 51). Полные веса модели DeepSeek, как ожидается, выложит в ближайшие недели. У DeepSeek V4 Flash 0731 сохраняется контекстное окно на 1M токенов, а размер не изменился с прошлого DeepSeek V4 Flash: 284B параметров всего и 13B активных на инференсе. Ключевые результаты: ➤ Агентские способности выросли: DeepSeek V4 Flash 0731 получает рейтинг Elo 1559 на GDPval-AA v2, нашей оценке реальных рабочих задач для агентов, против 1189 у прошлого DeepSeek V4 Flash. Когда веса выложат, это будет второй результат среди открытых весов: позади Kimi K3 (max, 1687) и впереди GLM-5.2 (max, 1510). Terminal-Bench 2.1 прибавляет 17 пунктов до 79%, τ³-Bench Banking - 8 пунктов до 31%. ➤ Расход токенов упал на 12% против предшественника: на прогон Intelligence Index DeepSeek V4 Flash 0731 потратил ~206M выходных токенов против ~234M у прошлого DeepSeek V4 Flash. Новый вариант экономнее по токенам: индекс выше, а суммарных выходных токенов меньше. ➤ DeepSeek V4 Flash 0731 обходит предшественника на каждом тесте Intelligence Index: помимо агентских замеров, CritPt прибавляет 9 пунктов до 17%, SciCode - 5 пунктов до 50%, Humanity's Last Exam - 5 пунктов до 37%, AA-LCR - 3 пункта до 66%, GPQA Diamond - 1 пункт до 91%. ➤ AA-Omniscience подрос за счёт меньшего числа галлюцинаций, а не за счёт точности: индекс AA-Omniscience у DeepSeek V4 Flash 0731 равен -16, это +7 к предшественнику. Прирост целиком даёт снижение доли галлюцинаций, доля правильных ответов не изменилась. Hallucination Rate по AA-Omniscience - 84%, на 12 пунктов ниже, чем у предшественника, и сопоставимо с такими моделями, как GPT-5.6 Terra (max, 85%) и Mistral Medium 3.5 (82%). Дополнительные детали модели: ➤ Контекстное окно: 1M токенов (как у DeepSeek V4 Flash) ➤ Размер: 284B параметров всего (13B активных) ➤ Модальности: только текст на входе и выходе ➤ Доступ: через первопартийный API DeepSeek ➤ Цены: $0.14/$0.28 за 1M входных/выходных токенов, как у DeepSeek V4 Flash. Попадание в кэш - $0.0028 за 1M токенов, скидка 98%.

· 2,6 тыс. просмотров
DeepSeek V4 Flash 0731 набрал 50 в индексе интеллекта Artificial Analysis 31 июля 2026: апрельская версия брала 40. Цена не изменилась: $0.14 и $0.28 за 1M входных и выходных токенов, попадание в кэш стоит $0.0028 за 1M (скидка 98% против 90% у большинства индустрии). Архитектура тоже прежняя: 284B параметров, 13B активных, контекст 1M токенов.
Почему это важно: Раньше расклад был такой: нужен агент, который вытягивает реальные рабочие задачи, плати за верхний тариф западной лаборатории. Апрельский DeepSeek V4 Flash на эту роль не годился: 40 в индексе и Elo 1189 на GDPval-AA v2. Теперь та же модель по той же цене берёт 50 в индексе и Elo 1559, а Terminal-Bench 2.1 поднялся с 62% до 79%. Токенов модель тратит на 12% меньше: 206M против 234M на прогон индекса, так что счёт падает дважды. OpenAI, подавшая конфиденциальный S-1 8 июня 2026, в тот же день срезала цену GPT-5.6 Luna на 80% - и задача на DeepSeek всё равно выходит примерно на 60% дешевле при разнице в один пункт индекса. Точность ответов при этом не выросла ни на пункт: индекс AA-Omniscience подняли только тем, что модель реже выдумывает, доля галлюцинаций упала с 96% до 84%.
Что дальше: Полные веса DeepSeek обещает выложить в ближайшие недели: тогда 1559 на GDPval-AA v2 станет вторым результатом среди открытых моделей после Kimi K3 (1687). До этого прогони свой агентский сценарий на первопартийном API DeepSeek с включённым кэшем и сравни счёт с тем, что набегает на GPT-5.6 Luna.
первоисточник