
«DeepSeek V4 Flash 0731 набирает 50 в Artificial Analysis Intelligence Index. Это на 10 пунктов больше, чем у DeepSeek V4 Flash (вышел в апреле 2026), и на 6 пунктов выше DeepSeek V4 Pro. Архитектура и цены у него те же, что у прошлого DeepSeek V4 Flash, и он попадает на нашу границу Парето по связке «интеллект против стоимости задачи». DeepSeek V4 Flash 0731 от @deepseek_ai отстаёт от GPT-5.6 Luna (max, 51) на один пункт индекса. Сегодня OpenAI срезала цену GPT-5.6 Luna на 80%, но даже после этого стоимость задачи у DeepSeek V4 Flash 0731 на первопартийном API DeepSeek выходит примерно на 60% ниже, чем у GPT-5.6 Luna (max), модели сопоставимого интеллекта. Главная причина: скидка около 98% за попадание в кэш на первопартийном API DeepSeek, куда агрессивнее, чем принятые по индустрии 90%. Новая модель заметно шагнула вперёд относительно прошлого поколения, DeepSeek V4 Flash (40), и подошла к GLM-5.2 (max, 51) на один пункт. До границы открытых весов, которую держит Kimi K3 (max, 57), остаётся 7 пунктов. Для сравнения: это вровень с недавно вышедшей Gemini 3.6 Flash (50) и на пункт ниже Muse Spark 1.1 (xhigh, 51). Полные веса модели DeepSeek, как ожидается, выложит в ближайшие недели. У DeepSeek V4 Flash 0731 сохраняется контекстное окно на 1M токенов, а размер не изменился с прошлого DeepSeek V4 Flash: 284B параметров всего и 13B активных на инференсе. Ключевые результаты: ➤ Агентские способности выросли: DeepSeek V4 Flash 0731 получает рейтинг Elo 1559 на GDPval-AA v2, нашей оценке реальных рабочих задач для агентов, против 1189 у прошлого DeepSeek V4 Flash. Когда веса выложат, это будет второй результат среди открытых весов: позади Kimi K3 (max, 1687) и впереди GLM-5.2 (max, 1510). Terminal-Bench 2.1 прибавляет 17 пунктов до 79%, τ³-Bench Banking - 8 пунктов до 31%. ➤ Расход токенов упал на 12% против предшественника: на прогон Intelligence Index DeepSeek V4 Flash 0731 потратил ~206M выходных токенов против ~234M у прошлого DeepSeek V4 Flash. Новый вариант экономнее по токенам: индекс выше, а суммарных выходных токенов меньше. ➤ DeepSeek V4 Flash 0731 обходит предшественника на каждом тесте Intelligence Index: помимо агентских замеров, CritPt прибавляет 9 пунктов до 17%, SciCode - 5 пунктов до 50%, Humanity's Last Exam - 5 пунктов до 37%, AA-LCR - 3 пункта до 66%, GPQA Diamond - 1 пункт до 91%. ➤ AA-Omniscience подрос за счёт меньшего числа галлюцинаций, а не за счёт точности: индекс AA-Omniscience у DeepSeek V4 Flash 0731 равен -16, это +7 к предшественнику. Прирост целиком даёт снижение доли галлюцинаций, доля правильных ответов не изменилась. Hallucination Rate по AA-Omniscience - 84%, на 12 пунктов ниже, чем у предшественника, и сопоставимо с такими моделями, как GPT-5.6 Terra (max, 85%) и Mistral Medium 3.5 (82%). Дополнительные детали модели: ➤ Контекстное окно: 1M токенов (как у DeepSeek V4 Flash) ➤ Размер: 284B параметров всего (13B активных) ➤ Модальности: только текст на входе и выходе ➤ Доступ: через первопартийный API DeepSeek ➤ Цены: $0.14/$0.28 за 1M входных/выходных токенов, как у DeepSeek V4 Flash. Попадание в кэш - $0.0028 за 1M токенов, скидка 98%.»
Artificial Analysis@artificialanlys
по твиту@artificialanlys31.07
Задача на DeepSeek обходится на 60% дешевле GPT-5.6 Luna: разница в индексе - 1 пункт
по твиту@artificialanlys31.07Задача на DeepSeek обходится на 60% дешевле GPT-5.6 Luna: разница в индексе - 1 пункт

«DeepSeek V4 Flash 0731 набирает 50 в Artificial Analysis Intelligence Index. Это на 10 пунктов больше, чем у DeepSeek V4 Flash (вышел в апреле 2026), и на 6 пунктов выше DeepSeek V4 Pro. Архитектура и цены у него те же, что у прошлого DeepSeek V4 Flash, и он попадает на нашу границу Парето по связке «интеллект против стоимости задачи». DeepSeek V4 Flash 0731 от @deepseek_ai отстаёт от GPT-5.6 Luna (max, 51) на один пункт индекса. Сегодня OpenAI срезала цену GPT-5.6 Luna на 80%, но даже после этого стоимость задачи у DeepSeek V4 Flash 0731 на первопартийном API DeepSeek выходит примерно на 60% ниже, чем у GPT-5.6 Luna (max), модели сопоставимого интеллекта. Главная причина: скидка около 98% за попадание в кэш на первопартийном API DeepSeek, куда агрессивнее, чем принятые по индустрии 90%. Новая модель заметно шагнула вперёд относительно прошлого поколения, DeepSeek V4 Flash (40), и подошла к GLM-5.2 (max, 51) на один пункт. До границы открытых весов, которую держит Kimi K3 (max, 57), остаётся 7 пунктов. Для сравнения: это вровень с недавно вышедшей Gemini 3.6 Flash (50) и на пункт ниже Muse Spark 1.1 (xhigh, 51). Полные веса модели DeepSeek, как ожидается, выложит в ближайшие недели. У DeepSeek V4 Flash 0731 сохраняется контекстное окно на 1M токенов, а размер не изменился с прошлого DeepSeek V4 Flash: 284B параметров всего и 13B активных на инференсе. Ключевые результаты: ➤ Агентские способности выросли: DeepSeek V4 Flash 0731 получает рейтинг Elo 1559 на GDPval-AA v2, нашей оценке реальных рабочих задач для агентов, против 1189 у прошлого DeepSeek V4 Flash. Когда веса выложат, это будет второй результат среди открытых весов: позади Kimi K3 (max, 1687) и впереди GLM-5.2 (max, 1510). Terminal-Bench 2.1 прибавляет 17 пунктов до 79%, τ³-Bench Banking - 8 пунктов до 31%. ➤ Расход токенов упал на 12% против предшественника: на прогон Intelligence Index DeepSeek V4 Flash 0731 потратил ~206M выходных токенов против ~234M у прошлого DeepSeek V4 Flash. Новый вариант экономнее по токенам: индекс выше, а суммарных выходных токенов меньше. ➤ DeepSeek V4 Flash 0731 обходит предшественника на каждом тесте Intelligence Index: помимо агентских замеров, CritPt прибавляет 9 пунктов до 17%, SciCode - 5 пунктов до 50%, Humanity's Last Exam - 5 пунктов до 37%, AA-LCR - 3 пункта до 66%, GPQA Diamond - 1 пункт до 91%. ➤ AA-Omniscience подрос за счёт меньшего числа галлюцинаций, а не за счёт точности: индекс AA-Omniscience у DeepSeek V4 Flash 0731 равен -16, это +7 к предшественнику. Прирост целиком даёт снижение доли галлюцинаций, доля правильных ответов не изменилась. Hallucination Rate по AA-Omniscience - 84%, на 12 пунктов ниже, чем у предшественника, и сопоставимо с такими моделями, как GPT-5.6 Terra (max, 85%) и Mistral Medium 3.5 (82%). Дополнительные детали модели: ➤ Контекстное окно: 1M токенов (как у DeepSeek V4 Flash) ➤ Размер: 284B параметров всего (13B активных) ➤ Модальности: только текст на входе и выходе ➤ Доступ: через первопартийный API DeepSeek ➤ Цены: $0.14/$0.28 за 1M входных/выходных токенов, как у DeepSeek V4 Flash. Попадание в кэш - $0.0028 за 1M токенов, скидка 98%.»
Artificial Analysis@artificialanlys















