9 сентября 2026 г.
DeepSeek V4.1 Flash можно запускать локально: Hugging Face дал команду для vLLM
DeepSeek V4.1 Flash можно запускать локально через vLLM и подключать по OpenAI API. Карточка Hugging Face от 10 сентября указывает 763 млрд параметров, поддержку текста и изображений и контекст до 1 млн токенов. Baseten на 10 сентября выставил цену $0,30 за 1 млн входных токенов и $1,20 за 1 млн выходных.

Раньше DeepSeek V4 Flash набирал 35 баллов Artificial Analysis. Теперь V4.1 Flash получил 40 баллов, но GLM-5.3-Flash остаётся выше с 42 баллами в сравнении от 10 сентября.
Локальный порог. Hugging Face рекомендует команды `pip install vllm` и `vllm serve deepseek-ai/DeepSeek-V4.1-Flash`. Модель активирует 8 млрд параметров на prefill и 16 млрд на decode. DeepSeek заявляет, что KV cache требует в 4 раза меньше HBM и в 8 раз меньше SSD, чем у прошлого поколения.
На двух Sparks конфигурация ещё требует тестов. NVIDIA 9 сентября назвала неизвестными сочетание квантования, большего числа активных параметров во время decode, n-gram offloading и DSpark.
Первые совместные тесты на двух Sparks покажут, насколько локальный запуск V4.1 Flash зависит от квантования и offloading.
