14 августа 2026 г.
Qwen3.8 теперь можно взять без своих серверов: $2 за миллион входных токенов
Модель на 2,4 трлн параметров считает у DeepInfra, от тебя нужен один HTTP-запрос.

Qwen
@alibaba_qwen
Максимальный уровень интеллекта - в одном вызове API. Qwen3.8-2.4T-A95B уже работает на DeepInfra, готова к вашим креативным проектам. 🥳 Погружайтесь в детали на DeepInfra! @DeepInfra
Новое на DeepInfra: Qwen3.8-2.4T-A95B 🚀 Свежая sparse MoE от @Alibaba_Qwen: 2.4T параметров всего, 95B активных, 512 экспертов. Сделана под код, агентные сценарии и сложные рассуждения, нативный контекст 262K. Уже работает: $2.00/M вход · $6.00/M выход · $0.20/M кэш @Alibaba_Qwen @alibaba_cloud

12 августа Qwen3.8-2.4T-A95B требовала две ноды B300. 14 августа она отвечает по обычному API.
От открытия весов до «можно пользоваться» прошло двое суток. Модель считает на чужих серверах, ты платишь только за токены.
Цена. DeepInfra берёт $2 за миллион входных токенов и $6 за миллион выходных. Кэшированный вход стоит $0.20 за миллион, в десять раз дешевле обычного. Агент, который сотни раз шлёт один и тот же системный промпт, платит именно по этой ставке.
Как подключить. Эндпоинт OpenAI-совместимый: https://api.deepinfra.com/v1/openai/chat/completions. В model id идёт «Qwen/Qwen3.8-2.4T-A95B», в заголовок авторизации - Bearer-токен DeepInfra. Стриминг, JSON-схема и function calling работают.
Нативное окно держит 262 144 токена, это примерно средний роман целиком. Qwen заявляет расширение до 1 010 000. Свои цифры компания называет сама: 67,7 на SWE-bench Pro и 92,6 на GPQA Diamond.
Поднять такое у себя выходит дорого. Для BF16 нужны две ноды B300 или MI355X, для FP4-квантов хватает одной. Самая тощая GGUF-сборка Unsloth весит 397 ГБ, полная BF16 - 4,89 ТБ.
В день запуска модель взяли ещё DigitalOcean, Fireworks AI, Modal и OpenRouter - прайс у каждого свой.
первоисточник