19 сентября 2026 г.
Китайские ИИ-провайдеры сменили скидки на ступени: у Qwen3.7-flash цена прыгает в 6,7 раза
Цена за токен больше ничего не решает: рынок сравнивает стоимость задачи целиком.

Одни и те же 657 офисных задач обошлись в $14 на DeepSeek-V4 Flash и примерно в $1000 на Anthropic Opus 4.8.
Замер ASPI от 21.07.2026 объясняет разрыв. В агентных задачах расход токенов доходит до 3500 раз выше обычного запроса, поэтому доли цента за токен множатся в сотни долларов на одной задаче.
Винни Ву, глава стратегии Bank of America по азиатским акциям, 18.09.2026 сформулировала сдвиг: ценовая война китайских LLM уходит от сплошных скидок к многоуровневым тарифам. Считать рынок теперь надо по стоимости выполненной задачи, а не по цене за токен.
Ступени вместо скидок. В Alibaba Model Studio уровень цены задаёт общее число входных токенов запроса, и весь запрос оплачивается по цене этого уровня. Запрос на 100K токенов при пороге 32K уходит на вторую ступень целиком: у Qwen3.7-flash миллион входных токенов дорожает с $0.03 до $0.2, в 6,7 раза (доки Alibaba Cloud Model Studio, 18.09.2026).
Счёт режется и без смены модели. DeepSeek держит off-peak ровно вдвое дешевле пикового тарифа: пик идёт с 04:00 до 07:00 и с 09:00 до 13:00 МСК по будням, остальные часы, выходные и китайские праздники считаются по половине (доки DeepSeek API, 19.09.2026). Миллион входных токенов deepseek-flash стоит в такое окно $0.15 вместо $0.30.
Скидки поверх тарифа. Batch-инференс в Model Studio снимает 50% со входа и выхода, попадание в кэш контекста стоит 10% обычной цены входа. Вместе они не складываются, а явная запись в кэш обойдётся в 125% (доки Alibaba Cloud Model Studio, 18.09.2026).
Цена за токен при этом продолжала падать. Индекс Silicon Data показал $2.04 на 31 мая 2026, $1.45 в конце июля и $1.16 на 6–8 августа, минимум года. Подъёмы шли параллельно: с 12 февраля 2026 Zhipu подняла GLM-5 минимум на 30% внутри КНР и на 67–100% по API за рубежом, а Alibaba, ByteDance и ещё два крупных китайских облака перевели прайс на ступени.
Дальше дешеветь будет простой инференс, премию BofA оставляет моделям с рассуждением, длинным контекстом и агентностью.
Первоисточник
