10 сентября 2026 г.
DeepSeek-V4.1-Flash удешевляет длинные контексты агентов: кэш 890 байт на токен
10 сентября 2026 DeepSeek объявила V4.1-Flash для длинных задач с 552 млрд параметрами и контекстом до 1 млн токенов. В API модель вызывается как deepseek-flash через api.deepseek.com с ключом DeepSeek. По ценнику на 1 млн токенов вход в пик стоит $0,006 с кэшем и $0,30 без кэша, вне пика $0,003 и $0,15, а выходной тариф $1,20 в пик и $0,60 вне пика.

Раньше рост длины контекста почти линейно раздувал стоимость у агентов: KV-кэш требовал много HBM, а хранение состояний тянуло SSD или RAM. Теперь модель использует Causal Encoder-Decoder и Compressed Sparse Attention 2, а SWA Bounded Replay пересчитывает только нужный участок контекста, поэтому постоянная память стала меньше. По сравнению с V4-Flash кэш теперь около 890 байт на токен, то есть в 4 раза меньше, а постоянный кэш сокращён в 8 раз. По расчёту DeepSeek, при увеличении от 4 тыс. до 1 млн токенов вычисления на один токен выросли только на четверть, но на научных задачах разрыв с экспертным уровнем всё ещё остаётся.
С 14 сентября 2026 V4-Pro останется в работе по прежней тарификации, а deepseek-v4-flash и deepseek-v4-flash-vision-exp будут обслуживаться по цене V4.1-Flash.
Первоисточник
