23 сентября 2026 г.
Повторные запросы к GPT-6 станут дешевле: кэш держится 30 минут
22 сентября OpenAI подняла долю попаданий кэша GPT-6 и оставила 30 минут на повторное использование общих префиксов. Кэш-чтение стоит 0,1 цены входного токена.

Раньше OpenAI включала prompt caching сама, если начало запроса содержало от 1 024 видимых входных токенов. Теперь GPT-6 чаще узнаёт общий префикс, поэтому повторяющаяся часть длинного запроса не считается заново.
Точки под контролем. Для явного кэша нужно включить `prompt_cache_options.mode: "explicit"` и поставить `prompt_cache_breakpoint` в content block. Одна кэш-запись и одно полное чтение стоят 1,35 обычной цены входа против 2 без кэша. После последней точки меняющийся хвост запроса идёт по обычной цене.
В Responses API базовый ответ передают через `comparison_response_id`, а затем смотрят `prompt_cache_diagnostics` и число кэшированных токенов. Запрос с `prewarm: true` прогревает общий контекст до основного обращения без генерации ответа.
Первые цифры. Команда Manus подняла долю попаданий примерно с 85% до стабильных 90% за срок меньше недели. В Wordsmith переход на явные точки поднял её с 83% до 91%, сократил кэш-записи примерно на две трети и расходы на инференс на 36%.
Новый Prompt Caching Dashboard уже показывает долю входных токенов из кэша, hit rate во времени и соотношение кэшированных и обычных токенов.
Первоисточник
