1 сентября 2026 г.
Часовая лекция в Gemini API теперь стоит вдвое меньше: −88% токенов на длинном видео
Google включила в Gemini API агентную обработку видео: до −88% токенов и до −66% стоимости анализа против прежнего режима, плюс до +7% точности. Доплаты за фичу нет, цены остались обычные токенные.

Logan Kilpatrick
@officiallogank
Представляем Agentic Video в Gemini API — новый способ обрабатывать длинные видео: расход токенов падает до 88%, а качество при этом растёт. Включается в API одним параметром для каждого видео, работает на свежих моделях вроде 3.7 Flash!

· 87,8 тыс. просмотров
Гугловские доки считают так: примерно 300 токенов на секунду ролика при обычном разрешении, около 100 на низком. Час видео упирался в потолок миллионного контекста, а на бенчмарках 1H-VideoQA и LVBench один запрос съедал 300–400 тысяч токенов. Теперь на тех же бенчмарках расход падает ниже 50 тысяч.
Включается одним полем. В объекте видео у Gemini ставится "processing": "agentic" — и в Interactions, и в GenerateContent, и в REST-вызове. Чейнджлог от 1 сентября 2026 называет три модели: 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Работает и с загруженным файлом, и со ссылкой на YouTube.
Выигрыш растёт с длиной: десятиминутный гайд, 90-минутная лекция, многочасовая запись созвона. На роликах короче пяти минут доки сами советуют режим не включать — модель начинает рассуждать и отвечает медленнее.
На бенчмарке Minerva Google показывает 58% экономии токенов при росте точности примерно на 7 пунктов. В сравнительном графике 3.7 Flash стоит выше GPT-5.6 Sol, Claude Opus 5 и Grok 4.6 по точности при меньшей цене — график вендорский, сторонних замеров пока нет.
Сторонние прогоны на длинных видео покажут, держится ли −88% вне бенчмарков Google.
Первоисточник