1 сентября 2026 г.
Gemini сам решает, какие куски видео смотреть: разбор дешевеет до 3 раз
Google включила в Gemini агентный режим видео: на бенчмарках это до 88% меньше токенов и до 66% меньше денег.

Раньше Gemini смотрел видео как метроном: фиксированное число кадров в секунду от первой минуты до последней.
1 сентября Google включила агентный режим. Модель сама выбирает, что смотреть, с какой скоростью и через какую модальность (кадры, звук или транскрипт), и подгружает нужные куски по требованию.
Арифметика простая. На стандартных бенчмарках видеоанализа агентный режим даёт до 88% экономии токенов, до 66% по деньгам и до 7% точности. Чем длиннее ролик, тем больше выигрыш: от десятиминутного гайда до 90-минутной лекции и многочасовых записей.
Прежняя цена считалась по секундомеру. Секунда видео стоила около 100 токенов на низком качестве и около 300 на высоком, и час записи съедал под 360 тысяч токенов только на вход.
Google называет сценарии: найти момент с точностью до доли секунды, прошерстить многочасовую запись, поймать аномалию, пересчитать действия и объекты в кадре.
Включается одной строкой. В запросе к Gemini API у части video выставляется processing: "agentic". Режим поддерживают Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite.
Доступ дают Google AI Studio и Gemini Enterprise Agent Platform по обычному токенному прайсу, отдельной платы за фичу нет. Потолок длины прежний: при окне в 1 млн токенов модель тянет до 3 часов видео на низком качестве и до часа на высоком.
На роликах короче 5 минут режим добавляет задержку из-за внутреннего рассуждения и работает только в дефолтной конфигурации: кастомный fps и обрезка по таймкодам с ним не сочетаются.
В приложение Gemini режим обещают скоро, а в «Ask YouTube» для авторов в ближайшие месяцы.
Первоисточник