1 сентября 2026 г.
Разбирать длинное видео стало дешевле: Gemini тратит на 88% меньше токенов
Google включила в Gemini агентный разбор видео: на длинных роликах уходит до 88% меньше токенов и до 66% меньше денег.

Google DeepMind
@googledeepmind
Добавляем агентное понимание видео в наши свежие модели Gemini. Теперь они разбирают видео точнее и тратят до 88% меньше токенов. 🧵

· 8,6 тыс. просмотров
Час видео Gemini разбирал за 300–400 тысяч токенов на один вопрос. Теперь укладывается в 50 тысяч.
Google перевела разбор длинного видео из режима «нарежь всё на кадры» в режим «найди нужное место». Модель сама листает ролик и тратит токены только на то, что смотрит.
Как включить. В запросе к Gemini у видео-инпута ставится поле «processing» со значением «agentic». По умолчанию видео идёт по-старому: кадр в секунду и около 100 токенов на каждую секунду ролика при обычном разрешении, 300 при высоком. Режим работает на Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite, лучшее качество Google обещает на 3.7 Flash. Отдельной платы нет, считаются обычные токены API.
Что показали замеры. Цифры сняты на тестах 1H-VideoQA и LVBench, точность на длинных роликах Google называет «высокие 80-е». На Minerva прибавка 7 процентных пунктов точности при экономии 58% токенов.
В API режим доступен сразу, и для загруженных файлов, и для ссылок на YouTube. Потолок на моделях с окном в миллион токенов: три часа видео при обычном разрешении или час при высоком. Ролики короче пяти минут выигрыша не дают, навигация там может замедлить первый ответ.
В приложении Gemini и в «Ask YouTube» агентный разбор обещают в ближайшие месяцы.
Первоисточник