26 августа 2026 г.
Минута расшифровки речи теперь стоит $0,003: Google открыла превью Gemini 3.5 Transcribe
Google отдала транскрипцию Gemini: минута аудио стоит $0,003, а ошибка на слове держится на 2,6% в замере Artificial Analysis.

Час созвона уезжает на расшифровку одним запросом и стоит 18 центов.
Google собрала распознавание речи внутри Gemini: отдельного сервиса за этим нет, работают тот же ключ API и тот же вызов, что для текста. 26.08.2026 модель открыли в публичном превью в Google AI Studio и на Gemini Enterprise Agent Platform.
Раньше и теперь. Речь у Google расшифровывал Chirp 3. Gemini 3.5 Transcribe отдаёт финальный текст на 70% быстрее и ошибается в среднем на 2,6% слов, в стриминге на 4,0% (замер Artificial Analysis). На мультиязычном бенчмарке FLEURS получилось 5,04% и 5,50%.
Как запустить. Файл загружается через `client.files.upload()`, дальше идёт вызов `client.interactions.create` с моделью `gemini-3.5-transcribe`. Готовый код лежит в доках Gemini API. Для живого потока есть `gemini-3.5-transcribe-live` через Live API, задержка там меньше секунды.
Счёт за минуту (цены Gemini API, 26.08.2026):
- `gemini-3.5-transcribe`: $2 за миллион аудио-токенов входа (~$0,003 за минуту) и $12 за миллион текстовых токенов выхода (~$0,002 за минуту). - `gemini-3.5-transcribe-live`: $3,50 и $21 (~$0,005 и $0,004 за минуту).
У обеих моделей есть бесплатный тариф.
Лимиты длины. За один запрос модель берёт до часа аудио. С разметкой по спикерам (`"diarization_mode": "speaker"`) или таймкодами по словам потолок падает до 30 минут. Спикеров модель различает троих, дальше режим экспериментальный, а в стриминге разметка не работает вовсе: для неё нужен нестриминговый вызов. Live-сессия живёт 10 минут.
Первоисточник