27 августа 2026 г.
Расшифровка часа аудио обходится в 30 центов: Gemini 3.5 Transcribe берёт $0,003 за минуту
На смену Chirp 3 у Google пришла модель, которая доводит запись до финального текста на 70% быстрее и сама вычищает «э-э» и самопоправки.

Час созвона превращается в текст за 30 центов, и вычищать «э-э» за моделью не придётся.
Gemini 3.5 Transcribe берёт $0,003 за минуту аудио на входе и $0,002 за минуту готового текста на выходе (прайс Gemini Developer API, 28.08). Час записи складывается в 30 центов, а на старте работает бесплатный тариф.
Как включить. Файл уходит в Interactions API: в Python-SDK google-genai вызывается client.interactions.create с моделью gemini-3.5-transcribe и ссылкой на аудио. Живой поток идёт через Live API и модель gemini-3.5-transcribe-live, она примерно вдвое дороже файловой.
До этого расшифровку в Google вела Chirp 3. Новая модель доходит до финального текста на 70% быстрее и ошибается реже: слова-паразиты она выкидывает сама, самопоправки сводит к итоговой фразе, текст форматирует.
На замере Artificial Analysis модель ошибается в 2,6% слов на файле и в 4,0% в потоке (блог Google, 26.08). Языков 85+, нужный она определяет сама.
Лимиты длины. На один запрос уходит до часа аудио. С разметкой по спикерам или пословными таймстемпами потолок падает до 30 минут, а живая сессия обрывается на десятой. Спикеров модель разводит до восьми, но с третьего атрибуция помечена экспериментальной, а в потоке её нет вовсе.
Свои термины модель выучит списком: поле custom_vocabulary принимает до 1000 слов. Доки советуют не больше сотни.
Та же модель уже расшифровывает надиктовку в Gboard Rambler на Android и в «Speak to Window» приложения Gemini на macOS.
Первоисточник