27 августа 2026 г.
Речь превращается в готовый текст без слов-паразитов: Gemini 3.5 Transcribe ошибается в 2,6% слов
Час записи превращается в текст за 30 центов, а имена и термины проекта можно заранее скормить модели списком.

Часовая запись уходит одним файлом и возвращается готовым текстом, из которого модель сама вычистила слова-паразиты.
Gemini 3.5 Transcribe ошибается в 2,6% слов на записанном аудио и в 4,0% на живом потоке (замер Google, 26.08). До готовой строки текста модель доходит на 70% быстрее прежней Chirp 3.
Как включить. Без кода модель открывается прямой ссылкой в Google AI Studio. Из своего кода она вызывается новым Interactions API: файл грузится через files.upload, дальше идёт interactions.create с моделью gemini-3.5-transcribe. SDK готовы для Python и JavaScript.
Минута записанного аудио стоит полцента, живой поток — почти вдвое дороже (прайс Gemini Developer API, 26.08). Час созвона выходит в 30 центов. У обеих версий есть бесплатный тариф.
Час аудио — потолок одного запроса. Включишь разделение по говорящим или пословные таймкоды, и потолок падает до 30 минут, а живая сессия обрывается после 10 минут непрерывного стриминга.
Разделять голоса на лету модель не умеет вовсе. Зато в записи она разводит до восьми говорящих — этот путь Google и советует в доках.
Свой словарь. Имена коллег, названия продуктов и внутренние термины грузятся полем custom_vocabulary — до 1000 штук за раз, хотя доки Google советуют держаться в пределах сотни.
Модель уже работает в голосовом вводе Gboard на Android, в приложении Gemini на macOS и в микрофоне Google Antigravity. В Chrome её обещают «скоро».
Флагманская Gemini 3.5 Pro всё ещё не вышла — Transcribe приехала раньше неё.
Первоисточник