26 августа 2026 г.
Час расшифровки речи обходится в 30 центов: Gemini 3.5 Transcribe вышла в превью
Google отдала в превью свою модель расшифровки речи: $0.005 за минуту аудио и 2,6% ошибок на слово.

Google AI Studio
@googleaistudio
представляем Gemini 3.5 Transcribe: нашу самую точную модель распознавания речи, сделанную для умного голосового общения новая модель: - гладко справляется с самопоправками - убирает слова-паразиты и отдаёт чистый форматированный текст - понимает, что вы имели в виду и как вы говорите - разбирает речь даже в шуме - поддерживает 85+ языков, включая региональные акценты и разные диалекты попробуйте уже сегодня в Gemini API и в AI Studio
Диктуешь как говоришь, а на выходе чистый текст: модель сама убирает «э-э» и правит оговорки.
Google отдала в публичное превью Gemini 3.5 Transcribe. Минута записи стоит $0.005 (прайс Gemini API, 26.08.2026), час разговора обходится в 30 центов. Во free tier вход и выход бесплатны.
Скорость выросла. С 2025 года расшифровку в Google Cloud вела Chirp 3. Новая модель доводит фразу до финального текста на 70% быстрее по замеру Artificial Analysis, в потоке отвечает за доли секунды.
Как включить. В API работают две модели: gemini-3.5-transcribe для готовых записей и gemini-3.5-transcribe-live для потока по WebSocket. Поток дороже, $0.009 за минуту. Без кода модель гоняется прямо в Google AI Studio, реалтайм открывается страницей live.
Ошибок на слово модель делает 2,6% вне потока и 4,0% в потоке. В лидерборде Artificial Analysis по расшифровке это третья строка, впереди ElevenLabs Scribe v2 с 2,2% и Microsoft MAI-Transcribe-1.5 с 2,4%.
Язык модель определяет сама и держит 85+ языков с акцентами и диалектами. Ещё она размечает до трёх говорящих, ставит таймстемпы на каждое слово и принимает свой словарь терминов.
Внутри Google модель уже работает: клавиатура Gboard на Android, приложение Gemini на macOS, микрофон в поле промпта Antigravity.
Следующим Google обещает надиктовку в Chrome, голосом в любое поле страницы.
Первоисточник
