26 августа 2026 г.
Час аудио расшифровывается за $0,30: Gemini 3.5 Transcribe открыт в публичном превью
Расшифровка речи у Google стала точнее и быстрее: 2,6% ошибок на записи и на 70% меньше времени до готового текста.
Час записи превращается в текст за 30 центов.
Google открыла две модели расшифровки в семействе Gemini: gemini-3.5-transcribe разбирает готовые записи, gemini-3.5-transcribe-live работает на потоке. Обе в публичном превью, попробовать можно бесплатно в Google AI Studio.
Раньше был Chirp 3. Новая модель доводит запись до финального текста на 70% быстрее. На открытом бенчмарке FLEURS она ошибается в 5,04% слов на записи и в 5,50% на потоке.
Язык определяет сама. Модель понимает больше 85 языков и держит переключение в середине фразы, ручного выбора нет. В API можно подсунуть свой словарь терминов и написаний, а говорящих в записи она разделяет до трёх, с таймкодами.
Цена в API: $2 за миллион входных аудиотокенов и $12 за миллион выходных текстовых, смешанно около $0,005 за минуту. Стриминговая версия обходится вдвое дороже. Бесплатный тир есть.
В телефоне это уже работает. Режим Rambler в Gboard вычищает «эканье» прямо при диктовке: нужен Pixel 11, свежий Gboard клавиатурой по умолчанию и путь «Настройки → Голосовой ввод → Rambler». Русский входит в 11 языков старта.
Обе модели пока держатся в публичном превью, в Chrome расшифровку Google обещает позже.
Первоисточник