19 сентября 2026 г.
В потоковой расшифровке появился новый лидер: Grok Voice Transcribe 2.0 дал 2,7% ошибок
18 сентября 2026 года Grok Voice Transcribe 2.0 занял первое место по точности потоковой расшифровки на AA-WER: 2,7% ошибок через 0,49 секунды после конца речи. В первом частичном фрагменте он дал 3,4%, а в пакетном режиме занял 5-е место из 59 моделей с 2,3% AA-WER. Streaming стоит $0,20 за час, batch — $0,10, цена совпадает с прошлой версией.

Artificial Analysis
@artificialanlys
SpaceXAI выпустила Grok Voice Transcribe 2.0 и заняла первое место по точности Final Transcript и First Partial Transcript в AA-WER Streaming: 2,7% WER через 0,49 секунды после окончания речи. Grok Voice Transcribe 2.0 — новая модель преобразования речи в текст от @SpaceXAI, которая пришла на смену Grok Voice Transcribe 1.0, ранее известной как Grok Speech to Text. Потоковый WER Final Transcript улучшился с 3,9% до 2,7%, а непотоковый AA-WER — с 4,0% до 2,3%. Модель доступна через API SpaceXAI для потоковой и непотоковой расшифровки по той же цене, что и предшественница. Главное ➤ Final Transcript: Grok Voice Transcribe 2.0 достигает 2,7% WER через 0,49 секунды после окончания речи. Она точнее, но медленнее Muse Voice Transcribe с результатом 3,1% и задержкой 0,16 секунды, а также ElevenLabs Scribe v2 Realtime с результатом 3,6% и задержкой 0,14 секунды. Она также точнее, но немного медленнее Cartesia Ink-2 с семантическими точками завершения, которая показала 3,4% и 0,43 секунды. ➤ First Partial Transcript: модель достигает 3,4% WER через 0,49 секунды. По точности она немного опережает Muse Voice Transcribe и ElevenLabs Scribe v2 Realtime, у которых по 3,6%, но уступает им по скорости, поскольку обе модели выдают результат через 0,13 секунды. Она точнее, но медленнее Cartesia Ink-2 с внешними точками завершения, которая показала 4,9% и 0,17 секунды, а также Cartesia Ink-2 с внешними endpoint, которая показала 4,0% и 0,07 секунды. ➤ Непотоковая расшифровка: Grok Voice Transcribe 2.0 получила 2,3% AA-WER и заняла 5-е место из 59 моделей. Выше находятся Fun-Realtime-ASR-preview от Alibaba и StepAudio 3 ASR от StepFun с результатом 1,7%, MAI-Transcribe-2 от Microsoft AI с 2,0% и ElevenLabs Scribe v2 с 2,2%. Коэффициент скорости составляет около 160x. ➤ Цена: Grok Voice Transcribe 2.0 стоит $0,20 за час потоковой расшифровки, или $3,33 за 1000 минут. Это немного дороже Muse Voice Transcribe за $3, дешевле Cartesia Ink-2 за $4 и примерно вдвое дешевле ElevenLabs Scribe v2 Realtime и Deepgram Flux, которые стоят по $6,50. Непотоковая расшифровка стоит $0,10 за час, или $1,67 за 1000 минут. Поздравляем @elonmusk и команду @SpaceXAI с запуском! Подробнее ниже ⬇️

· 5,6 тыс. просмотров
У Grok Voice Transcribe 1.0 было 3,9% ошибок в потоковом финальном тексте и 4,0% в пакетной расшифровке. Версия 2.0 снизила показатели до 2,7% и 2,3%, поэтому готовая расшифровка требует меньше ручных исправлений.
Рабочий сценарий. Atlassian Loom выбрала 2.0 после сравнения с прежним решением и использует его для каждого видео. В описанном процессе транскрипт из Loom передаётся в Cursor, который вносит изменения в код.
Подключение. Пакетная расшифровка идёт через `/v1/stt` с параметром `model=grok-voice-transcribe-2.0`, потоковая работает через WebSocket. API принимает файлы до 500 МБ и до 8 каналов, а в стоимость входят diarization, timestamps и key terms. Сейчас модель 1.0 остаётся значением по умолчанию, поэтому 2.0 нужно указать явно.
В ближайшие недели SpaceXAI планирует сделать 2.0 моделью по умолчанию, а 1.0 пометить устаревшей.
Первоисточник
