2 сентября 2026 г.
Час расшифровки речи теперь стоит 18 центов: столько Meta просит за Muse Voice Transcribe
Задержка 0,16 секунды, больше 20 голосов в одном потоке и метки говорящих без пост-обработки.

Текст догоняет говорящего за 0,16 секунды, а метки A и B появляются прямо в потоке.
Meta открыла Muse Voice Transcribe, свою первую модель для аудио в реальном времени: она ведёт больше 20 говорящих и несколько языков сразу в одном потоке.
Аудио режется на куски по 80 мс, и на каждом модель сама решает, слушать дальше или выдавать текст. Отсюда задержка 0,16 секунды. Ошибается она в 3,1% слов и занимает первое место по потоковой расшифровке в индексе Artificial Analysis (VentureBeat, 02.09.2026).
Цена и лимиты. $3 за 1000 аудиоминут, то есть 18 центов за час. Считают по целым секундам, упавшие и обрезанные лимитом запросы не оплачивают. Файл принимают до 10 минут и 32 МБ, стрим-сессию держат до часа, параллельно идут 8 потоков и 1000 запусков в час, звук моно 16 бит, PCM 24 кГц или файлом WAV.
Раньше разделение говорящих докупали отдельной опцией и получали его уже после записи, пост-обработкой. Теперь модель расставляет метки A, B и дальше прямо во время разговора. Средняя ошибка разделения 17,5% на трёх наборах записей встреч, то есть примерно каждая шестая секунда достаётся не тому голосу.
Планка «20+ говорящих» рекордом не стала: Speechmatics и Amazon Transcribe держат больше.
Где взять. На Mac диктовка уже встроена: в приложении Meta AI и в Muse Code текст вводится в любое окно по удержанию клавиши Fn. Через API это модель muse-voice-transcribe-1.0, потоком по wss://api.meta.ai/v1/asr/realtime, файлом через POST на api.meta.ai/v1/asr/transcribe. Ключ и пятиминутный quickstart лежат на dev.meta.ai.
Из 70+ языков обучения Meta проверила к релизу 25, остальные ждут валидации.
Первоисточник