2 сентября 2026 г.
Meta сбила цену расшифровки речи: Muse Voice Transcribe берёт $0,18 за час
$3 за 1000 минут аудио, разметка говорящих не тарифицируется: у Deepgram тот же час стоит около $0,47.

Час записи совещания Meta расшифровывает за 18 центов и сама помечает, кто из говоривших что сказал.
Раньше живая расшифровка с разбивкой по голосам обходилась дороже: Deepgram Nova-3 берёт около $0,47 за час. Meta ставит $3 за 1000 минут аудио, то есть $0,18 за час, и разметку говорящих в счёт не добавляет. Стриминг и расшифровка готового файла стоят одинаково.
На финальной расшифровке модель делает 3,1% ошибок в словах и выдаёт текст через 0,16 секунды после того, как человек замолчал. В стриминговом индексе Artificial Analysis на 1 сентября 2026 это первое место.
На Mac это одна клавиша. Код не нужен: в приложении Meta AI зажимаешь Fn и диктуешь в любое окно.
Через API. Ключ берётся на dev.meta.ai, дальше работает привычный OpenAI SDK — меняешь адрес сервера и имя модели на muse-voice-transcribe-1.0. Живой поток идёт по WebSocket, готовый файл уходит обычным POST.
Границы жёсткие. Живая сессия обрывается на 60 минутах и требует переподключения, файл принимается до 10 минут, параллельно на аккаунт идут 8 потоков. Сама модель при этом держит 20+ говорящих и разговоры длиннее часа, обучена на 70+ языках, 25 из них проверили к запуску.
Независимый замер на 25 минутах английской речи дал 11,93% ошибок против 15,34% у Whisper large-v3-turbo. На смеси хинди с английским Muse проиграла — 54,21% против 30,84%, английские термины она писала деванагари.
Весов для скачивания нет: поднять модель у себя не получится.
Первоисточник