22 сентября 2026 г.
Приятный голос ещё не грамотный: лидер арены TTS оказался 11-м по произношению
Artificial Analysis замерила чтение сложных мест вслух: Sonic 3.6 первый по симпатии слушателей и одиннадцатый по точности с 74,5%.

Artificial Analysis
@artificialanlys
Представляем Artificial Analysis Pronunciation Robustness — замер того, насколько надёжно модели Text to Speech произносят сложный текст правильно. Впереди Google Gemini 3.1 Flash TTS с 88,1%, вплотную за ним SpaceXAI TTS с 87,6% и ElevenLabs Eleven v3 с 85,6%. Нынешние оценки TTS, включая нашу TTS Arena, ловят общее предпочтение слушателя (например, насколько естественно звучит голос), а Word Error Rate проверяет, вышли ли нужные слова. Pronunciation Robustness добавляет взгляд на то, правильно ли эти слова произнесены (например, «St.» читается как «Saint» и как «Street» во фразе «St. Mary's is on Church St.»). Это критично для голосовых агентов в проде: им нужно верно выговаривать реквизиты счёта, имена, суммы и прочее, чтобы пользователи им доверяли, и делать это с той низкой задержкой, которой требует живой разговор. Как устроен Pronunciation Robustness Каждая модель озвучивает 454 предложения, в которых 701 целевое слово или словосочетание, по четырём категориям: 1. Зависящие от контекста (слова читаются по-разному в зависимости от контекста, например wound как «рана» и wound как «намотанный») 2. Раскрытие сокращений (числа, даты, единицы и нотация, прочитанные естественно, например 6'2", Chapter XVII или 1 tsp сахара) 3. Точные последовательности (коды, пути, почта и идентификаторы произносятся в точности, например .env.local или a.chen@ucsf.edu) 4. Отдельные термины (бренды, географические и технические названия, например Arkansas, façade или genre) Предложения мы отправляем как написаны, без нормализации с нашей стороны сверх настроек каждой модели по умолчанию. Отобранные живые слушатели судят, произнесена ли каждая цель правильно, сверяясь с заранее заданными допустимыми вариантами; тех, кто проваливает проверку на внимательность, мы исключаем. Оценка — доля верных суждений, без учёта ответов «не смог разобрать»; модель публикуем, когда по 95% целей набралось трое и больше одобренных слушателей. Главные результаты: ➤ Лидеры в общем зачёте: Gemini 3.1 Flash TTS от @GoogleDeepMind впереди с 88,1%, следом TTS от @SpaceXAI с 87,6%, Eleven v3 от @ElevenLabs с 85,6%, v3 Conversational с 84,8% и Qwen-Audio-3.0-TTS-Plus от @Alibaba с 81,6%. Gemini 3.1 Flash TTS ведёт в категориях «зависящие от контекста» и «раскрытие сокращений», TTS от SpaceXAI — в «точных последовательностях», Qwen-Audio-3.0-TTS-Plus — в «отдельных терминах». ➤ Самые трудные категории: раскрытие сокращений (62,4%) и точные последовательности (62,9%) отстают от зависящих от контекста (86,2%) и отдельных терминов (86,1%). Мы ждём, что на нормализованном входном тексте оценки в раскрытии сокращений и точных последовательностях вырастут заметно, особенно у моделей, где нормализация по умолчанию выключена. ➤ Предпочтение ≠ надёжность произношения: самые любимые голоса не всегда самые точные. Sonic 3.6 стоит #1 в Provider Voice Arena с 1276 Elo и лишь #11 по надёжности произношения с 74,5%, тогда как Gemini 3.1 Flash TTS занимает #9 в Arena с 1201 Elo и #1 по надёжности произношения с 88,1%. Подробности ниже ⬇️

· 2 тыс. просмотров
Голос, который нравится слушателям больше всех, спотыкается на номере счёта и адресе.
22.09.2026 Artificial Analysis выпустила замер Pronunciation Robustness: 454 предложения, 701 сложное место, вердикт выносят живые слушатели. Это третья линейка для голосовых движков, и она расходится с двумя прежними.
Что именно меряют. Арена предпочтений показывает, чей голос приятнее, WER проверяет, те ли слова прозвучали. Новый замер спрашивает, верно ли они прочитаны: во фразе «St. Mary's is on Church St.» первое сокращение читается «Saint», второе «стрит».
Первое место у Gemini 3.1 Flash TTS с 88,1% верных прочтений. TTS от SpaceXAI отстал на полпункта, 87,6%. Eleven v3 от ElevenLabs набрал 85,6%, Qwen-Audio-3.0-TTS-Plus от Alibaba 81,6%.
Ломается на мелочах. Сокращения, числа и единицы модели читают верно в 62,4% случаев, точные последовательности вроде .env.local или почтового адреса в 62,9%. На словах, где решает контекст, и на названиях вроде Arkansas показатель держится выше 86%. Голосовому агенту в работе достаются как раз реквизиты, суммы и адреса.
Sonic 3.6 стоит первым на арене предпочтений и одиннадцатым по произношению с 74,5%. У Gemini 3.1 Flash TTS ровно наоборот: девятое место по симпатии слушателей, первое по точности.
Текст моделям подавали как есть, и авторы замера ждут, что на очищенном вводе обе слабые категории заметно подтянутся.
Первоисточник
