30 сентября 2026 г.
Озвучку можно сравнить на одинаковых текстах: Open TTS Leaderboard доступен в браузере
Hugging Face собрала образцы речи и оценки моделей в одном Space, включая озвучку на русском и клонирование голоса.

На 9 сентября OmniVoice лидирует по точности произношения в Open TTS Leaderboard для 9 языков, включая русский, с клонированием голоса и без него.
Одинаковые условия. Вместо сравнения отдельных демо Hugging Face даёт моделям одинаковые тексты из двух наборов: Seed-TTS eval и CV3-Eval. В браузерном Space Hugging Face Audio можно слушать и оценивать образцы, подбирая голос для приложения или озвучки материалов.
Одного победителя для всех задач нет. WER измеряет ошибки в произнесённых словах, SIM оценивает сходство с исходным голосом, а TTFA показывает время до начала звучания.
| Модель | Результат на 9 сентября 2026 года | | --- | --- | | OmniVoice | 1-е место по среднему WER для 9 языков с клонированием и без него. 2-е место по среднему SIM. 1-е по SIM для русского, английского, французского и корейского | | Fish Audio S2 Pro | 2-е место по среднему WER для 9 языков. 1-е по WER для немецкого | | Qwen3-TTS-GGUF | 1-е место по скорости начала звучания в streaming-тесте с одним запросом |
Запуск OmniVoice. Для локального запуска нужны PyTorch и torchaudio 2.8.0, затем установка через `pip install omnivoice`. Модель загружается вызовом `OmniVoice.from_pretrained("k2-fsa/OmniVoice")`, а клонирование запускается через `generate(text=..., ref_audio=..., ref_text=...)`: передаются новый текст, образец голоса и расшифровка образца.
Первоисточник: [Hugging Face, 30 сентября 2026 года](https://huggingface.co/blog/open-tts-leaderboard).
Код OmniVoice доступен под Apache 2.0, но лицензия весов CC-BY-NC не подходит для коммерческого применения.
Первоисточник