./новости · 23 июля 2026 г.
новость
TTS от Qwen озвучивает 3 минуты за проход и правит эмоции инлайн-тегами: #1 в рейтинге Artificial Analysis
источник: @alibaba_qwen на X ↗·
машинная выжимка · сверена с источником

Qwen
@alibaba_qwen
Представляем Qwen-Audio-3.0-TTS. Наша новая модель синтеза речи, в двух вариантах: • Flash: взаимодействие в реальном времени • Plus: генерация высокого качества Что нового: • Точные инлайн-теги для управления - [whisper], [angry], [breaths] и [laughs] • Свободное управление на естественном языке - «прочитай это медленно, как сказку на ночь» • 16 языков • Чистый звук даже из шумного референсного аудио • Одна дорожка длинной формы до 3 минут за проход Теперь #1 в TTS-рейтинге Artificial Analysis. Blog: https://funaudiollm.github.io/qwen-audio-3.0-tts/ API: https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide


· 2,5 тыс. просмотров
Alibaba Qwen 23 июля выпустила Qwen-Audio-3.0-TTS и с ходу заняла первое место в TTS-рейтинге Artificial Analysis. Модель идёт в двух версиях: Flash для работы в реальном времени и Plus для качества. Внутри - инлайн-теги эмоций ([whisper], [angry], [laughs]), 16 языков и озвучка до 3 минут за один проход; ещё пара фич в самом твите.
Почему это важно: Раньше эмоции в TTS задавали отдельными параметрами или отдельной моделью под голос - здесь тон правится прямо в тексте тегами [whisper] или [angry], а стиль можно описать словами: «прочитай медленно, как сказку на ночь». Добавили чистый звук даже из шумного референса и одну дорожку до 3 минут без склейки. Про цену API и лимиты в анонсе молчат.
Что дальше: Прогнать свой текст на Flash и Plus и сравнить задержку с качеством; заодно проверить, есть ли русский среди 16 языков - список не назван. API уже открыт через Alibaba Cloud Model Studio.