23 сентября 2026 г.
Qwen-Audio снизил цену расшифровки аудио: ASR подешевел до 95%
23 сентября Alibaba снизила цены в Qwen-Audio: TTS примерно на 70%, Realtime примерно на 85%, ASR до 95%. Линейка включает пять моделей для расшифровки, синтеза, диалога в реальном времени и создания аудио. Новые TTS-Next и ASR-Next создают голос и звуки либо размечают спикеров и время в расшифровке.

Qwen
@alibaba_qwen
⚡ Знакомьтесь: Qwen-Audio-3.1! ASR, TTS и Realtime полностью обновили, а к ним добавили две модели: TTS-Next для создания аудио и ASR-Next для его понимания. Пять моделей, одна полная аудиосвязка: понимание, генерация, взаимодействие и создание. Плюс крупное снижение цен по всей линейке: TTS примерно на 70%, Realtime примерно на 85%, ASR до 95%. Главное: 🥳 - ASR: лучше распознаёт разные языки и диалекты, а встроенная чистка сама убирает слова-паразиты и повторы. Расшифровки становятся чище и связнее. - ASR-Next: поддерживает расшифровку нескольких спикеров с метками, таймкодами и синхронизированным текстом. Понимает эмоции, фоновые и машинные звуки для описания звуков, определения событий, проверки аудио и рассуждений по нему. - TTS: синтезирует речь на разных языках и диалектах с естественным переносом голоса между языками. Эмоцию, скорость и стиль можно задать простыми указаниями. - TTS-Next: единая архитектура LM и диффузии за один проход создаёт голос, звуковые эффекты и фоновое аудио для аудиокниг, подкастов, игр и рекламы. - Realtime: можно говорить и слушать одновременно, а перебить модель можно в любой момент, как в обычном разговоре. Когда она замечает плохое настроение, то замедляется и отвечает с сочувствием. Раскройте все возможности Qwen-Audio-3.1! 👇 - Блог: https://fun-resource-shanghai.oss-cn-shanghai.aliyuncs.com/cuijiayan.cjy/tmp/exp/qwen_audio_3_tts_blog_review_260918/index.shtml?Expires=2105366399&OSSAccessKeyId=LTAI5tQrCBwj82sVMCWoSmzE&Signature=9ZaZIEahoN41Zb9MFJjf34G%2BSCM%3D - Qwen-Audio-3.1-ASR: https://www.qwencloud.com/models/qwen-audio-3.1-asr-flash-filetrans - Qwen-Audio-3.1-Realtime: https://www.qwencloud.com/models/qwen-audio-3.1-realtime-plus - Другие API: скоро в @qwen_cloud

· 7,8 тыс. просмотров
До 22 сентября Qwen-Audio-3.0-Realtime-Flash стоил в Singapore $4.5 за 1 млн токенов audio input и $15 за output text+audio. С 22 сентября Alibaba берёт $0.93 и $1.87, а 23 сентября объявила скидки для линейки Qwen-Audio-3.1.
Появились готовые детали. Модель для расшифровки файлов принимает записи до 12 часов или 2 GB, разделяет реплики и работает через HTTP. Потоковый вариант подключается по WebSocket и не ограничивает длительность. TTS-Next принимает до трёх референс-клипов по 30 секунд и за запрос собирает до 240 секунд подкаста.
Другие API Qwen-Audio-3.1 Alibaba обещает добавить позже.
Первоисточник
