./новости · 28 июля 2026 г.
новость
Лидер голос-в-голос сменился: Qwen Audio 3.0 Realtime Plus обошёл GPT-Realtime на 5 пунктов
источник: @artificialanlys · X·
машинная выжимка · сверена с источником

Artificial Analysis
@artificialanlys
Alibaba выпустила Qwen Audio 3.0 Realtime: вариант Plus сразу занял первое место в Artificial Analysis Speech to Speech Index с 84,1%, опередив GPT-Realtime-2.1 High с 79,1% Qwen Audio 3.0 Realtime вышла в начале этого месяца: это флагманская нативная модель речь-в-речь от @Alibaba_Qwen, и у неё два варианта, Plus и Flash. Qwen Audio 3.0 Realtime Plus идёт первой во всех трёх бенчмарках, из которых собран Artificial Analysis Speech to Speech Index: Big Bench Audio на речевые рассуждения, Full Duplex Bench на динамику диалога и Tau Voice на агентную работу. Мы тестировали китайские endpoints на Aliyun (Alibaba Cloud). Главное: ➤ Speech to Speech Index: новый лидер это Qwen Audio 3.0 Realtime Plus с 84,1%, за ним GPT-Realtime-2.1 High (79,1%) и GPT-Realtime-2 High (77,2%). Вариант Flash на четвёртом месте с 76,3%. ➤ Индекс по бенчмаркам: на Big Bench Audio Plus набирает 99,2%, это примерно на 0,5 процентного пункта выше прежнего лучшего результата в 98,7% (Alibaba Qwen3.5 Omni Plus Realtime), у Flash 96,1%. На Tau Voice Plus сейчас первый с 54,6%, впереди Grok Voice Think Fast 1.0 с 52,1%. На нашем подмножестве Full Duplex Bench ведёт Plus с 98,4%, у Flash 96,9%, и оба выше лучшей не-Alibaba модели, GPT-Realtime-2 (Minimal) с 96,1%. ➤ Скорость: у Plus среднее время до первого звука на Big Bench Audio 4,02 секунды, у Flash 4,16 секунды. Это одни из самых медленных моделей в нашем лидерборде, далеко позади GPT-Realtime-2 (Minimal) с 1,10 секунды и GPT-Realtime-2 (High) с 1,14 секунды. ➤ Цена: Plus стоит $4,42 за час входного аудио на нашем подмножестве Big Bench Audio, это дороже GPT-Realtime-2 High ($4,14) и примерно в 2,4 раза дешевле GPT-Realtime-2.1 High ($10,75). Flash в среднем выходит в $4,77, дороже Plus, хотя прайс у него ниже: он отвечает заметно многословнее. Подробности ниже ⬇️

· 4,3 тыс. просмотров
Qwen Audio 3.0 Realtime Plus набрал 84,1% в индексе Speech to Speech и 28 июля встал у Artificial Analysis на первое место. У GPT-Realtime-2.1 High 79,1%, у GPT-Realtime-2 High 77,2%, вариант Flash четвёртый с 76,3%. Plus идёт первым во всех трёх бенчмарках индекса, но время до первого звука у него 4,02 секунды против 1,10 у GPT-Realtime-2 Minimal.
Почему это важно: Раньше верх голосового лидерборда держала OpenAI: GPT-Realtime-2.1 High с 79,1%. Теперь первое место у Alibaba, и свой же прошлый рекорд на Big Bench Audio она подняла с 98,7% (Qwen3.5 Omni Plus Realtime) до 99,2%. За это первое место ты платишь тремя секундами тишины: 4,02 секунды до первого звука в живом диалоге слышно, 1,10 секунды нет. Цена зависит от того, с кем сравнивать: час входного аудио на Plus стоит $4,42, это дороже GPT-Realtime-2 High ($4,14) и в 2,4 раза дешевле GPT-Realtime-2.1 High ($10,75). Мерили только китайские endpoints на Aliyun, про другие цифр не дают. У Flash прайс ниже, а счёт выше, $4,77: болтливость оплачивается отдельно.
Что дальше: Artificial Analysis мерила только китайские endpoints на Aliyun. Если у тебя есть голосовой сценарий, прогони один и тот же диалог на Plus и на GPT-Realtime-2 Minimal и сравни две цифры: время до первого звука и счёт за час.
первоисточник