28 июля 2026 г.
Лучшая голосовая модель теперь у Alibaba: 84,1% против 79,1% у GPT-Realtime
28 июля Artificial Analysis поставила Qwen Audio 3.0 Realtime Plus на первое место своего Speech to Speech Index с 84,1%. GPT-Realtime-2.1 High идёт следом с 79,1%, вариант Flash - четвёртый с 76,3%. Plus выигрывает все три бенчмарка индекса, но до первого звука ждёт 4,02 секунды и стоит $4,42 за час входящего аудио.

Artificial Analysis
@artificialanlys
Alibaba выпустила Qwen Audio 3.0 Realtime: вариант Plus сразу занял первое место в Artificial Analysis Speech to Speech Index с 84,1%, опередив GPT-Realtime-2.1 High с 79,1% Qwen Audio 3.0 Realtime вышла в начале этого месяца: это флагманская нативная модель речь-в-речь от @Alibaba_Qwen, и у неё два варианта, Plus и Flash. Qwen Audio 3.0 Realtime Plus идёт первой во всех трёх бенчмарках, из которых собран Artificial Analysis Speech to Speech Index: Big Bench Audio на речевые рассуждения, Full Duplex Bench на динамику диалога и Tau Voice на агентную работу. Мы тестировали китайские endpoints на Aliyun (Alibaba Cloud). Главное: ➤ Speech to Speech Index: новый лидер это Qwen Audio 3.0 Realtime Plus с 84,1%, за ним GPT-Realtime-2.1 High (79,1%) и GPT-Realtime-2 High (77,2%). Вариант Flash на четвёртом месте с 76,3%. ➤ Индекс по бенчмаркам: на Big Bench Audio Plus набирает 99,2%, это примерно на 0,5 процентного пункта выше прежнего лучшего результата в 98,7% (Alibaba Qwen3.5 Omni Plus Realtime), у Flash 96,1%. На Tau Voice Plus сейчас первый с 54,6%, впереди Grok Voice Think Fast 1.0 с 52,1%. На нашем подмножестве Full Duplex Bench ведёт Plus с 98,4%, у Flash 96,9%, и оба выше лучшей не-Alibaba модели, GPT-Realtime-2 (Minimal) с 96,1%. ➤ Скорость: у Plus среднее время до первого звука на Big Bench Audio 4,02 секунды, у Flash 4,16 секунды. Это одни из самых медленных моделей в нашем лидерборде, далеко позади GPT-Realtime-2 (Minimal) с 1,10 секунды и GPT-Realtime-2 (High) с 1,14 секунды. ➤ Цена: Plus стоит $4,42 за час входного аудио на нашем подмножестве Big Bench Audio, это дороже GPT-Realtime-2 High ($4,14) и примерно в 2,4 раза дешевле GPT-Realtime-2.1 High ($10,75). Flash в среднем выходит в $4,77, дороже Plus, хотя прайс у него ниже: он отвечает заметно многословнее. Подробности ниже ⬇️

· 57,7 тыс. просмотров
Почему это важно: До сих пор верхнюю строчку Speech to Speech Index держала OpenAI: GPT-Realtime-2.1 High с 79,1%. Теперь там Alibaba с 84,1%. Прошлый рекорд в Big Bench Audio она побила свой же: было 98,7% у Qwen3.5 Omni Plus Realtime, стало 99,2%. В Tau Voice отрыв скромнее: 54,6% против 52,1% у Grok Voice Think Fast 1.0. Практику важнее другое: за первое место платят ожиданием. 4,02 секунды до первого звука против 1,10 у GPT-Realtime-2 (Minimal) - в живом диалоге такую паузу слышно. Замеряли китайские эндпойнты на Aliyun. С Flash арифметика вышла смешная: прайс ниже, а счёт выше, чем у Plus, потому что модель больше болтает.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Что дальше: Прогони свой голосовой сценарий на обоих эндпойнтах и сравни два числа: время до первого звука и счёт за час входящего аудио. Если в сценарии есть перебивания, отдельно проверь Full Duplex - там разрыв с GPT-Realtime самый большой.
Первоисточник