11 сентября 2026 г.
CocktailASR-1 отделяет нужного говорящего в шуме: ошибка упала до 20,63%
11 сентября 2026 года Xiaomi открыла CocktailASR-1, модель для расшифровки нужного голоса в смешанной записи. На AliMeeting Far она получила 20,63% ошибок в словах против 27,5% у предыдущего лучшего результата. Модель получает запись разговора и короткий референс голоса.

На реальных записях AMI SDM и AliMeeting Far предыдущие лучшие результаты давали 22,0% и 27,5% ошибок в словах. CocktailASR-1 снизила их до 21,81% и 20,63% соответственно в техническом отчёте Xiaomi от 10 сентября 2026 года.
Проверка. В синтетическом LibriMix модель получила 4,11% ошибок для двух говорящих и 12,29% для трёх. Qwen3-ASR на тех же тестах показала 68,75% и 106,04%.
Как устроено. В target.wav лежит смешанная запись, а в ref_speaker.wav короткий голосовой референс. Модель возвращает текст только нужного говорящего. Если его голоса в целевой записи нет, модель может вернуть пустой текст. Доля таких корректных отказов составила 79,59% на LibriSpeech Neg и 75,35% на Aishell Neg.
Запуск. Веса и код лежат на Hugging Face в Ease3/Xiaomi-CocktailASR-1, инструкция и пакетная обработка находятся в репозитории Xiaomi Research на GitHub от 11 сентября 2026 года. Для запуска нужны четыре Python-пакета: torch, torchaudio, transformers и soundfile. Инструкция вызывает AutoModel.from_pretrained с trust_remote_code=True и torch_dtype="bfloat16", затем переводит модель на CUDA.
Пакетный режим. Скрипт tools/test_batch_scp.py читает TSV из пяти колонок: utt_id, wav, text, ref_wav и ref_id. Модель принимает numpy.ndarray и torch.Tensor. Записи не в 16 кГц она автоматически пересэмплирует. Внутри модель объединяет референсный голос, 1 секунду тишины и целевую запись.
Репозиторий опубликован под Apache License 2.0.
Первоисточник
