21 августа 2026 г.
Модели распознавания речи заучили бенчмарк: ошибки эталона они повторяют в 18–30% случаев
Hugging Face открыла вкладку, где видно, какая модель подстроилась под тесты, а какая правда слышит звук.

В записи звучит «Thank you, Mr. President». В эталоне VoxPopuli слов «Thank you» нет, и 6 моделей из 11 их тоже не написали.
Так выглядит подгонка под бенчмарк: модель пишет не то, что слышит, а то, что стоит в разметке, по которой ей ставят оценку. На свежей записи парламента ЕС те же слова срезала только 1 модель из 11.
Как это меряют. Hugging Face и Hume AI Research прогнали 11 популярных открытых моделей через три пробы. Методика пометила подозрительные референсы в 40% разобранных тестовых клипов VoxPopuli, это около 3% всех слов эталона. Модели с признаками подгонки повторяли ошибочный эталон в 18–30% случаев.
Вторая проба глушит в аудио число. На LibriSpeech сильнейшие по рейтингу модели восстанавливали вырезанное число в 30–40% примеров, а на отложенной выборке и свежесобранном аудио доля падала.
Третья проба ловит орфографию. Выбор между «Mr.» и «Mister» под конвенцию конкретного датасета случайно дал бы 50%, отдельные модели попадают в 90%.
Раньше в таблице рейтинга стояла одна цифра ошибки на датасет. Теперь в Open ASR Leaderboard есть вкладка «Benchmark fitting»: рядом видно долю повторённых ошибочных эталонов и орфографическое переключение по всем публичным датасетам.
Скрипты открыты. Обе пробы лежат в репозитории huggingface/open_asr_leaderboard, папка benchmark_fitting. Зависимости ставит `pip install -r requirements/requirements_jobs.txt`, повтор ошибочных эталонов считает `python benchmark_fitting/score_voxpopuli_ref_errors.py --bucket hf-audio/asr_leaderboard_h200`, а свою модель прогоняет тот же скрипт с `--preds_dir results --model openai/whisper-large-v3`.
Первоисточник