1 октября 2026 г.
Распознавание звонков можно сравнить на открытых данных: RESON OSD содержит 38 часов речи
MWS AI выложила записи телефонной речи и инструмент, который помогает найти ошибки распознавания за общей оценкой.

В опубликованном 1 октября RESON OSD собраны 12 114 записей телефонной речи. Их общая длительность составляет почти 38 часов.
Команда MWS AI разрабатывала RESON для внутренней работы в течение последнего года. Теперь разработчики голосовых ботов могут использовать тот же инструмент для анализа своих моделей и открытый набор записей для сравнения результатов.
Ошибки по словам. RESON дополняет WER, общую долю ошибок распознавания, двумя метриками. MWA даёт каждому уникальному слову одинаковый вес при подсчёте правильно распознанных употреблений. WIS выделяет слова, улучшение распознавания которых полезно для выбранной области применения.
RESОN OSD содержит речь в телефонном канале 8 кГц. В наборе есть общая речь General и числовые выражения Numeric, оба раздела доступны в тихой и шумной версиях. Для проверки предусмотрены два эталона: text передаёт произнесённое, e2e_text содержит письменную форму.
Данные для проверки. На Hugging Face доступны четыре конфигурации, у каждой один сплит test. Тихую версию общей речи можно загрузить через библиотеку datasets:
```python from datasets import load_dataset
load_dataset("MTSAIR/mws-reson-asr-osd", "general_quietly", split="test") ```
Без datasets можно скачать wav-файлы и metadata.jsonl. Для анализа своих результатов RESON принимает JSONL с полями audio_filepath, duration, text и prediction. Инструмент также поддерживает JSON и CSV.
Разработчики могут запускать RESON через Python API или CLI. В CLI предусмотрены четыре группы команд:
- `manifest`; - `run`; - `report`; - `pipeline`.
Команда `pipeline` объединяет обработку в один запуск.
Код RESON опубликован в репозитории mts-ai/RESON на GitHub.
Первоисточник