23 сентября 2026 г.
Расшифровка разговоров различит до 8 голосов: Nemotron 3 Diarization
NVIDIA 23 сентября 2026 года выпустила Nemotron 3 Diarization: 99,2 млн параметров для 8 говорящих. Модель с открытыми весами размечает аудио в потоке и после записи, возвращая сегменты с началом, концом и номером говорящего.

В Voice Arena модель заняла первое место среди 12 систем: 14,72% ошибок в разделении голосов против 19,3% у следующей системы на 139 англоязычных разговорах общей длиной около 22 часов. На DIHARD III Nemotron 3 Diarization при буфере 1,04 секунды дал 13,18% ошибок против 19,60% у прежнего Sortformer.
Из файла в метки. Раньше для такой разметки приходилось собирать связку самостоятельно. Теперь NeMo ставится командой `uv pip install 'nemo-toolkit[asr]'` после Python 3.12, Cython, свежего PyTorch, libsndfile1 и ffmpeg, а вызов `diarize()` возвращает границы реплик и индекс говорящего.
Для потока. NVIDIA даёт отдельную связку с распознаванием речи: входной файл нужен одноканальный с частотой 16 kHz. Профили ждут перед обработкой 0,32, 0,64 или 1,04 секунды аудио, время вычисления в эти цифры не входит.
Для потоковой расшифровки NVIDIA уже связала модель с `multitalker-parakeet-streaming-0.6b-v1` или `nemotron-3.5-asr-streaming-0.6b`.
Первоисточник
