2 октября 2026 г.
Голосовой ИИ делит одну GPU: .wave обслужила 56 сессий Nemotron VoiceChat
В замере .wave от 10 сентября один H100 обслужил 56 сессий Nemotron VoiceChat без опозданий аудио.

Голосовая модель слушает собеседника, пока отвечает, и продолжает работать даже в паузах. Пропустила срок выдачи следующего фрагмента аудио — человек слышит разрыв.
Больше сессий вместе. В замере .wave референсный NVIDIA NIM выдерживал одну сессию. При двух сессиях он опаздывал с 8–15% аудиофрагментов. Движок WPK обслужил 56 сессий на той же H100 и не пропустил ни одного срока за 84 тысячи проверенных фрагментов в трёх прогонах.
.wave перенесла управление вычислениями на GPU и объединила обработку сессий. Компания заранее задаёт порядок работы и размещение памяти, вместо того чтобы решать это во время разговора. В тесте использовали одинаковые веса и точность модели, одну аудиозапись во всех сессиях и две минуты контекста, а задержку измеряли на сервере.
Подключение из Python. VoiceChat доступен через API .wave для голосового разговора с перебиваниями. В руководстве есть готовый пример работы с микрофоном: установить `python -m pip install websockets sounddevice`, задать `DOTWAVE_API_KEY` и запустить пример. Подключение идёт через WebSocket, первым сообщением приложение отправляет `session.start` с моделью `nemotron-voicechat`, затем передаёт аудио PCM16 mono 24 kHz через `session.input_audio.append`.
На 2 октября вводный тариф составляет $0,005 за минуту, или $0,30 за час открытой сессии, включая паузы. После регистрации .wave выдаёт ключ и бесплатные кредиты без банковской карты. По данным компании, их хватает примерно на 33 часа VoiceChat.
Текущий API поддерживает разговоры на английском до 120 секунд с голосом aria, без собственных инструкций, текстового ввода и вызова tools.
Первоисточник