21 августа 2026 г.
Голосовой ИИ научится слушать, пока говорит: Сбер обещает отклик 160–320 мс
Сбер разрабатывает голосового ассистента, который слушает, пока говорит сам: отклик обещают за 160–320 мс вместо нынешних секунд.

Перебей голосового ассистента на полуслове: он договорит своё и только потом начнёт слушать.
Сбер разрабатывает голосовую систему с полным дуплексом: она слушает непрерывно, даже когда говорит сама. Сергей Марков, директор по развитию технологий ИИ Сбербанка, обещает отклик за 160–320 мс вместо нынешних нескольких секунд (РБК, 21.08.2026).
160 мс — это обычная пауза между репликами в живом разговоре. Секунда молчания в ответ уже читается как сбой, поэтому с ассистентами говорят короткими командами, а не разговаривают.
Одна модель вместо трёх звеньев. Сейчас голосовой ассистент собран конвейером: распознавание речи, потом языковая модель, потом синтез. Каждое звено добавляет задержку. Сбер строит всё на одной модели. Добавится камера — система сможет видеть собеседника и двигать видеоаватара.
Realtime API Яндекса ждёт смены реплики: человек договорил, дальше отвечает модель. Режим «Поговорить» в приложении Алисы уже держит непрерывный диалог и реагирует на перебивания, но говорит только на русском и не умеет искать информацию и пользоваться инструментами. Марков говорит, что в РФ о полнодуплексных разработках публично больше никто не заявлял.
Поставить можно уже сейчас. Полнодуплексный аналог лежит в открытом доступе. Moshi от Kyutai ставится командой pip install -U moshi, для Apple Silicon есть сборка moshi_mlx. PyTorch-версии без квантизации нужен GPU на 24 ГБ VRAM. Задержка заявлена в 160 мс теоретическая и 200 мс практическая на GPU L4: те же цифры, что обещает Сбер. Код под MIT, веса под CC-BY 4.0, так что брать в свой продукт можно.
У самого Сбера открытая аудио-модель уже есть. GigaChat3.1-Audio-10B-A1.8B выложена на Hugging Face 14.07.2026, держит запись до 120 минут и запускается через transformers или vLLM. Речь она не генерирует, только слушает и отвечает текстом.
Первоисточник