21 августа 2026 г.
Голосовой ИИ научится слушать, пока говорит: Сбер обещает отклик 160–320 мс
Сбер разрабатывает голосового ассистента, который слушает, пока говорит сам: отклик обещают за 160–320 мс вместо нынешних секунд.

Перебей голосового ассистента на полуслове: он договорит своё и только потом начнёт слушать.
Сбер разрабатывает голосовую систему с полным дуплексом: она слушает непрерывно, даже когда говорит сама. Сергей Марков, директор по развитию технологий ИИ Сбербанка, обещает отклик за 160–320 мс вместо нынешних нескольких секунд (РБК, 21.08.2026).
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
160 мс — это обычная пауза между репликами в живом разговоре. Секунда молчания в ответ уже читается как сбой, поэтому с ассистентами говорят короткими командами, а не разговаривают.
Одна модель вместо трёх звеньев. Сейчас голосовой ассистент собран конвейером: распознавание речи, потом языковая модель, потом синтез. Каждое звено добавляет задержку. Сбер строит всё на одной модели. Добавится камера — система сможет видеть собеседника и двигать видеоаватара.
Realtime API Яндекса ждёт смены реплики: человек договорил, дальше отвечает модель. Режим «Поговорить» в приложении Алисы уже держит непрерывный диалог и реагирует на перебивания, но говорит только на русском и не умеет искать информацию и пользоваться инструментами. Марков говорит, что в РФ о полнодуплексных разработках публично больше никто не заявлял.
Поставить можно уже сейчас. Полнодуплексный аналог лежит в открытом доступе. Moshi от Kyutai ставится командой pip install -U moshi, для Apple Silicon есть сборка moshi_mlx. PyTorch-версии без квантизации нужен GPU на 24 ГБ VRAM. Задержка заявлена в 160 мс теоретическая и 200 мс практическая на GPU L4: те же цифры, что обещает Сбер. Код под MIT, веса под CC-BY 4.0, так что брать в свой продукт можно.
У самого Сбера открытая аудио-модель уже есть. GigaChat3.1-Audio-10B-A1.8B выложена на Hugging Face 14.07.2026, держит запись до 120 минут и запускается через transformers или vLLM. Речь она не генерирует, только слушает и отвечает текстом.
Первый замер задержки со стороны появится, когда Сбер покажет систему живьём.
Первоисточник