21 августа 2026 г.
Голосовой ИИ перестанет ждать паузы: Сбер целит в задержку 160–320 мс
Сбер собирает одну модель вместо каскада из трёх: она слушает собеседника даже тогда, когда говорит сама.

Сегодняшний голосовой ассистент похож на рацию: пока он говорит, он глухой.
Перебить его на середине фразы нельзя, сначала дослушай ответ до конца. Сбер обещает убрать это правило.
Раньше был конвейер. Одна нейросеть распознавала речь, вторая думала, третья озвучивала ответ, а человек ждал несколько секунд. Сбер складывает всё в одну модель и обещает сжать паузу до 160–320 мс: столько же держит человек в живом разговоре.
О разработке 21 августа рассказал Сергей Марков, директор по развитию технологий ИИ Сбербанка. Разницу с соседом он описал так: модель Яндекса ждёт смены реплики, а полный дуплекс слушает непрерывно, даже когда говорит сам. Если добавить видео, та же система сможет одновременно видеть человека и вести движения своего аватара.
Первой полный дуплекс показала французская Kyutai: модель Moshi вышла в 2024 году. Потом подтянулись Google с Gemini Live и OpenAI с GPT-Live, у Яндекса работает Realtime API.
Поставить можно уже сейчас. Kyutai выложила Moshi открыто: ставится командой `pip install -U moshi`, нужна видеокарта на 24 ГБ. На Mac идёт вариант `pip install -U moshi_mlx` с квантованными весами q4 или q8. Задержку разработчики называют так: 160 мс в теории и 200 мс на живом железе.
У Сбера аудио уже открыто. Веса GigaChat3.1-Audio-10B-A1.8B лежат в открытом доступе, прод поднимается одной командой `vllm serve "ai-sage/GigaChat3.1-Audio-10B-A1.8B"`. В сравнении вживую единая модель обошла старую связку из распознавания речи и LLM со счётом 68:32.
Первоисточник