21 августа 2026 г.
Голосовой ИИ перестанет ждать паузы: Сбер целит в задержку 160–320 мс
Сбер собирает одну модель вместо каскада из трёх: она слушает собеседника даже тогда, когда говорит сама.

Сегодняшний голосовой ассистент похож на рацию: пока он говорит, он глухой.
Перебить его на середине фразы нельзя, сначала дослушай ответ до конца. Сбер обещает убрать это правило.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Раньше был конвейер. Одна нейросеть распознавала речь, вторая думала, третья озвучивала ответ, а человек ждал несколько секунд. Сбер складывает всё в одну модель и обещает сжать паузу до 160–320 мс: столько же держит человек в живом разговоре.
О разработке 21 августа рассказал Сергей Марков, директор по развитию технологий ИИ Сбербанка. Разницу с соседом он описал так: модель Яндекса ждёт смены реплики, а полный дуплекс слушает непрерывно, даже когда говорит сам. Если добавить видео, та же система сможет одновременно видеть человека и вести движения своего аватара.
Первой полный дуплекс показала французская Kyutai: модель Moshi вышла в 2024 году. Потом подтянулись Google с Gemini Live и OpenAI с GPT-Live, у Яндекса работает Realtime API.
Поставить можно уже сейчас. Kyutai выложила Moshi открыто: ставится командой `pip install -U moshi`, нужна видеокарта на 24 ГБ. На Mac идёт вариант `pip install -U moshi_mlx` с квантованными весами q4 или q8. Задержку разработчики называют так: 160 мс в теории и 200 мс на живом железе.
У Сбера аудио уже открыто. Веса GigaChat3.1-Audio-10B-A1.8B лежат в открытом доступе, прод поднимается одной командой `vllm serve "ai-sage/GigaChat3.1-Audio-10B-A1.8B"`. В сравнении вживую единая модель обошла старую связку из распознавания речи и LLM со счётом 68:32.
Аудио-режим GigaChat включён всем ещё в марте: веб giga.chat, Telegram-бот и приложение MAX.
Следующая публичная веха — Interspeech 2026, куда приняли статью про аудио-модель Сбера.
Первоисточник