21 августа 2026 г.
Ассистент перестанет ждать паузу в речи: Сбер обещает ответ за 160–320 мс
Сбер строит голосовую модель, которая слушает и говорит одновременно: ответ приходит за 160–320 мс вместо нескольких секунд.

Робот на том конце провода больше не дослушивает фразу до конца. Сбер учит модель отвечать, не дожидаясь, пока ты замолчишь.
За 160–320 мс отвечает живой собеседник в телефонном разговоре. Пока держится эта скорость, разговор с машиной не превращается в диктовку автоответчику.
Раньше и теперь. Голосом до сих пор занимался конвейер из трёх нейросетей: одна расшифровывала речь в текст, вторая придумывала ответ, третья озвучивала его. Сбер собрал одну модель, которая работает со звуком напрямую и не выключает слух, пока говорит сама.
Не то же, что у Яндекса. Сергей Марков, директор по развитию технологий ИИ Сбербанка, называет сберовскую разработку первой российской полнодуплексной. У Яндекса есть Realtime API, он отвечает быстро и умеет перебивать, но по-прежнему ждёт конца реплики.
За рубежом такие модели уже работают: Moshi от французской Kyutai вышла в 2024 году, полный дуплекс держат Gemini Live у Google и GPT-Live у OpenAI.
Потрогать можно сегодня. Голосовой режим уже работает в приложении GigaChat из RuStore бесплатно: жмёшь кнопку голосового чата, и разговор идёт как обычный звонок. Режим в бете, картинки в нём не генерируются.
Аудио-модель, на которой строится подход, Сбер выложил 21 июля 2026 года на Hugging Face под свободной лицензией MIT, так что поднять её можно у себя. GigaChat3.1-Audio-10B-A1.8B стартует двумя командами: `pip install vllm` и `vllm serve "ai-sage/GigaChat3.1-Audio-10B-A1.8B"`. Модель слушает аудио без перевода в текст, тянет записи до 120 минут и понимает русский и английский.
Первоисточник