23 сентября 2026 г.
ИИ-агенты смогут принимать новые данные во время ответа: AsyncReasoning ускоряет отклик до 12 раз
23 сентября Yandex Research показала AsyncReasoning: в крайних сценариях метод сократил воспринимаемую задержку до 12 раз. Время до первого видимого токена уменьшилось до 80 раз. Метод работает без дополнительного обучения модели.

Раньше последовательная LLM сначала заканчивала рассуждение, а новые кадры камеры или результат инструмента ждали следующего запуска. Теперь AsyncReasoning разделяет ввод, скрытое рассуждение Thinker и видимый ответ Writer. Thinker может остановить Writer, принять свежие данные и скорректировать ответ.
Без переучивания. Метод использует positional embeddings и манипуляции с KV-кешем вместо дообучения. Яндекс разрабатывает общий async I/O-фреймворк в SGLang и собственные GPU-kernels. Демо Qwen3.5, играющей в Doom по непрерывному видеопотоку, тоже находится в разработке.
Команда продолжает разрабатывать общий async I/O-фреймворк в SGLang и собственные GPU-kernels.
Первоисточник
