./новости · 24 июля 2026 г.
новость
Память ассистента на русском теперь есть чем мерить: Сбер собрал бенчмарк RUMBA
источник: Хабр·
машинная выжимка · сверена с источником
Сбер 24 июля 2026 показал RUMBA - Russian User Memory Benchmark, набор для проверки долгосрочной памяти диалоговых систем на русском. Бенчмарк проверяет пять вещей: помнит ли система неизменные факты о пользователе, обновляет ли устаревшие, как разрешает противоречия, удаляет ли данные по запросу и понимает ли, когда событие произошло. Сценарии - многосессионные разговоры, а не одиночные вопросы.
Почему это важно: Память обычно не свойство самой модели. Её навешивают слоем вокруг LLM: RAG с долговременным хранилищем, векторные и графовые базы, профили пользователя, журналы событий, агентные схемы вроде локальной файловой системы в духе Obsidian с вызовом инструментов. Значит, качество памяти задаёт архитектура сборки, а не размер модели. Раньше на русском такой сборке нечего было предъявить: по словам самого Сбера, бенчмарка именно под эти аспекты не хватало. Теперь есть общий набор сценариев, на котором две разные сборки сравнимы между собой. Где взять данные и будет ли лидерборд, в анонсе не сказано.
Что дальше: Смотреть, выложат ли сам набор и таблицу результатов - без этого сравнивать свою сборку не с чем. Пока можно проверить свой memory-слой руками по тем же пяти пунктам: неизменные факты, обновление устаревшего, противоречия, удаление по запросу, время события.
первоисточник