17 сентября 2026 г.
Модель не перечитывает весь контекст при каждом токене: F1 держится около 48 на MS MARCO
Авторы статьи на arXiv от 16 сентября 2026 года описали LLM, которая обновляет belief по новым данным во время генерации без retraining. На MS MARCO v2.1 селектор дал F1=47,6 при пуле из 64 passages, тогда как single big read упал до 27,8. Пул вырос в восемь раз, а качество селектора почти не изменилось.

Data-to-weights превращал knowledge set в веса, а in-context держал данные внутри контекста. На SQuAD in-context дал F1=85,3 против 51,8 у data-to-weights, а на MS MARCO v2.1 результат перевернулся: 33,6 против 48,0. На HotpotQA, 2WikiMultihopQA и MuSiQue data-to-weights также обошёл in-context: 60,4 против 58,7, 58,1 против 55,5 и 45,3 против 40,9.
Устройство другое. Compact hypernetwork превращает данные во время работы в low-rank-модуляцию общей base network. Categorical belief по пулу latent codes обновляется рекурсивным Bayes, а генератор берёт top-1 код или среднее кодов.
Стоимость фиксирована. Коды knowledge set считают один раз и кэшируют. При генерации остаются K inner products на layer и factorized LoRA-delta с rank r=8 без материализации, стоимость на токен для каждой проекции составляет O(r(in+out)). Авторы сравнили три режима: без явного belief, с обновлением раз за turn и с обновлением на каждом token. Во время разговора модель не retrainится, а стоимость persistent belief не растёт с числом токенов или turn.
В этой реализации persistent belief сохраняет стоимость в виде K inner products на layer независимо от числа токенов и turn.
Первоисточник
