31 августа 2026 г.
Ловить галлюцинации моделей стало дешевле: метод Сколтеха и Сбера в 7 раз быстрее SelfCheckGPT
TOHA ищет выдумку в картах внимания уже готового ответа и не переспрашивает модель заново: проверка выходит в 7 раз быстрее SelfCheckGPT.

Чтобы поймать модель на выдумке, её обычно заставляют ответить ещё десять раз подряд.
Так устроен SelfCheckGPT: одна проверка стоит десяти ответов, а то и двадцати. Александра Базарова, Сергей Баранников и Алексей Зайцев из Сколтеха вместе с Андреем Савченко из Сбера предложили не переспрашивать вовсе.
TOHA (TOpology-based HAllucination detector) читает карты внимания того ответа, который модель уже выдала, и ищет в их геометрии след того, что ответ не опирается на контекст. Дополнительных генераций ноль. Работу напечатали в трудах ACL 2026 в июле, у статьи 13 авторов.
Скорость. TOHA примерно в 7 раз быстрее SelfCheckGPT с одной дополнительной генерацией и больше чем в 70 раз быстрее стандартного варианта с 10–20 генерациями. Хватает 10 голов внимания.
Точность при этом выше. На SQuAD с LLaMA-2-7B TOHA даёт AUROC 0,87 против 0,57 у max entropy. На MS MARCO с Mistral-7B получилось 0,76 против 0,63 у SelfCheckGPT. В этой шкале 0,5 означает угадывание монеткой. Прогнали на 5 открытых моделях и 5 бенчмарках, плюс HotpotQA на многошаговых вопросах.
Разметки нужно мало. Даже на 50 размеченных примерах качество почти не падает, а от роста выборки дальше почти не растёт.
Раньше и теперь. Агент, отвечающий по своей памяти, попадал в правильный ответ в 62,4% случаев. Два селективных гейта SIRIN подняли планку до 79,3%, а долю ответов с прямым противоречием источнику срезали с 20,2% до 9,8%. Без единой лишней генерации.
Поставить можно сегодня. Метод уже встроен в открытую библиотеку SIRIN: `pip install -e '.[ui]'`, Python 3.11+, лицензия Apache 2.0, код у sb-ai-lab на GitHub. Веб-демо SIRIN лежит на Hugging Face Spaces, ставить ничего не нужно.
Первоисточник