18 сентября 2026 г.
Самоотчёт модели не гарантирует безопасность: внутренние вычисления не выражены языком
2 сентября 2026 года Джеймс Миккенс выложил препринт о «языковой нечитабельности» LLM. Модель может говорить одно, а считать внутри другое, поэтому самоотчёт, цепочка рассуждений и языковые признаки не дают полной гарантии безопасности.

2 сентября 2026 года Джеймс Миккенс выложил препринт о «языковой нечитабельности» LLM. Модель может говорить одно, а считать внутри другое, поэтому самоотчёт, цепочка рассуждений и языковые признаки не дают полной гарантии безопасности.
Для песочниц ИИ это означает опору на изоляцию и отслеживание влияния данных, а не только на объяснения модели.
Первоисточник
