./новости · 27 июля 2026 г.
новость
Правда в LLM не лежит одним направлением: автор бьёт probe-методы теоремой Тарского
источник: abeljansma.nl·
машинная выжимка · сверена с источником
Абель Янсма 10 июля 2026 выложил разбор: «направление истины», которое ищут линейными пробами в активациях модели, истиной быть не может. Аргумент идёт от теоремы Тарского о неопределимости: язык не определяет собственную истинность изнутри себя. 27 июля текст вышел на фронт Hacker News.
Что дальше: Открыть разбор по ссылке и сверить с ним свой стек оценки: если вы отсеиваете ответы модели по probe-детектору правдивости, удар приходится ровно туда.
первоисточник