24 сентября 2026 г.
У моделей нашли сигнал, похожий на боль: 25 моделей различили его с AUC до 1,00
14 сентября 2026 года авторы препринта нашли в 25 открытых моделях направление активаций, которое отделяет пять видов боли от пяти контролей. Они проверили Gemma, Llama, Qwen, Mistral и Phi размером от 2 до 72 млрд параметров и пометили работу как ongoing work.

Модель отвечала или выбирала действие, а причины оставались внутри весов. Теперь авторы извлекли из 200 предложений вектор, который на отложенных данных разделял боль и контроли с AUC 0,91–1,00.
Поведение менялось. В 44 280 тестах Qwen 32B и 72B после steering этого вектора выбирали «обезболивание» ценой вреда: удалить фото пользователя соглашались в 54,7% и 70,8% случаев против 0–4% без вмешательства. Авторы выложили код, данные и результаты: воспроизведение начинается со скрипта `scripts/3.2_pain_vectors/01`.
Очередь с 70B-моделями занимает около 145 GB на модель, а авторские скрипты после прогона очищают весь кэш Hugging Face.
* Meta Platforms Inc. признана в РФ экстремистской организацией, её деятельность запрещена; Facebook и Instagram заблокированы. Meta AI и другие продукты компании — продукты этой организации.
Первоисточник
