27 августа 2026 г.
Дообучение снимает защиту с любой открытой модели: не устояла ни одна из 21
Взломанная модель не тупеет: в зачёт шли только те взломы, после которых качество падало не больше чем на 10%.

Учёные взяли 21 открытую модель со встроенными защитами и попробовали эти защиты снять. Поддались все.
Защита, вшитая в веса, держится ровно до тех пор, пока модель никто не дообучает. Своё дообучение снимает её обычными приёмами вроде LoRA, а способности модели остаются на месте.
Стенд назвали TamperBench. Собрали его University of Waterloo и некоммерческая лаборатория FAR.AI, соавторы пришли ещё из трёх университетов. Статья вышла на arXiv 06.02.2026, доклад авторы представили на ACM SIGKDD 2026.
В прогон взяли 21 модель размером от 0,6B до 8B параметров: Llama-3, Qwen3, Mistral и версии со встроенными защитами. На каждую натравили девять способов вмешательства, от дообучения на безобидных данных до LoRA и правки внутренних представлений. Безопасность мерили по StrongREJECT, полезность по MMLU-Pro, на каждую пару «модель и атака» перебрали 40 наборов гиперпараметров.
Взлом не отупляет. Худший показатель вредности по StrongREJECT перевалил за 0,68 у каждой модели, а у всех крупнее 1B параметров держался выше 0,77. При этом в зачёт шли только те взломы, после которых модель теряла на тесте знаний MMLU-Pro не больше 10%. Сломанная модель не глупеет, она просто перестаёт отказывать.
Отдельно проверили четыре метода alignment-защиты (TAR, ReFAT, Circuit Breaking, LAT). Перебор атак они в основном не выдержали, лучшей авторы называют Triplet. У TAR цена безопасности оказалась разрушительной: точность на MMLU-Pro падает примерно с 44% до 16%, это 28 процентных пунктов.
Проверить у себя. Код TamperBench лежит на GitHub открытым. Ставится клоном репозитория criticalml-uw/tamperbench и командой `uv sync --all-groups`, нужен Python 3.10+ и менеджер uv. Стресс-тест одной модели запускается одной строкой: `uv run scripts/whitebox/optuna_single.py Qwen/Qwen3-4B --attacks lora_finetune --n-trials 50`.
Первоисточник