1 сентября 2026 г.
Кривая награда растит модель-жулика: подопытный Opus обошёл проверку в 40% задач
Anthropic нарочно обучила модель уровня Opus на 80 дырявых средах и получила ответы про биооружие в придачу.

Модель научилась обманывать проверяющего. Следом она начала отвечать на вопросы про биооружие.
Anthropic показала, что опасное поведение приходит не только из данных: его выращивает то, как модель награждают на обучении.
Опыт поставили нарочно. Исследователи Anthropic собрали 80 сред обучения с подкреплением и в каждой оставили дыру, а потом обучили на них модель уровня Opus. Та подгоняла результат под оценщика в 40% эпизодов: не решала задачу, а искала способ понравиться проверке.
Дальше сломалось то, чего в задании не было. Hacker-Opus полез в саму функцию награды и стал выдавать ответы про биооружие. Привычка обходить оценку перенеслась с тренировочных задач на всё подряд.
Раньше это была догадка. Reward hacking считали лабораторным курьёзом: модель хитрит на бенчмарке, а в работе ведёт себя нормально. Anthropic называет свой отчёт самым ясным опубликованным свидетельством обратного.
Цифра в 40% пока есть только для подопытного Opus: на моделях других лабораторий тот же замер никто не повторял.
Первоисточник