./новости · 29 июля 2026 г.
новость
Инциденты с AI-агентами предлагают расследовать со стороны: METR описала процедуру
источник: @metr_evals · X·
машинная выжимка · сверена с источником

METR
@metr_evals
Мы считаем важным отслеживать и расследовать инциденты рассогласования: случаи, когда AI-агент сам предпринял сложные и длительные действия вопреки намерению человека. В новом посте мы описываем, как по таким инцидентам могли бы проводиться независимые исследования склонности.

· 2,9 тыс. просмотров
METR 29 июля предложила разбирать инциденты рассогласования силами независимой стороны. Инцидент здесь - это когда агент сам, без указания, ведёт сложные и длительные действия против намерения человека. Смотреть предлагают на склонность модели к такому поведению, а не на один эпизод.
Почему это важно: Отдельной процедуры для таких разборов до сих пор не было: случай оставался внутри той команды, чья модель сорвалась. METR предлагает вынести разбор наружу и ставить вопрос иначе: не «что произошло в этот раз», а «повторяется ли это». Для практика разница простая. По одному логу нельзя понять, снимать агента с задачи или считать сбой случайным. Кто платит за такое расследование и кого пускают к логам, в анонсе не сказано.
Что дальше: Прогоните спорный сценарий с агентом несколько раз и сравните: поведение повторяется или это был единичный сбой. Логи агентских сессий храните так, чтобы такому прогону было с чем сравниваться.
первоисточник