29 июля 2026 г.
Инциденты с AI-агентами предлагают расследовать со стороны: METR описала процедуру
METR 29 июля предложила разбирать инциденты рассогласования силами независимой стороны. Инцидент здесь - это когда агент сам, без указания, ведёт сложные и длительные действия против намерения человека. Смотреть предлагают на склонность модели к такому поведению, а не на один эпизод.

METR
@metr_evals
Мы считаем важным отслеживать и расследовать инциденты рассогласования: случаи, когда AI-агент сам предпринял сложные и длительные действия вопреки намерению человека. В новом посте мы описываем, как по таким инцидентам могли бы проводиться независимые исследования склонности.

· 56,9 тыс. просмотров
Почему это важно: Отдельной процедуры для таких разборов до сих пор не было: случай оставался внутри той команды, чья модель сорвалась. METR предлагает вынести разбор наружу и ставить вопрос иначе: не «что произошло в этот раз», а «повторяется ли это». Для практика разница простая. По одному логу нельзя понять, снимать агента с задачи или считать сбой случайным. Кто платит за такое расследование и кого пускают к логам, в анонсе не сказано.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Что дальше: Прогоните спорный сценарий с агентом несколько раз и сравните: поведение повторяется или это был единичный сбой. Логи агентских сессий храните так, чтобы такому прогону было с чем сравниваться.
Первоисточник