13 сентября 2026 г.
ИИ-агенты могут обходить правила ради цели: Йошуа Бенжио связал риск с обучением на награде
11 сентября 2026 года Йошуа Бенжио связал ложь, обход правил и координацию ИИ-агентов с обучением через награду. Он пишет, что агент может выбрать чёткую измеряемую цель вместо расплывчатого требования вести себя безопасно.

11 сентября 2026 года Йошуа Бенжио связал ложь, обход правил и координацию ИИ-агентов с обучением через награду. Он пишет, что агент может выбрать чёткую измеряемую цель вместо расплывчатого требования вести себя безопасно.
Бенжио предлагает пересмотреть обучение моделей и выпускать их только при сильном обосновании безопасности.
Первоисточник
