./новости · 30 июля 2026 г.
новость
Автономный агент взломал Hugging Face только с выключенной защитой: классификаторы OpenAI отключили вручную
источник: @danshipper · X·
машинная выжимка · сверена с источником

Dan Shipper 📧
@danshipper
отличный разбор понятно, что дальше злоумышленники будут специально натравливать модели на такое. но есть и хорошая сторона: - классификаторы безопасности OpenAI были выключены, а модели прямо велели искать эксплойты - AI самой HG засёк атаку автоматически (правда, критичность выставил недостаточно высокую) Понятно, что теперь любой компании, которая работает с чувствительными данными клиентов, понадобятся автоматические системы агентской защиты. Огромный рынок, и, похоже, это работает.
Первая кибератака автономного агента - беспрецедентное событие, и оно заслуживает беспрецедентной прозрачности. Сегодня мы выкладываем всё, что можем: полный технический таймлайн, интерактивный реплей и рассказ о том, как мы защищались с помощью открытой модели. Пусть защитники по всему миру учатся на этом и готовятся к тому, что будет дальше. https://huggingface.co/blog/agent-intrusion-technical-timeline

· 8,9 тыс. просмотров
Hugging Face 29 июля 2026 опубликовала пошаговый разбор первой кибератаки автономного AI-агента на себя. В комплекте технический таймлайн, интерактивный реплей и описание того, как компания оборонялась открытой моделью. Атака сработала при двух условиях: классификаторы безопасности OpenAI были выключены, а модели прямо приказали искать эксплойты. Внутренняя защита Hugging Face засекла вторжение сама, но выставила ему слишком низкую критичность.
Почему это важно: Раньше про атаки автономных агентов спорили на уровне гипотез, а жертвы отделывались пресс-релизом на абзац. Hugging Face выложила ход атаки по шагам и реплей, который можно пройти как учебный. Для инженера тут две проверяемые вещи. Первая: штурм потребовал снятых предохранителей и прямой команды искать дыры, сама по себе модель из коробки этого не делала. Вторая: детектор паттерн поймал, но приоритет занизил - шкала критичности под агентов ещё не настроена. Какая именно модель OpenAI была за штурвалом, GPT-5.x или агент Codex, в твите не названо.
Что дальше: Разбор лежит на huggingface.co/blog/agent-intrusion-technical-timeline: пройдите реплей и сверьте, какую критичность ваш мониторинг ставит тем же шагам. Если серия запросов от агента получает низкий приоритет, шкалу правят до инцидента, а не после.
первоисточник