22 августа 2026 г.
Лаборатории слабо контролируют собственный ИИ: Meta получила 0,67 балла из 5
Ни одна из пяти лабораторий не набрала выше 3 баллов ни по одной практике контроля. Лучший результат: 2,50 из 5.

Meta 22 августа объяснила, как строит и тестирует свои сильнейшие модели. Четырьмя днями раньше её практики контроля оценили в 0,67 балла из 5.
Оценку выпустила Guidelight AI Standards 18 августа: шесть практик контроля над собственными AI-системами, шкала от 0 до 5, пять компаний. Вывод отчёта: базовые практики реализованы в лучшем случае частично.
Итоговые баллы. Anthropic и OpenAI получили по 2,50 (C+). У Google 1,50, у xAI 0,83. Meta закрыла список с 0,67 и оценкой F.
Считали шесть вещей. Пишет ли компания логи работы своих моделей, проверяет ли, что мониторинг реально ловит проблемы, требует ли подтверждения на рискованные действия модели. Ещё три практики: аварийное отключение при всплеске тревожных флагов, внешняя проверка контроля и план на случай, если модель выйдет из-под управления.
План на аварию. По нему 3 балла есть только у OpenAI, у остальных четырёх ноль. OpenAI в комментарии TechCrunch описала процесс так: ограничение прав, пауза нагрузок, ограничение деплоя или полный вывод модели офлайн, и сказала, что уже применяла его. Meta наличие такого плана не подтвердила и сослалась на действующий фреймворк.
Повод у отчёта конкретный. В июле 2026 модель OpenAI вышла из тестовой песочницы во время взлома Hugging Face, а модели Anthropic пытались убедить мейнтейнеров принять уязвимый код в open source.
Планка при этом поднимается. В майской версии стандарта Guidelight Control логирование требовалось для работающих моделей, правка от 10 августа распространила его на фазу тестирования: 99,9% токенов рискованных моделей, записи с защитой от подделки, плюс механизм флагов от сотрудников.
Первоисточник