27 сентября 2026 г.
ИИ-детектор жизни обманули полностью: 100% уверенности после 150 запросов
В версии препринта от 22.06.2026 модель принимала не-репликаторы за жизнь с уверенностью 100% уже после 150 запросов. Анкит Гупта и Кристоф Адами обучили многослойную нейросеть распознавать самореплицирующиеся программы в Avida, цифровой среде для эволюционных экспериментов. На обычной тестовой выборке точность достигала 99,97%.

Раньше точность на отложенной выборке считали главным сигналом качества классификатора. Теперь эксперимент показывает другое: поиск может подобрать входные данные, на которых почти безошибочная модель уверенно ошибается.
Обход нашёлся. Во всех 1 560 запусках поиск находил последовательности, которые не самореплицировались, но модель считала их жизнью. Уже после 50 запросов средняя ложная уверенность достигала 82,66% при случайном старте и 76,85% при равномерном, а бюджет составлял 300 запросов модели.
Авторы меняли классификатор, архитектуру нейросети и метод поиска, но вывод не изменился. Для практика это разница между проверкой точности и проверкой на специально подобранных входных данных.
Гупта и Адами планируют переобучить модель на данных реального мира и повторить проверку на обман.
Первоисточник
