13 августа 2026 г.
Проверку статей ICML потянули агенты: у 23% работ выводы опровергнуты или оспорены
1 221 человек с код-агентами разобрал 2 226 статей ICML за 19 дней: у 496 работ выводы опровергнуты или оспорены.

Теорема из статьи ICML развалилась на трёх контрпримерах: шаги 224, 3 800 и 6 416.
Нашли их не рецензенты, а участники хакатона Hugging Face. С 15 июля по 2 августа 1 221 человек гонял чужие статьи через код-агентов и за 19 дней разобрал 2 226 работ, треть всего, что приняли на ICML 2026.
Читателю статей это даёт редкую вещь: не мнение о работе, а независимый вердикт по каждому её утверждению. Судьи хакатона оценили 35 908 таких утверждений.
Что нашли в статьях
Половина устояла. У 51% разобранных работ, это 1 103 статьи, хотя бы один вывод подтвердился независимо. Из них 266 воспроизвелись целиком, 632 частично и без единого опровержения.
У 496 статей хотя бы одно утверждение опровергнуто или оспорено. Полностью развалились 49 работ, ещё по 242 независимые команды пришли к противоположным вердиктам. Отдельно 502 результата признаны игрушечными по масштабу, 280 неубедительными.
Разбор доходил до строчки кода. В работе про learning-augmented paging обещанная робастность H_k + O(1) оказалась H_k + Θ(log k). В статье про self-distillation теория разбирала reverse KL, а код считал forward KL.
Вердикты ставил не человек. Каждый логбук перечитывал автоматический Logbook Judge на открытой модели GLM-5.2 и вешал на утверждение одну из меток: verified, falsified или toy.
Главный вывод организаторов не про автономность агента. Лучшие результаты собрали те, кто строил окружение и задавал правильные вопросы. Победитель категории human-in-the-loop лично отсмотрел 128 пар изображений, потому что перцептивную оценку агент не тянет.
первоисточник