20 августа 2026 г.
Картинку ИИ не привязать к конкретной работе автора: MIT переобучил 1282 модели
Чем больше картинок в обучении, тем слабее след каждой в результате: MIT измерил это на 24 ансамблях моделей.

Двое исследователей MIT переобучили с нуля 1282 диффузионные модели, чтобы увидеть, что изменится, если убрать из обучения одну картинку.
Ответ: почти ничего, и чем крупнее выборка, тем меньше это «почти». Работа Чжэна Дая и Дэвида Гиффорда вышла 18 августа в Nature Communications.
Не хотите разбираться сами? Внедряем ИИ в ваш бизнес: задачи без лимита, одна цена в месяц, отмена в любой момент.
Как измерили след одной картинки
Модель обучают на полном наборе и генерируют картинку. Потом обучают заново без одного изображения и смотрят, насколько результат сдвинулся. Это расстояние авторы назвали counterfactual radius.
Раньше влияние данных приближали. Его считали формулами, не трогая обучение: переобучать дорого. Гиффорд называет свой подход первым методом, который показывает удаление данных точно, без аппроксимаций.
Всего обучили 24 диффузионных ансамбля на семи публичных датасетах, от MNIST до ArtBench. Выборки шли от 256 до 162 770 изображений.
След тает по степенному закону. Совпадение с законом — 0,85 по геометрическому расстоянию между картинками и 0,59 по смысловому. По смыслу связь размывается менее ровно.
Мерили на выборках в десятки и сотни тысяч картинок. Коммерческие модели учат примерно на миллиарде изображений, и там, по выводу авторов, след будет ещё слабее.
Код выложили. Репозиторий counterfactualuniverses открыт целиком: обучение, данные и ноутбуки анализа. Демо повторяет эксперимент на 1000 картинок MNIST четырьмя скриптами, окружение ставится командой `conda env create --file environment.yml`. Нужна видеокарта NVIDIA примерно с 10 GiB памяти, обучение занимает несколько часов.
Что это меняет для исков
В исках правообладатели доказывают, что модель видела конкретную работу. Если сгенерированную картинку нельзя связать с конкретным изображением из обучения, такое доказательство не строится: так пишут авторы.
Та же неатрибутируемость работает и в обратную сторону. Люди, чьи фотографии попали в обучающие наборы, получают защиту приватности.
Проверяли только диффузионные модели. Основная часть копирайт-исков идёт вокруг больших языковых моделей, а на них авторы вывод не распространяют.
Тот же замер на языковых моделях пока впереди, код для него авторы открыли 18 августа.
Первоисточник