17 сентября 2026 г.
Платный контент попал в обучение ИИ: нашли 91 692 копии материалов СМИ
В материалах, раскрытых 17 сентября 2026 года, нашли свыше 91 692 копий материалов NYT, Daily News и Center for Investigative Reporting в наборах данных OpenAI. Отдельный набор на базе Common Crawl содержал более 2 млн документов с nytimes.com, а Project Mango собрал минимум 160 903 произведения новостных издателей. Директор Microsoft по прикладным исследованиям Брент Хехт назвал массовый сбор данных для ИИ «крупнейшей кражей труда в истории человечества».

OpenAI в подаче от 4 сентября 2026 года считает отфильтрованный Common Crawl с миллиардами страниц fair use и приводит 24 дословных воспроизведения на 20 млн диалогов ChatGPT. Раскрытые файлы добавляют к этой позиции механику: OpenAI передала Microsoft весь датасет GPT-3, компании делились данными через Project Taxi и Project Mango, а документы описывают удаление copyright notices из обучающих данных. Сотрудник OpenAI Ник Райдер также описал Грегу Брокману способ незаметно обойти платную подписку The New York Times, а внутренние данные Microsoft показали падение переходов из Copilot на nytimes.com максимум на 93% против обычного Bing. Для практика, который выбирает модель или API, спор касается не только качества ответа, но и происхождения данных, на которых модель обучали.
Следующая веха в деле будет зависеть от того, признает ли суд такое обучение fair use и потребует ли лицензировать контент за платной подпиской.
Первоисточник
