21 августа 2026 г.
Каждая десятая страница в интернете похожа на текст ИИ: Pew проверил 490 000 адресов
Среди страниц, вышедших после запуска ChatGPT, признаки машинного текста нашлись у 35%.

Pew Research Center прогнал через детектор 490 000 англоязычных страниц: признаки машинного текста нашлись у каждой десятой.
Треть свежего веба выглядит машинной. Среди страниц, опубликованных после запуска ChatGPT в ноябре 2022 года, детектор отметил 35%.
Выборку собрали из 49 сканирований архива Common Crawl с января 2021 по июль 2026 года, по 10 000 случайных страниц из каждого. Признаком ИИ-авторства Pew считал оценку 0,2 и выше по шкале детектора от 0 до 1.
Разброс по зонам. В .com признаки ИИ нашлись примерно у 10% страниц, в .org у 4,6%, в .edu и .gov около 1%.
Раньше и теперь. На 10 000 слов длинные тире встречались 5,79 раза в 2023 году и 11,19 раза в 2026-м. Оксфордская запятая (та, что в английском перечислении стоит перед последним элементом) прибавила 63%, а типичная для моделей лексика выросла вдвое. Сами по себе эти приметы машинного авторства не доказывают.
Детектор лежит открыто. Open Pangram выложен на HuggingFace открытыми весами: модель на 3 млрд параметров и модель на 355 млн, обе запускаются на MacBook, код в репозитории EditLens. Лицензия некоммерческая, и сам Pangram просит не проверять этим людей на соблюдение ИИ-политик.
Отдельный текст детектор не судит: вывод Pew про статистику больших массивов, а не про конкретную статью. Замер Graphite насчитал среди новых публикаций почти половину машинных, при этом в выдаче Google и в ссылках ИИ-сервисов чаще попадаются написанные людьми.
Первоисточник