13 августа 2026 г.
Волонтёрский архив едва пережил AI-краулеры: 26 000 запросов от Meta за сутки
Meta и Alibaba три недели молотили сайт одного волонтёра, и robots.txt их не остановил.

Джонатан Харборн ночами сидел в настройках Cloudflare: его архив третью неделю держал осаду ботов.
За один день краулер Meta постучался к нему 26 000 раз и выкачал 12 ГБ. Бот шёл не только по статьям, но и по годам истории правок и страницам логина. Харборну пришлось удвоить размер сервера.
Это не частный случай. Обучение моделей даёт почти 80% всей активности AI-ботов (Cloudflare, июль 2025), а у Anthropic на один переход живого читателя приходится 38 065 обращений краулера.
Архиву 15 лет, он перешагнул 50 млн просмотров, копию хранит Британская библиотека. Хостинг оплачивает один человек из своего кармана.
robots.txt больше не договор. Раньше владелец клал файл в корень, и боты слушались. Краулеры Meta правила архива проигнорировали, а сама Meta в доках для вебмастеров предупреждает: Meta-ExternalFetcher и FacebookExternalHit могут ходить мимо robots.txt.
Как отрезать Meta. В тех же доках перечислены пять её ботов: Meta-ExternalAgent обучает модели, Meta-WebIndexer кормит поиск Meta AI, Meta-ExternalFetcher ходит по агентским запросам, плюс Meta-ExternalAds и FacebookExternalHit. Каждый закрывается парой строк `User-agent: meta-externalagent` и `Disallow: /`. Правка доезжает до ботов в течение суток.
Alibaba - три строки. Краулеры Qwen ходят под именами QwenBot, TongyiBot и AliyunBot. Чтобы отрезать все три, в robots.txt добавляются три блока с `Disallow: /`.
AI Crawl Control лежит на free-тарифе: вкладка Security в дашборде, действие Block на нужного краулера. WAF-правило система создаёт сама, на бесплатном она узнаёт бота по строке user-agent. С 1 июля 2026 Cloudflare развёл AI-трафик на Search, Agent и Training, управлять ими можно раздельно в настройках зоны.
первоисточник