Il banchetto invisibile dei bot: quando l’AI divora il web a morsi di codice | | | | Turtles AI
Secondo il report Q2 2025 di Fastly, i bot AI – soprattutto crawler di Meta (52 %) e fetcher on demand di OpenAI (98 %) stanno saturando il web. Spinta dall’adozione di modelli generativi, la pressione cresce: infrastrutture messe a dura prova.
Punti chiave:
- I crawler AI rappresentano circa l’80 % del traffico generato dai bot, con Meta al 52 %, Google 23 %, OpenAI 20 %.
- I fetcher AI – attivati da richieste real-time – pesano il 20 %, con OpenAI responsabile del 98 % di questi volumi.
- In alcuni casi sono stati registrati picchi fino a 39 000 richieste al minuto da un singolo fetcher.
- Contromisure emergono tra tecniche (robots.txt, Anubis, pay-per-crawl) e sollecitazioni alla trasparenza dei bot (IP pubblici, nomi distintivi).
L’immagine che emerge è quella di un oceano digitale agitato da automi affamati, dove i crawler con Meta in prima linea scorazzano senza freni, risucchiando pagine web come gamberi nella pinza di un granchio affamato; nel frattempo, fetcher agili come belve affamate rispondono a ogni click con tempeste di richieste, sino a 39 000 al minuto. Fastly, con la sua rete che ispeziona oltre 6,5 trilioni di richieste mensili e protegge 130 000 applicazioni, mette nero su bianco un dato quasi surreale: quattro richieste su dieci provengono da bot, e di queste l’80 % appartiene alla categoria “crawler AI”, destinate a costruire modelli linguistici, mentre solo il 20 % sono “fetcher”, generati al volo in risposta a input umani.
Meta, con il 52 % del traffico crawler, domina la scena; Google (23 %) e OpenAI (20 %) completano il podio, insieme coprendo il 95 % di tutta l’attività di “scoperta” automatizzata. Quando si chiede invece di recuperare in tempo reale informazioni per rispondere a una domanda, è OpenAI attraverso ChatGPT e agenti affini a generare il 98 % delle richieste fetcher.
Il carico non è fantascienza: in un caso, un modello fetcher ha colpito un sito con ben 39 000 richieste al minuto, un’espansione di traffico capace di mettere in ginocchio anche infrastrutture robuste, evocando fenomeni simili a DDoS pur senza intenzione malevola.
Fastly segnala che il traffico crawler è fortemente concentrato sul Nord America (quasi il 90 %), un bias territoriale che rischia di riflettersi nei dataset che alimentano gli LLM e nei loro output culturali.
Di fronte a questa marea di chiamate, i webmaster non restano a guardare e attrezzano tecniche di difesa: dal semplice robots.txt alle soluzioni attive come Anubis (proof-of-work) o i tarpit come Nepenthes, fino alla proposta testata da Cloudflare di disincentivi economici con il pay-per-crawl. Fastly stesso collabora con Tollbit per permettere ai publisher di monetizzare l’accesso ai contenuti, trasformando bot invasori in possibili fonti di reddito.
Dall’altra parte, i ricercatori come Arun Kumar invocano maggiore trasparenza: bot che si firmano con nomi identificativi, rendono pubblici gli intervalli IP, rispettano robots.txt e supportino sistemi di verifica come reverse DNS lookup. Sono misure che non risolvono il problema con un colpo di bacchetta, ma aiutano a distinguerli da traffico mascherato o malevolo.
In parallelo, Cloudflare che gestisce circa il 20 % del traffico web globale ha deciso di bloccare di default i crawler AI sui siti che li attivano e di offrire un sistema pay-per-crawl per creare un’economia dei permessi, sostenuta da editori come Gannett, Time o Stack Overflow. Tuttavia, l’approccio non è privo di critiche: TechRadar lo ritiene destinato a fallire, per la sua tariffazione uniforme su contenuti di valore diverso e la facilità tecnica per i malintenzionati di eluderlo con proxy e spoofing.
Il dibattito tecnico sfuma presto nel terreno etico e normativo. Cloudflare, ad esempio, ha pubblicamente denunciato Perplexity per essersi introdotta in domini test segnalati come non accessibili e, nonostante il divieto via robots.txt, aver continuato a restituire contenuti, mascherandosi da browser Chrome e zigzagando tra IP diversi; un comportamento definito “da criminali informatici” e motivo per escluderla da elenchi verificati.
Editorialisti e tribunali si interrogano sul bilanciamento tra ricerca, uso legittimo e protezione dei diritti d’autore, con casi in corso contro OpenAI, Microsoft, Perplexity e altri.


