Il banchetto invisibile dei bot: quando l’AI divora il web a morsi di codice | | | | Turtles AI

Il banchetto invisibile dei bot: quando l’AI divora il web a morsi di codice
Crawler famelici e fetcher iperveloci trasformano la rete in un’arena digitale dove pochi giganti accumulano dati e i siti arrancano tra sovraccarichi, contromisure creative e richieste di regole mai scritte
Editorial Team21 agosto 2025

 


Secondo il report Q2 2025 di Fastly, i bot AI – soprattutto crawler di Meta (52 %) e fetcher on demand di OpenAI (98 %)  stanno saturando il web. Spinta dall’adozione di modelli generativi, la pressione cresce: infrastrutture messe a dura prova.

Punti chiave:

  • I crawler AI rappresentano circa l’80 % del traffico generato dai bot, con Meta al 52 %, Google 23 %, OpenAI 20 %.
  • I fetcher AI – attivati da richieste real-time – pesano il 20 %, con OpenAI responsabile del 98 % di questi volumi.
  • In alcuni casi sono stati registrati picchi fino a 39 000 richieste al minuto da un singolo fetcher.
  • Contromisure emergono tra tecniche (robots.txt, Anubis, pay-per-crawl) e sollecitazioni alla trasparenza dei bot (IP pubblici, nomi distintivi).

L’immagine che emerge è quella di un oceano digitale agitato da automi affamati, dove i crawler  con Meta in prima linea  scorazzano senza freni, risucchiando pagine web come gamberi nella pinza di un granchio affamato; nel frattempo, fetcher agili come belve affamate rispondono a ogni click con tempeste di richieste, sino a 39 000 al minuto. Fastly, con la sua rete che ispeziona oltre 6,5 trilioni di richieste mensili e protegge 130 000 applicazioni, mette nero su bianco un dato quasi surreale: quattro richieste su dieci provengono da bot, e di queste l’80 % appartiene alla categoria “crawler AI”, destinate a costruire modelli linguistici, mentre solo il 20 % sono “fetcher”, generati al volo in risposta a input umani.

Meta, con il 52 % del traffico crawler, domina la scena; Google (23 %) e OpenAI (20 %) completano il podio, insieme coprendo il 95 % di tutta l’attività di “scoperta” automatizzata. Quando si chiede invece di recuperare in tempo reale informazioni per rispondere a una domanda, è OpenAI  attraverso ChatGPT e agenti affini  a generare il 98 % delle richieste fetcher.

Il carico non è fantascienza: in un caso, un modello fetcher ha colpito un sito con ben 39 000 richieste al minuto, un’espansione di traffico capace di mettere in ginocchio anche infrastrutture robuste, evocando fenomeni simili a DDoS pur senza intenzione malevola.

Fastly segnala che il traffico crawler è fortemente concentrato sul Nord America (quasi il 90 %), un bias territoriale che rischia di riflettersi nei dataset che alimentano gli LLM e nei loro output culturali.

Di fronte a questa marea di chiamate, i webmaster non restano a guardare e attrezzano tecniche di difesa: dal semplice robots.txt alle soluzioni attive come Anubis (proof-of-work) o i tarpit come Nepenthes, fino alla proposta testata da Cloudflare di disincentivi economici con il pay-per-crawl. Fastly stesso collabora con Tollbit per permettere ai publisher di monetizzare l’accesso ai contenuti, trasformando bot invasori in possibili fonti di reddito.

Dall’altra parte, i ricercatori come Arun Kumar invocano maggiore trasparenza: bot che si firmano con nomi identificativi, rendono pubblici gli intervalli IP, rispettano robots.txt e supportino sistemi di verifica come reverse DNS lookup. Sono misure che non risolvono il problema con un colpo di bacchetta, ma aiutano a distinguerli da traffico mascherato o malevolo.

In parallelo, Cloudflare  che gestisce circa il 20 % del traffico web globale  ha deciso di bloccare di default i crawler AI sui siti che li attivano e di offrire un sistema pay-per-crawl per creare un’economia dei permessi, sostenuta da editori come Gannett, Time o Stack Overflow. Tuttavia, l’approccio non è privo di critiche: TechRadar lo ritiene destinato a fallire, per la sua tariffazione uniforme su contenuti di valore diverso e la facilità tecnica per i malintenzionati di eluderlo con proxy e spoofing.

Il dibattito tecnico sfuma presto nel terreno etico e normativo. Cloudflare, ad esempio, ha pubblicamente denunciato Perplexity per essersi introdotta in domini test segnalati come non accessibili e, nonostante il divieto via robots.txt, aver continuato a restituire contenuti, mascherandosi da browser Chrome e zigzagando tra IP diversi; un comportamento definito “da criminali informatici” e motivo per escluderla da elenchi verificati. 

Editorialisti e tribunali si interrogano sul bilanciamento tra ricerca, uso legittimo e protezione dei diritti d’autore, con casi in corso contro OpenAI, Microsoft, Perplexity e altri.