La Resistenza contro i Web Crawler AI: Nepenthes e Iocaine come Armi di Tarpitting | Chat bot online italiano | Rete neurale informatica | Chat gpt login free | Turtles AI
Nel contesto della crescente preoccupazione per l’uso indiscriminato dei web crawler da parte delle aziende di AI, sono emersi strumenti che cercano di fermare o rallentare questi crawler, in particolare quelli che ignorano le restrizioni dei file robots.txt. Questi strumenti sono progettati per "intrappolare" i crawler, impedendo loro di raccogliere dati dai siti web e danneggiando potenzialmente i modelli di AI che li utilizzano per l’addestramento. Un esempio di tale strumento è Nepenthes, creato da un programmatore noto solo come Aaron B., il quale ha sviluppato questo software come una sorta di "pozzo di catrame" per web crawler.
Punti chiave:
- Nepenthes è un software sviluppato per bloccare i web crawler, in particolare quelli utilizzati da AI, come quelli di grandi aziende. Utilizza una tecnica chiamata tarpitting per intrappolare i crawler in un "labirinto infinito" di link che non conducono a nulla, rallentando le loro operazioni e consumando le loro risorse.
- Oltre a intrappolare i crawler, Nepenthes può anche "avvelenare" i dati che i crawler raccolgono. Alimentando i crawler con dati incomprensibili o frasi generate casualmente tramite un algoritmo di Markov, i modelli di AI che usano questi dati rischiano di subire un degrado nella qualità delle informazioni su cui si allenano.
- La diffusione di strumenti come Nepenthes rappresenta una nuova minaccia per le aziende di AI, poiché potrebbe aumentare i costi operativi per la raccolta dei dati. Non solo, ma i tentativi di attacco richiedono anche risorse energetiche che possono rallentare il progresso delle aziende che competono nell’industria dell’AI.
- La creazione di Nepenthes e di altri strumenti simili non è solo una risposta tecnica, ma anche una protesta contro l’uso crescente dell’AI, che molti ritengono stia danneggiando la qualità e l’accessibilità di Internet. Per alcuni, queste misure sono viste come una forma di resistenza a un’industria tecnologica che sembra "divorare" il web per fini economici e monopolistici.
Nepenthes è progettato per ingannare i web crawler, in particolare quelli usati dalle AI, facendo in modo che questi si "impantano" in un ciclo infinito di richieste a pagine web che non portano a nulla. Le pagine generate da Nepenthes contengono numerosi link che rimandano tutti alla stessa pagina, creando una sorta di labirinto senza via d’uscita. I crawler, cercando di raccogliere informazioni, restano bloccati, sprecando risorse e tempo. Inoltre, le pagine hanno un tempo di caricamento estremamente lungo, mettendo a dura prova le capacità dei crawler di gestire grandi volumi di dati.
L’idea alla base di Nepenthes è quella di rendere il lavoro di raccolta dati più costoso e dispendioso in termini di tempo per le aziende che utilizzano l’AI. In un contesto in cui le risorse di calcolo sono già molto costose, questo tipo di attacco può aumentare significativamente i costi di raccolta e di addestramento dei modelli di AI.
Oltre a intrappolare i crawler in loop inutili, Nepenthes può anche "avvelenare" i dati che i crawler raccolgono. Questo avviene generando contenuti privi di senso, come il balbettio di Markov, che è un testo privo di coerenza logica, progettato per confondere i modelli di AI durante l’addestramento. Se abbastanza dati inutilizzabili vengono raccolti, possono compromettere l’efficacia dei modelli di AI che si basano su questi dati per imparare.
Un altro strumento simile è Iocaine, creato dallo sviluppatore Gergely Nagy, che ha preso spunto da Nepenthes. Iocaine funziona con lo stesso principio di tarpitting, ma si concentra maggiormente sull’avvelenamento dei dati. L’idea è quella di intrappolare i crawler in un labirinto di dati falsi e inutili, rallentando ulteriormente i loro sforzi di raccolta e aumentando i costi per le aziende che utilizzano questi dati per addestrare i loro modelli.
Nagy ha dichiarato che il suo strumento è stato efficace nel bloccare il traffico di bot, riducendo notevolmente l’accesso ai dati da parte dei crawler AI. Inoltre, ha sottolineato che l’obiettivo non è solo fermare lo scraping, ma anche avvelenare i dati che i crawler raccolgono, rendendoli inutilizzabili per l’addestramento.
Questi strumenti di tarpitting, pur essendo tecnicamente relativamente semplici, sollevano questioni più ampie sulla direzione che sta prendendo l’AI. Gli sviluppatori di Nepenthes e Iocaine vedono questi attacchi come una forma di resistenza contro l’invasione dei crawler AI, che sembrano ignorare le leggi del web e le richieste di non raccogliere dati senza permesso. Aaron B. stesso ha descritto il suo progetto come una forma di "ribellione" contro un’industria tecnologica che sta creando chatbot e altre tecnologie che stanno lentamente "distruggendo" la qualità e l’esperienza di Internet.
Per alcuni, come Jürgen Geuter, che ha promosso l’uso di Nepenthes sui social media, il progetto rappresenta una dichiarazione contro l’uso aggressivo dell’AI per raccogliere e utilizzare dati senza una vera reciprocità per i creatori di contenuti. Geuter ha sostenuto che la crescita dell’AI sta minacciando la "società e il contratto sociale" che una volta esisteva, e che strumenti come Nepenthes sono una risposta per fermare questo processo.
Le aziende di AI, consapevoli della crescente minaccia di questi attacchi, stanno già cercando di trovare soluzioni per difendersi da tarpitting e avvelenamento dei dati. OpenAI, ad esempio, ha dichiarato di essere al lavoro su contromisure per proteggere i propri crawler da attacchi come Nepenthes. Tuttavia, nonostante i loro sforzi, la lotta contro il tarpitting e altre forme di sabotaggio dei crawler è solo all’inizio.
Mentre gli attacchi di tarpitting come Nepenthes e Iocaine non sono una soluzione definitiva, rappresentano un segnale della crescente resistenza a una tecnologia che viene percepita come invasiva. Questi strumenti offrono una protezione limitata ma significativa contro lo scraping e l’uso incontrollato dei dati da parte delle aziende di AI.
In un’epoca in cui i crawler AI stanno diventando sempre più sofisticati, è probabile che il dibattito sul loro impatto sociale, politico e legale continui a evolversi, portando a nuove forme di resistenza digitale e a una riconsiderazione del rapporto tra le aziende tecnologiche e gli utenti.
