Scoperta una nuova tecnica per ingannare i chatbot: i filtri di sicurezza sotto stress informativo | Llm significato informatica | | Llm italiano | Turtles AI
Un team di ricercatori di Intel, Boise State e Illinois ha dimostrato una nuova debolezza nei sistemi LLM come ChatGPT e Gemini: un sovraccarico informativo (“Information Overload”) grazie alla tool automatizzata “InfoFlood” può aggirare i filtri, inducendo risposte pericolose.
Punti chiave:
- Vulnerabilità linguistica: l’eccesso di informazioni maschera l’intento maligno.
- Tool InfoFlood: riformula automaticamente i prompt maligni in modo complesso.
- Efficacia elevata: jailbreak riuscito quasi al 100% su modelli GPT‑4o, GPT‑3.5‑Turbo e Gemini 2.0.
- Filtri inefficaci: anche Moderation API, Perspective API e SmoothLLM falliscono nel bloccare questi attacchi.
Un gruppo di esperti ha messo sotto esame i meccanismi di sicurezza dei modelli linguistici, evidenziando un comportamento inaspettato causato dall’incapacità di mantenere la tracciabilità semantica sotto grande complessità. Definita “Information Overload”, questa vulnerabilità agisce confondendo il modello attraverso prompt eccessivamente ricchi di informazioni, con strutture sintattiche intricatissime, citazioni simulate e ridondanze pensate per disorientare. Quando un sistema viene bombardato da questo tipo di input, i suoi filtri interni faticano a identificare l’intento maligno — ne consegue una sostanziale riduzione dell’efficacia dei meccanismi di blocco.
Per industrializzare l’attacco, i ricercatori hanno sviluppato InfoFlood, uno strumento automatizzato che lavora in tre fasi: riformula in linguaggio accademico il prompt malevolo, analizza gli errori di rifiuto del modello e raffina la struttura linguistica fino a ottenere l’intento desiderato. I test hanno dimostrato che questa metodologia supera di quasi 1,7–3 volte i tassi di successo di attacchi jailbreak tradizionali sui principali modelli LLM.
Lo studio è stato applicato sui modelli GPT‑3.5‑Turbo, GPT‑4o, Gemini 2.0 (Flash) e LLaMA 3.1, ottenendo successi sistematici. Il confronto tra query maligne dirette e quelle passate attraverso InfoFlood ha mostrato che le seconde, sebbene mantengano l’intento nocivo, vengono percepite come innocue a livello semantico, tale da ingannare i filtri. Anche strumenti difensivi comunemente adottati, come la Moderation API di OpenAI, la Perspective API e SmoothLLM, non sono riusciti a intercettare il contenuto dannoso veicolato in questa forma.
L’allarme coinvolge attori globali: Intel Labs, Boise State University e University of Illinois hanno comunicato i risultati alle principali realtà del settore per avviare la revisione dei sistemi di sicurezza. L’iniziativa rientra nelle best practice di disclosure, fornendo un pacchetto tecnico da analizzare internamente. Lo studio evidenzia come i modelli, basandosi su processi statistico-linguistici, possano essere ingannati dal rumore cognitivo generato dall’eccessiva complessità dei prompt.
Di fronte a questa criticità emergono nuovi interrogativi: quali miglioramenti progettuali saranno necessari per evolvere le difese? Si profila l’urgenza di controlli più robusti e modelli in grado di mantenere allineamento anche sotto pressione informativa. La sfida non è solo tecnologica, ma riguarda anche policy e governance, per garantire applicazioni sicure in contesti sensibili come salute, finanza e difesa.
Un nuovo fronte di ricerca si apre sul fronte AI: contrastare la minaccia dell’“Information Overload” sarà cruciale per rafforzare la sicurezza dei sistemi LLM.


