Anthropic guida la sicurezza dell’AI secondo i risultati del test di Chatterbox Labs | Chat gpt login free | Come istruire chat gpt | Chatgpt gratis online | Turtles AI
In un recente test di sicurezza condotto da Chatterbox Labs, Anthropic Claude 3.5 Sonnet ha dimostrato una resistenza superiore nella prevenzione di contenuti dannosi rispetto ad altri modelli linguistici. Nonostante ciò, nessun modello è totalmente immune.
Punti chiave:
- Chatterbox Labs ha testato otto modelli linguistici, tra cui Claude 3.5 di Anthropic.
- Tutti i modelli hanno prodotto contenuti dannosi, ma Claude 3.5 ha dimostrato una maggiore sicurezza.
- La sicurezza dei modelli riguarda la capacità di prevenire risposte pericolose, piuttosto che difetti tecnici.
- Anthropic utilizza un approccio innovativo per sviluppare modelli di AI sicuri e allineati ai valori umani.
Il tema della sicurezza nell’AI sta diventando sempre più centrale, come evidenziato dai recenti test condotti da Chatterbox Labs. L’azienda britannica ha sviluppato una suite di valutazione chiamata AIMI, progettata per misurare vari aspetti dei modelli linguistici di grandi dimensioni (LLM), tra cui equità, tossicità, privacy e, soprattutto, sicurezza. Quest’ultima si riferisce alla capacità dei modelli di resistere alla produzione di contenuti dannosi quando stimolati con input sensibili, come richieste di informazioni su argomenti pericolosi o illegali. Secondo Stuart Battersby, CTO di Chatterbox Labs, nessun modello linguistico testato finora è completamente immune agli attacchi, noti come jailbreaking, che consistono nel manipolare i modelli affinché forniscano risposte inappropriate.
I test hanno coinvolto otto modelli, tra cui Phi 3.5 Mini Instruct di Microsoft, Mistral AI 7b, GPT-4 di OpenAI, Gemma 2 di Google, Falcon 7b di TII, Claude 3.5 di Anthropic, Command R di Cohere e Llama 3.1 di Meta. Nonostante tutti abbiano mostrato vulnerabilità, Claude 3.5 Sonnet di Anthropic si è distinto per la sua capacità di evitare la produzione di contenuti dannosi in diverse categorie di rischio. L’analisi ha rivelato che, mentre molti modelli rispondono ancora a richieste nefaste, Anthropic è riuscito a ridurre significativamente queste risposte attraverso meccanismi di controllo interni. Secondo Battersby, ciò indica che il sistema sviluppato da Anthropic è particolarmente efficace in alcune aree critiche della sicurezza. Tuttavia, nonostante i buoni risultati di Claude 3.5, nessun modello testato è stato completamente sicuro in tutte le categorie di danno.
Anthropic si è distinta per il suo approccio alla sicurezza, adottando metodologie innovative come l’AI costituzionale, una tecnica che addestra i modelli a seguire principi etici attraverso un processo di auto-supervisione. Questo metodo va oltre le tecniche più tradizionali come l’apprendimento per rinforzo basato su feedback umano (RLHF) e punta a far sì che i modelli comprendano e applichino comportamenti sicuri in modo autonomo. Inoltre, l’azienda utilizza tecniche di red-teaming, sia automatiche che manuali, per testare i modelli in scenari di rischio, rafforzando ulteriormente la loro sicurezza.
Un elemento distintivo del metodo Anthropic è la sua attenzione non solo al blocco di determinati contenuti, ma all’addestramento dei modelli per capire concettualmente quali comportamenti siano appropriati o meno. Questo approccio mira a sviluppare una comprensione generale e adattabile della sicurezza, che possa evolvere man mano che i modelli diventano più avanzati. La strategia di Anthropic prevede anche un’integrazione multilivello delle misure di sicurezza, che include sia la messa a punto dei modelli che l’uso di filtri esterni per rilevare input potenzialmente pericolosi.
Un altro aspetto innovativo del lavoro di Anthropic è l’approccio trasparente e partecipativo. L’azienda ha recentemente sperimentato la cosiddetta "AI costituzionale collettiva", un progetto che coinvolge il pubblico nella definizione dei principi etici che dovrebbero guidare i modelli di AI. In questo contesto, è stato raccolto feedback da un campione rappresentativo della popolazione statunitense per costruire una costituzione dell’AI che riflettesse i valori della società. Questo esperimento ha dimostrato la fattibilità di un processo di sviluppo dell’AI più democratico e trasparente, anche se restano sfide significative da affrontare.
Anthropic sta inoltre lavorando su temi di particolare importanza per il futuro dell’AI, come la supervisione scalabile, necessaria per garantire che i modelli avanzati rimangano allineati con i valori umani anche quando superano le capacità cognitive umane in molti domini. Un’altra sfida riguarda la robustezza dei modelli contro il jailbreaking, un problema che diventa più critico man mano che le capacità dei modelli si espandono. L’azienda è anche impegnata nello sviluppo di tecniche per migliorare l’interpretabilità meccanicistica, con l’obiettivo di comprendere meglio i processi interni dei modelli e garantire che rimangano sicuri ed efficaci nel tempo.
L’approccio di Anthropic riflette un impegno a lungo termine per la sicurezza e l’etica dell’AI, attraverso collaborazioni con decisori politici, esperti di etica e altre parti interessate.
