DetectGPT: un nuovo strumento per classificare il testo generato dall’AI | Immagini Gratis da Scaricare | Immagini ia | Generatore di Immagini Gratis Online | Turtles AI
DetectGPT: un nuovo strumento per classificare il testo generato dall’AI
DukeRem18 febbraio 2023
Negli ultimi mesi, i ricercatori hanno esplorato nuovi modi per rilevare se un dato testo sia stato generato da un modello linguistico come ChatGPT. Un nuovo strumento, DetectGPT, mostra un’accuratezza del 95% in questo compito.
Uno ricercatore, Alexander Khazatsky, ha chiesto al suo collega, Eric Anthony Mitchell, se esistesse un modo per classificare un saggio come scritto da ChatGPT. Questa domanda ha portato Mitchell ad approfondire la questione.
Gli approcci precedenti prevedevano l’addestramento di un modello utilizzando testo generato sia da umani che da LLM, per poi chiedergli di classificare se un altro testo fosse stato scritto da un umano o da un LLM. Tuttavia, questo approccio richiede una grande quantità di dati per l’addestramento, al fine di avere successo in diverse aree tematiche e lingue differenti.
Un secondo approccio esistente prevede l’utilizzo dell’LLM che probabilmente ha generato il testo per rilevare i propri output. Questo approccio chiede a un LLM quanto gli "piaccia" un campione di testo, e questo gradimento di un pezzo di testo è un modo sintetico per dire che "ottiene un punteggio elevato". Si tratta di un singolo numero, che rappresenta, con un ottimo grado di confidenza, la probabilità che quella specifica sequenza di parole appaia, secondo il modello. Nel paper si spiega che, se al modello piace molto un campione di testo, è probabile che sia stato generato dal modello stesso, mentre se non gli piace, probabilmente non proviene dal modello. Questo approccio funziona ragionevolmente bene, sicuramente molto meglio di un’ipotesi casuale.
Tuttavia, Mitchell ha avuto l’intuizione iniziale che anche i potenti LLM abbiano pregiudizi arbitrari nell’utilizzare una formulazione di un’idea piuttosto che un’altra. Pertanto, l’LLM tenderà a "gradire" qualsiasi leggera riformulazione dei propri output meno dell’originale. Al contrario, anche quando ad un LLM "piace" un testo generato dall’uomo, la valutazione del modello di versioni leggermente modificate di quel testo sarà molto più varia. In altre parole, se un testo generato dall’uomo viene perturbato, è più o meno altrettanto probabile che al modello piaccia più o meno dell’originale.
Per verificare la sua intuizione, Mitchell ha utilizzato modelli open-source molto diffusi, compresi quelli disponibili attraverso l’API di OpenAI. Si è reso conto che il calcolo del gradimento di un particolare testo da parte di un modello è essenzialmente il modo in cui questi modelli vengono addestrati. Questi modelli forniscono automaticamente un numero, che si rivela molto utile per individuare il testo generato dalla macchina. Questo approccio, chiamato DetectGPT, prevede la misurazione della curvatura della funzione di probabilità del modello in funzione della quantità di perturbazione del testo originale. I risultati sono stati impressionanti: il metodo ha ottenuto un punteggio F1 del 94,9% per il testo inglese e del 92,6% per il testo tedesco.
