La sfida dei modelli linguistici AI nel settore medico: allucinazioni frequenti nelle sintesi clinic | Intelligenza artificiale google | 10 esempi di intelligenza artificiale | Intelligenza artificiale in oncologia | Turtles AI

La sfida dei modelli linguistici AI nel settore medico: allucinazioni frequenti nelle sintesi clinic
Uno studio recente rivela preoccupanti livelli di errori nei riassunti medici generati dai modelli linguistici GPT-4o e Llama-3.

Punti chiave:

  • Uno studio recente ha rilevato allucinazioni in quasi tutti i riassunti medici generati da GPT-4o e Llama-3.
  • Le allucinazioni identificate riguardavano principalmente sintomi, diagnosi e istruzioni mediche.
  • GPT-4o ha mostrato un numero maggiore di incongruenze rispetto a Llama-3, che ha prodotto riassunti più brevi e meno dettagliati.
  • La ricerca sottolinea la necessità di un sistema più efficace per rilevare e gestire le allucinazioni AI in contesti clinici.

 

L’utilizzo di modelli linguistici di grandi dimensioni (LLM) nel settore medico può sollevare importanti questioni di sicurezza. Un recente studio dell’Università del Massachusetts Amherst rivela come i modelli AI, tra cui GPT-4o e Llama-3, presentino frequentemente allucinazioni nelle sintesi mediche, con potenziali implicazioni critiche per la cura dei pazienti.

 

Negli ultimi anni, l’adozione di LLM nel settore sanitario ha subito un’accelerazione, in parte grazie alla promessa di alleviare il burnout clinico attraverso la generazione automatica di riassunti medici. Tuttavia, la comunità medica esprime ancora preoccupazione riguardo alle cosiddette "allucinazioni", ovvero quelle situazioni in cui un modello AI produce informazioni errate o fuorvianti. Lo studio condotto dall’Università del Massachusetts Amherst si è concentrato su questo fenomeno, analizzando specificamente le prestazioni di due LLM all’avanguardia: GPT-4o di OpenAI e Llama-3 di Meta.

 

Il team di ricerca ha raccolto 100 riassunti medici prodotti da questi modelli, suddivisi equamente tra GPT-4o e Llama-3, con l’intento di verificare l’affidabilità e la precisione delle informazioni generate. I risultati sono stati allarmanti: in quasi tutti i riassunti analizzati sono state riscontrate allucinazioni. Secondo Prathiksha Rumale, uno degli autori dello studio, le allucinazioni si sono manifestate prevalentemente in relazione a sintomi, diagnosi e istruzioni mediche, sottolineando la sfida che rappresenta per i modelli linguistici il dover maneggiare correttamente la conoscenza nel dominio medico.

 

Le allucinazioni identificate nel campione di GPT-4o sono state 327, distribuite tra incongruenze negli eventi medici, errori di ragionamento e incoerenze cronologiche. Nello specifico, sono stati segnalati 114 casi di ragionamenti errati e tre di errori temporali, con la maggior parte delle incongruenze legate a eventi medici. Al contrario, i riassunti generati da Llama-3, sebbene più brevi e meno dettagliati, hanno evidenziato 271 incongruenze negli eventi medici, 53 errori di ragionamento e un’unica incoerenza cronologica. Tejas Naik, un altro autore dello studio, ha evidenziato come la capacità dei LLM di generare frasi fluenti e plausibili, in grado di superare il test di Turing, possa rappresentare un rischio, soprattutto se queste sintesi non sono fedeli alle cartelle cliniche originali.

 

Il rischio principale è che, se non rilevate, queste allucinazioni possano portare a errori clinici gravi. Per esempio, un modello potrebbe erroneamente interpretare un raffreddore comune come un’infezione alla gola, portando i medici a prescrivere farmaci inappropriati e sottovalutando i potenziali rischi di trasmissione virale. Ancora più grave potrebbe essere l’omissione di una allergia a un farmaco, documentata nella cartella clinica ma ignorata dal modello, che potrebbe comportare una reazione allergica potenzialmente letale.

 

Il team di ricerca ha concluso che è necessario sviluppare un quadro metodologico più robusto per individuare e classificare le allucinazioni AI nel contesto clinico, al fine di migliorare l’affidabilità di questi strumenti. Questa raccomandazione apre un dibattito più ampio sull’integrazione dell’AI nel settore sanitario, dove la precisione e l’affidabilità delle informazioni sono cruciali per la sicurezza del paziente.