I chatbot distorcono la scienza: nuove AI esagerano risultati e riducono l’accuratezza | Cosa sono i large language models | Llm wikipedia | Come usare chatgpt | Turtles AI
Un’analisi su 4.900 riassunti scientifici mostra che i più recenti modelli LLM, come ChatGPT‑4o e DeepSeek, tendono a semplificare eccessivamente e ampliare il significato dei risultati rispetto agli esperti umani, con rischi soprattutto in ambito medico.
Punti chiave:
- I chatbot AI sovra‑generalizzano fino a cinque volte più degli esperti.
- Nuove versioni incrementano errori: fino al 73 % dei riassunti ha conclusioni ampliate.
- Prompt orientati all’accuratezza peggiorano la fedeltà delle sintesi.
- Solo Claude mostra prestazioni costantemente migliori rispetto agli altri LLM.
Un recente studio, pubblicato il 30 aprile su Royal Society Open Science, ha confrontato 10 modelli linguistici (quattro versioni di ChatGPT, tre di Claude, due di Llama e uno di DeepSeek) valutandone la qualità nella sintesi di articoli scientifici utilizzando 4.900 riassunti di ricerca. I ricercatori guidati da Uwe Peters (Università di Bonn/Utrecht) e Benjamin Chin‑Yee (Western/Cambridge) hanno rilevato una tendenza sistematica da parte degli LLM a eliminare qualifiche, contesti e limitazioni, trasformando frasi cautamente passate (“è stato sicuro…”), ad esempio, in affermazioni assertive (“è un trattamento sicuro ed efficace”). I modelli più recenti, nonostante maggiori capacità, si sono dimostrati meno affidabili: DeepSeek, ChatGPT‑4o e Llama 3.3 hanno mostrato overgeneralizzazioni in percentuali tra il 26 % e il 73 % dei casi. Laddove veniva richiesto un livello superiore di accuratezza, la tendenza a dilatare il significato raddoppiava. Gli LLM hanno sovra‑generalizzato cinque volte più spesso dei riassunti redatti da esseri umani, con potenziali conseguenze gravi in campo clinico, ad esempio nella gestione delle dosi di farmaci. Un esempio emblematico evidenzia come Llama abbia rimosso dettagli importanti sui dosaggi di un farmaco antidiabetico, potenzialmente inducendo a prescrizioni al di fuori delle linee guida. Esperti come Max Rollwage (Limbic) qualificano queste distorsioni come fonti di bias sottili ma insidiousi, e resistenti anche nei modelli più ampi e “instructable”. Patricia Thaine (Private AI) sottolinea come la formazione su testi semplificati amplifichi questi difetti quando i sistemi operano in domini specialistici senza supervisione adeguata. Come possibili contromisure, lo studio suggerisce di calibrare parametri come la temperatura (più bassa riduce l’inventiva della sintesi), adottare protocolli di benchmarking specifici e orientarsi verso modelli come Claude, che nel confronto ha mantenuto maggiore integrità.
Una maggiore consapevolezza e regole operative specifiche sono dunque essenziali affinché l’AI contribuisca alla comunicazione della scienza senza esagerarne i contenuti né sviare l’interpretazione di evidenze complesse.


