I limiti del ragionamento simulato: l’AI fatica nelle dimostrazioni matematiche avanzate | Llm large language model | Come istruire chat gpt | Large language models examples | Turtles AI
Un recente studio evidenzia i limiti dei modelli di AI basati sul ragionamento simulato (SR), che sebbene siano in grado di risolvere problemi matematici di routine, non raggiungono ancora i livelli richiesti per affrontare dimostrazioni complesse, come quelle delle Olimpiadi di Matematica.
Punti chiave:
- I modelli SR eccellono nei problemi matematici semplici, ma falliscono nelle dimostrazioni complesse.
- Le prestazioni su problemi delle Olimpiadi di Matematica degli Stati Uniti (USAMO) sono molto basse, con punteggi medi sotto il 5%.
- La differenza tra risolvere un problema e fornire una dimostrazione evidenzia le carenze nella comprensione profonda della matematica da parte dell’AI.
- I modelli di AI attuali non sono in grado di ragionare in modo astratto come gli esseri umani, ma miglioramenti futuri potrebbero colmare il divario.
Un nuovo studio condotto da un team di ricercatori provenienti dall’ETH di Zurigo e dall’INSAIT dell’Università di Sofia ha messo in luce una contraddizione fondamentale nei modelli di AI che utilizzano il "ragionamento simulato" (SR). Questi modelli, nonostante abbiano compiuto passi significativi in numerosi ambiti, tra cui la matematica di base, non riescono ancora a soddisfare le sfide più complesse, come quelle riscontrabili nelle competizioni matematiche di alto livello. Il rapporto si concentra in particolare sulla loro incapacità di fornire dimostrazioni matematiche complete e corrette, come quelle richieste nelle Olimpiadi di Matematica degli Stati Uniti (USAMO), uno degli eventi più prestigiosi a livello globale per i giovani matematici.
Quando i ricercatori hanno presentato ai modelli SR problemi tratti dal programma dell’USAMO 2025, i risultati sono stati tutt’altro che soddisfacenti. Sebbene uno dei modelli, Gemini 2.5 Pro di Google, abbia ottenuto un punteggio relativamente migliore (10,1 su 42 punti, circa il 24% di successo), la maggior parte degli altri modelli si è fermata ben al di sotto di un risultato accettabile. Alcuni modelli, come DeepSeek R1 e Grok 3, hanno ottenuto solo 2 punti, mentre altri come QwQ di Qwen e o1-pro di OpenAI sono riusciti ad ottenere solo una media di 1,2 punti su 42, con punteggi che non superano mai il 5%. Questo divario nelle prestazioni è significativo, poiché le Olimpiadi di Matematica richiedono la dimostrazione rigorosa di teoremi complessi, non la semplice soluzione di equazioni.
La distinzione tra risolvere un problema matematico e fornire una dimostrazione completa è fondamentale. Risolvere un problema implica trovare una risposta corretta, come nel caso di un’equazione o di una somma. Ma una dimostrazione richiede di giustificare ogni passaggio in modo logico, di costruire un ragionamento che mostri come si arriva alla conclusione in modo inequivocabile. Mentre i modelli SR sono in grado di produrre risposte corrette in problemi matematici di routine, come calcolare la somma di due numeri, mancano della capacità di articolare e giustificare i passaggi necessari per dimostrare un teorema. Questo tipo di ragionamento profondo, che richiede la costruzione di argomentazioni logiche astratte, è al di fuori delle capacità degli attuali modelli SR, che si basano principalmente sul riconoscimento di pattern.
L’analisi dei ricercatori ha rivelato diversi tipi di errori comuni nei tentativi di dimostrazione da parte dei modelli. In molti casi, le risposte degli algoritmi contenevano lacune logiche significative: affermazioni non dimostrate, errori nei passaggi intermedi o l’inclusione di argomentazioni contraddittorie. Ad esempio, in un problema che richiedeva la determinazione di numeri interi specifici per cui una formula matematica producesse sempre un risultato intero, il modello QwQ di Qwen ha escluso erroneamente alcune possibilità che erano in realtà permesse dalla formulazione del problema, portando a una conclusione errata. Ancora più problematico è il fatto che questi modelli spesso forniscono risposte sbagliate con un linguaggio che sembra certo, senza mostrare consapevolezza degli errori nel processo di ragionamento, un comportamento che li rende meno affidabili.
Secondo i ricercatori, uno dei motivi di questi errori potrebbe risiedere nel modo in cui i modelli vengono addestrati. I modelli SR sono progettati per "pensare" in modo simulato, utilizzando catene di ragionamento che imitano, in un certo senso, il processo umano. Tuttavia, questi modelli non possiedono una vera e propria comprensione concettuale delle questioni matematiche che affrontano. Quando vengono posti di fronte a nuove situazioni che richiedono ragionamenti non direttamente replicabili dai dati di addestramento, i modelli mancano la capacità di adattarsi e di correggere il loro corso. La mancanza di capacità di ragionamento astratto è un limite strutturale che attualmente ostacola l’efficacia di questi modelli in contesti complessi.
Un’altra difficoltà riguarda il cosiddetto "pattern matching", una tecnica alla base dei modelli di AI e come quelli basati su Transformer. I modelli SR si basano principalmente sull’identificazione di schemi nei dati e sull’adattamento di questi schemi ai nuovi problemi. Sebbene questo approccio sia efficace per compiti in cui le risposte sono relativamente semplici e ben definite, non è sufficiente quando si richiede un ragionamento logico più sofisticato. In altre parole, mentre i modelli SR possono risolvere problemi matematici elementari con precisione, non sono ancora in grado di eseguire la stessa operazione su problemi più avanzati che richiedono la costruzione di argomentazioni logiche complesse.
Nonostante questi limiti, la ricerca suggerisce che i modelli SR potrebbero migliorare nel tempo. Un approccio che potrebbe rivelarsi utile in futuro è l’integrazione di tecniche di ragionamento simbolico, che combinano le capacità delle reti neurali con metodi logici più formali. Alcuni esperimenti in questo campo, come il progetto AlphaGeometry di DeepMind, stanno cercando di sviluppare modelli neurosimbolici, che potrebbero, in teoria, migliorare la capacità dell’AI di eseguire ragionamenti complessi in modo più affidabile, evitando gli errori di confabulazione osservati nei modelli attuali. Tuttavia, questi progressi sono ancora nelle fasi iniziali, e rimane da vedere se saranno sufficienti per colmare il divario tra l’AI e il ragionamento matematico umano.
Nel complesso, il divario tra i modelli di AI attuali e il ragionamento matematico avanzato è ancora notevole, e non è detto che l’ampliamento delle capacità di questi modelli da solo possa superare le sfide che richiedono un pensiero profondamente astratto. Ma è possibile che, con ulteriori sviluppi nelle tecnologie di addestramento e nella progettazione delle architetture, questi modelli possano colmare il gap in futuro.
Per ora, il progresso continua a essere lentamente ma costantemente in corso, mentre la comunità scientifica esplora nuove modalità di sviluppo per l’AI applicata alla matematica.


