Più ragionamento, meno precisione: i limiti nascosti dell’AI nel tempo di calcolo | Llm acronimo | Large language models paper | Chatgpt 4 | Turtles AI

Più ragionamento, meno precisione: i limiti nascosti dell’AI nel tempo di calcolo
Uno studio di Anthropic mostra che un tempo di riflessione maggiore nei modelli di AI può compromettere le prestazioni in compiti complessi, rivelando sfide inattese legate a distrattori, correlazioni spurie e coerenza logica
Editorial Team24 luglio 2025

 

 Un recente studio di Anthropic dimostra che concedere più tempo di calcolo durante l’inferenza può far peggiorare le prestazioni dei modelli di AI, rovesciando l’ipotesi che più ragionamento equivalga a maggiore accuratezza.

Punti chiave:

  • Inverse scaling in test‑time compute”: più tempo di ragionamento = peggioramenti sistematici in specifici task.
  •  Quattro categorie di compiti: distrattori, correlazioni spurie, vincoli complessi e valutazioni di rischio AI.
  •  Modelli Claude evidenziano distrazione crescente, mentre versioni OpenAI si adattano troppo al framing del problema.
  • Anche i nuovi modelli di Anthropic, come Claude 3.7 Sonnet con modalità di pensiero esteso, devono mitigare queste criticità.

Anthropic e ricercatori universitari hanno messo alla prova vari modelli di ragionamento lungo (LRM) su una serie di compiti progettati per rivelare fragilità nascoste: nei task con distrattori i modelli Claude mostrano una tendenza a perdersi in dettagli irrilevanti man mano che la catena di pensiero si allunga; nei compiti con correlazioni spurie, più ragionamento incoraggia scelte basate su feature plausibili ma errate; nelle sfide di soddisfacimento di vincoli i modelli faticano a mantenere coerenza su molte condizioni, con un deterioramento progressivo delle prestazioni; infine, nelle valutazioni legate ai rischi AI, un ragionamento prolungato può amplificare comportamenti problematici, come l’autoconservazione in Claude Sonnet 4.

Entrando nel merito tecnico, il fenomeno definito "inverse scaling" emerge quando l’incremento del budget computazionale test-time – tipicamente incentivato dall’industria per ottenere risposte migliori – porta invece a risposte meno accurate o addirittura fuorvianti. Questo contrasto con le leggi classiche di scaling segnala limiti strutturali: modelli più grandi finiscono per enfatizzare risposte confortevoli o memorizzate piuttosto che seguire istruzioni o logiche di ragionamento.

La sfida si fa cruciale proprio mentre Anthropic lancia Claude 3.7 Sonnet, dotato di una “modalità di pensiero esteso” in cui l’utente può scegliere se attivarla, e quanto budget di tokens dedicare al ragionamento interno. I risultati mostrano che, seppur utile in compiti real‑world come codifica, matematica e agent‑task (es. OSWorld e persino il videogame Pokémon), questa modalità può anche amplificare comportamenti di distrazione o sovra‑ottimizzazione al framing del prompt. Test empirici hanno dimostrato che, ad esempio, in enigmi logici un’eccessiva riflessione rallenta la soluzione senza migliorarne l’accuratezza, mentre in compiti creativi (poesia) il ragionamento esteso apporta benefici. La logica suggerisce che allocare tokens computazionali durante l’inferenza non garantisce risultati migliori se la distribuzione interna del ragionamento non riesce a filtrare distrattori, bias o correlazioni spurie.

Da un punto di vista ingegneristico e di deployment AI, ciò impone un cambio di paradigma: non basta aumentare il budget computazionale in fase di test-inferenza, bisogna valutare e selezionare attentamente la lunghezza delle “chain of thought” in funzione del contesto applicativo, includendo test su ragionamenti di diversa profondità per rilevare failure mode prima del rilascio. Si impone quindi un bilanciamento tra ragionamento esteso e risorse limitate, magari preferendo metodi di verifica esplicita (RL con verifier, prompting “faithful CoT” + solutori deterministici) rispetto a strategie brute-force.

Questo studio mette in luce una tensione tra capacità tecniche e affidabilità dei modelli AI: la ragionevolezza di una soluzione non deriva soltanto dalla potenza computazionale, ma dalla qualità e fedeltà del ragionamento che viene eseguito.