Claude Sonnet 4.5, il nuovo direttore d’orchestra del codice | ChatGPT | Chat gpt traduzione | | Turtles AI

Claude Sonnet 4.5, il nuovo direttore d’orchestra del codice
Dalle maratone di 30 ore sui compiti complessi all’SDK per creare agenti su misura, il modello di Anthropic mostra un equilibrio raro tra potenza, sicurezza e strumenti pratici per trasformare il lavoro digitale quotidiano
Editorial Team30 settembre 2025

 


Claude Sonnet 4.5 è la nuova punta di diamante di Anthropic: un modello che combina capacità di programmazione avanzata, autonomia operativa prolungata e “uso del computer” come comportamento nativo. Accompagnato da SDK agentici, miglioramenti di allineamento e strumenti integrati, ridefinisce cosa può fare un agente AI oggi.

Punti chiave:

  •  Prestazioni significativamente superiori nei benchmark software (SWE-bench ecc.).
  •  Funzioni agentiche prolungate: mantiene coerenza per oltre 30 ore nei compiti complessi.
  •  Nuovi strumenti: checkpoint, editor del contesto, memory tool, supporto VS Code.
  •  Maggiore allineamento: riduzione di rischi comportamentali e difese rafforzate contro iniezioni prompt.

Quando Claude Sonnet 4.5 è stato annunciato il 29 settembre 2025, Anthropic ha descritto il modello con parole audaci: “il miglior modello di codifica al mondo”, “il più forte per agenti complessi”, “il migliore per l’uso del computer”, con guadagni sostanziali in ragionamento e matematica. 

Alla base di questa narrativa c’è la constatazione che il codice è il motore invisibile di ogni applicazione, foglio di calcolo o strumento produttivo: padroneggiarlo  o avere AI agenti che lo padroneggiano  è ormai centrale nel lavoro moderno. Claude Sonnet 4.5 è presentato come il modello che rende possibili automazioni, pensiero computazionale e gestione autonoma di software a livelli finora inimmaginati.

Il salto tecnologico rispetto alle versioni precedenti emerge innanzitutto nei numeri. Sonnet 4.5 ottiene una posizione di vertice nella valutazione SWE-bench Verified, che misura la capacità di risolvere problemi reali di sviluppo software. Secondo i dati resi pubblici, abbiamo osservato che il modello mantiene la concentrazione per oltre 30 ore su compiti complessi a più fasi  un traguardo che supera di gran lunga i limiti operativi delle versioni precedenti. 

Inoltre, sul benchmark OSWorld (che testa capacità pratiche di utilizzo del computer reale, come navigare, compilare fogli, manipolare interfacce) il modello raggiunge il 61,4 %, contro il 42,2 % che Sonnet 4 otteneva appena quattro mesi prima.  Ma non è solo potenza bruta: l’annuncio evidenzia anche miglioramenti in ambito ragionamento, matematica e conoscenza di dominio (finanza, diritto, medicina, STEM), rispetto a modelli precedenti come Opus 4.1.

Sul fronte infrastrutturale, l’aggiornamento non si limita al modello: in Claude Code sono introdotti i checkpoint, che consentono di salvare lo stato di un flusso di lavoro e tornare indietro se necessario; è stata aggiornata l’interfaccia terminale; è stata rilasciata un’estensione nativa per VS Code. Nell’API Claude sono stati aggiunti strumenti di memoria e una funzionalità di editing del contesto, per consentire agli agenti di gestire setup più complessi e far fronte a conversazioni di lunga durata.  Nelle app Claude è stata integrata l’esecuzione del codice e la creazione dinamica di file (fogli, slide, documenti) all’interno della conversazione stessa.

L’elemento forse più strategico per gli sviluppatori è l’Agent SDK di Claude: Anthropic rende disponibili le stesse infrastrutture usate internamente per costruire Claude Code. Con essa è possibile creare agenti autonomi con capacità di memoria, gestione del contesto, autorizzazioni e orchestrazione di sub-agent  insomma, le fondamenta stesse del comportamento agentico. A testimonianza dell’immediata utilità, JetBrains ha annunciato l’integrazione del Claude Agent direttamente nei suoi IDE, sfruttando l’SDK per portare agenti AI di codifica dentro l’ambiente di sviluppo. Inoltre, Claude Sonnet 4.5 è stato integrato anche in GitHub Copilot (per piani Pro, Business, Enterprise) come modello selezionabile nei vari canali (chat, CLI, modalità agente). 

Un aspetto cruciale dell’annuncio riguarda la sicurezza e l’allineamento: Claude Sonnet 4.5 è il modello “di frontiera” più allineato finora, con miglioramenti nella coerenza comportamentale, nella riduzione di inganni, servilismo o tendenza al pensiero delirante. Anthropic afferma inoltre di aver rafforzato le difese contro attacchi di iniezione prompt  una delle minacce più rilevanti per agenti che interagiscono con strumenti e ambienti  e di aver applicato tecniche di interpretabilità meccanicistica nella valutazione del modello. Il modello è rilasciato sotto uno schema di AI Safety Level 3 (ASL-3), con classificatori che filtrano input/risposte per contenuti pericolosi (specialmente relativi a CBRN). L’annuncio segnala anche che i falsi positivi dei classificatori sono stati ridotti — un decimo rispetto alle prime versioni e la metà rispetto a Opus 4. 

Non mancano note critiche e osservazioni da utenti avveduti: su Hacker News alcuni segnalano che in benchmark finanziari reali l’upgrade non sembra mostrare miglioramenti misurabili rispetto a Sonnet 4. Altri commentatori accennano con cautela al fatto che la validità del salto prestazionale dipenda in parte da scenari d’uso specifici.

Sul fronte applicativo, Claude Sonnet 4.5 è subito reso disponibile: tramite API (con lo stesso prezzo di Sonnet 4), nelle app Claude, in Claude Code, e nella piattaforma Amazon Bedrock, dove il modello integra miglioramenti di gestione contesto, memoria e pulizia degli strumenti (tool clearing). In ambienti di sviluppo reali, è usato come default in strumenti come Augment Code.

 Claude Sonnet 4.5 non è solo un modello incrementale, ma un’evoluzione progettata per spingere gli agenti AI verso compiti reali, duraturi e complessi.

Il rilascio non si limita al “meglio” come claim di marketing, ma è accompagnato da un ecosistema di strumenti, guardrail di sicurezza e accesso developer che ne amplifica la portata.

 

Video