DeepSeek accende la “torcia dell’attenzione”: un modello che taglia i costi guardando solo dove serve | Llm large language model | Llm generative ai | Llm nlp | Turtles AI

DeepSeek accende la “torcia dell’attenzione”: un modello che taglia i costi guardando solo dove serve
Con V3.2-Exp arriva la Sparse Attention, un sistema che filtra i token come setaccio d’oro nel fiume dei dati, riducendo fino a metà i costi API e aprendo la strada a contesti lunghissimi senza pesi inutili
Editorial Team30 settembre 2025

 


DeepSeek ha presentato V3.2-Exp, modello sperimentale con meccanismo DeepSeek Sparse Attention, che abbassa i costi delle API di oltre il 50 % in scenari di contesto lungo. Il nuovo sistema introduce una selezione fine di token e indicizzazione “lightning”, promettendo efficienza computazionale migliorata mantenendo qualità simile alla versione precedente. Il modello è open-weight e già disponibile su Hugging Face, integrato con hardware nazionali.

Punti chiave:

  • Meccanismo Sparse Attention per contesti testuali molto lunghi che seleziona solo parti rilevanti, riducendo il carico computazionale. 
  • Prezzi API ridotti oltre il 50 %, con risparmi ancora più marcati per output; nuovi prezzi già attivi. 
  • Compatibilità estesa con infrastrutture hardware nazionali cinesi, in particolare chip domestici, con supporto per sequenze lunghe (fino a ~160K token nelle segnalazioni) per applicazioni più esigenti. 
  • Open source / open weight del modello su Hugging Face (e ModelScope), permettendo verifiche indipendenti e utilizzi da parte di sviluppatori e terze parti. 

DeepSeek-V3.2-Exp è stato annunciato il 29 settembre 2025, come un modello sperimentale che funge da ponte verso l’architettura di prossima generazione. Il miglioramento più evidente è l’introduzione della DeepSeek Sparse Attention (DSA), che mira a preservare le prestazioni del modello precedente (V3.1-Terminus) pur tagliando significativamente i costi di inferenza quando si devono processare testi molto lunghi. 

Il metodo DSA combina più componenti: c’è una sorta di indice veloce (“lightning indexer”) che individua frammenti del contesto su cui vale la pena concentrarsi, e poi un sistema di selezione fine dei token all’interno di quegli estratti, che decide quali token specifici includere nella finestra di attenzione. In questo modo non bisogna calcolare l’attenzione completa su tutti i token, con risparmi in memoria e tempo computazionale. 

Nel confronto con V3.1, nei benchmark preliminari (sia su testi brevi che su testi con contesti lunghi) le prestazioni di V3.2-Exp risultano “praticamente allineate” in termini di accuratezza e qualità del risultato, mentre i costi di inferenza e la latenza migliorano soprattutto via via che la lunghezza del contesto cresce. 

Dal punto di vista economico, le tariffe per le API sono state ridefinite: per gli input token, in casi di cache hit e cache miss, i prezzi in CNY sono scesi (esempi: da ~ 0,5元 a 0,2元 per token quando c’è cache hit; da ~ 4元 a 2元 quando non c’è; l’output token da ~ 12元 a ~ 3元). 

Sul fronte infrastrutturale, il modello è già integrato con chip nazionali, e aziende come Huawei Cloud hanno completato l’adattamento per supportare V3.2-Exp, segnalando che la finestra del contesto può arrivare a ~160.000 token. 

A complemento di queste informazioni, dai rapporti risulta che DeepSeek aveva già fatto passi rilevanti su tecnologie correlate, come il Multi-Head Latent Attention (MLA), modelli Mixture-of-Experts (MoE) sparsi, e addestramento a bassa precisione (ad esempio FP8), che avevano già contribuito a contenere costi e richieste hardware. 

E’ un’esperienza interessante che mostra come, anche senza allargare solamente la scala di modello o numero di parametri, si possa ottenere efficienza significativa tramite ottimizzazione architetturale, selezione intelligente del contesto, e messa in pratica con hardware adatto.