Quando le parole diventano immagini: il nuovo sguardo di DeepSeek-OCR sulla memoria delle macchine | Stable diffusion xl | Buon giovedì simpatico | Generatore di immagini bing | Turtles AI
La nuova architettura DeepSeek‑OCR propone di “ridisegnare” il testo attraverso la vista: invece di codificare parola per parola, trasforma intere pagine in rappresentazioni visive compresse e le decodifica con un modello misto vision-linguaggio. I vantaggi sono molteplici: consumi di memoria ridotti, possibilità di processare contesti lunghi senza esplosione del numero di token, e un nuovo sguardo sul ruolo della visione nei modelli linguistici.
Punti chiave:
- Il sistema sfrutta due componenti principali, il compressore visivo “DeepEncoder” e il decoder “DeepSeek3B‑MoE‑A570M”, ottenendo oltre il 97 % di precisione OCR quando la compressione testo→visione è inferiore a 10×.
- A ratio più aggressive, circa 20×, l’accuratezza scende verso il 60 %, ma il risultato dimostra che è possibile impiegare una quantità significativamente inferiore di “token visivi” rispetto ai token testuali tradizionali.
- Sul benchmark OmniDocBench il modello supera sistemi che impiegano centinaia o migliaia di token per pagina utilizzando invece poche decine o centinaia di token visivi.
- Nella pratica produttiva, con una singola GPU A100-40G si parla di processare oltre 200 000 pagine al giorno; su 20 nodi (160 GPU) fino a 33 milioni di pagine al giorno.
L’idea di fondo è semplice quanto potente: un’immagine può contenere molte parole, dunque codificarla visivamente è un modo per «far stare dentro» più contesto con meno token. Il compressore visivo (DeepEncoder) riduce l’attivazione e il numero di token di visione prima di passare il tutto al decoder MoE (DeepSeek3B-MoE-A570M), che interpreta e traduce quella rappresentazione in testo o semantica. Secondo il rapporto tecnico, l’encoder supporta modalità a più risoluzioni (512×512 con 64 token visivi, fino 1280×1280 con 400 token visivi) e funzioni di “tokenpooling” e attenzione globale per limitare la frammentazione tipica dei metodi tile-based.
Questa soluzione rivolge l’attenzione a scenari concreti: archivi storici, documenti lunghi, pagine con grafici, formule chimiche, note scientifiche, diagrammi o testi multilingue. In ciascuno di questi casi, anziché codificare ogni parola come token linguistici, l’intera pagina può essere trattata come immagine compressa e poi decodificata dal modello. Il vantaggio per i modelli di linguaggio più grandi è evidente: se riescono a leggere una pagina compressa visivamente in poche decine di token invece che in migliaia di token testuali, il carico computazionale, memoria e latenza si riducono drasticamente. Dal punto di vista tecnico, la miscela di esperti (Mixture-of-Experts, MoE) nel decoder consente di specializzare parti del modello in compiti specifici OCR/semiOCR, e attivare solo una frazione degli esperti per ogni input, migliorando l’efficienza. Il tema della compressione visiva di contesti lunghi, inoltre, apre nuove riflessioni su come i modelli linguistici possano usare meccanismi di “memoria” o “dimenticanza” attenuando il carico delle sequenze testuali tramite rappresentazioni visive più compatte. L’azienda sviluppatrice, DeepSeek AI (fondata a Hangzhou, Cina), ha reso pubblico il codice e i pesi su GitHub.
Nel panorama più ampio, questo progetto arriva in un momento in cui la gestione di contesti lunghi (documenti, archivi, conversazioni estese) costituisce uno dei punti critici per i modelli linguistici: token = memoria, memoria = costi. Usando la visione come vettore di compressione, l’idea è che un’intera pagina possa essere «vista» da un modello in modo molto più efficiente di quanto la si possa «leggere» parola per parola. Al contempo, resta importante evidenziare che livelli elevati di compressione implicano cali di accuratezza: se si andasse oltre 20× la probabilità di errore diventa rilevante. È interessante notare che, se usato in pipeline di generazione dati per addestramento, l’efficienza (200k+ pagine al giorno) risulta attrattiva per scenari industriali. In tal senso, DeepSeek-OCR può essere interpretato come uno strumento capace di stimolare nuove architetture vision-language, spostando il focus dal solo “ragionamento su testo” al “compressione visiva di testo”.
Il modello offre uno sguardo intrigante su come i confini tra visione e linguaggio possano dissolversi, aprendo nuove strade all’efficienza dei sistemi AI.


