Nuova tecnica ottimizza i modelli linguistici e riduce i costi | Llm italiano | Large language model italiano | Chatgpt gratis | Turtles AI
Una startup di Tokyo, Sakana AI, ha sviluppato una tecnica innovativa, la "memoria universale del trasformatore", che migliora l’efficienza dei modelli linguistici riducendo i costi di elaborazione e ottimizzando l’uso della memoria tramite reti neurali specializzate.
Punti Chiave:
- La memoria universale del trasformatore ottimizza l’uso delle finestre di contesto nei modelli Transformer.
- Utilizza reti neurali di memoria attentiva (NAMM) per gestire in modo efficiente le informazioni rilevanti.
- I NAMM riducono significativamente la memoria cache necessaria senza sacrificare le prestazioni.
- La tecnica si adatta a diverse modalità e applicazioni, mantenendo alta la versatilità.
Sakana AI, una promettente startup giapponese, ha presentato un’innovativa metodologia per ottimizzare i modelli linguistici di grandi dimensioni (LLM) e altri sistemi basati su architetture Transformer, riducendo i costi e migliorando le prestazioni. Il fulcro di questa innovazione è la cosiddetta "memoria universale del trasformatore", una tecnica avanzata che si avvale di reti neurali attentiva (NAMM) per raffinare il trattamento delle informazioni. Il concetto di finestra di contesto, ossia lo spazio in cui un modello elabora gli input forniti dall’utente, rappresenta la memoria di lavoro di un LLM. Sebbene finestre di contesto più ampie permettano l’inclusione di un maggior numero di dati, comportano costi computazionali elevati. Questa problematica ha portato allo sviluppo di tecniche di ingegneria dei prompt, volte a massimizzare l’efficienza del modello rimuovendo i dettagli ridondanti senza sacrificare le informazioni essenziali. Tuttavia, queste soluzioni spesso richiedono notevoli risorse o interventi manuali.
La memoria universale del trasformatore affronta queste sfide attraverso i NAMM, modelli leggeri che, durante l’inferenza, decidono quali token conservare o eliminare. Il loro addestramento, separato dagli LLM, avviene mediante algoritmi evolutivi, che simulano un processo iterativo di selezione e mutazione per ottimizzare le prestazioni. Ciò consente loro di raggiungere un obiettivo specifico: ridurre il peso computazionale mantenendo la qualità delle risposte. Operando direttamente sui livelli di attenzione dei Transformer, i NAMM identificano i token più rilevanti per il compito specifico, scartando quelli superflui. Questa funzionalità non solo migliora l’efficienza ma rende i NAMM adattabili a diversi contesti. Ad esempio, un NAMM addestrato su modelli di testo puro può essere applicato con successo a sistemi multimodali o di visione artificiale senza necessità di ulteriori adattamenti.
I test condotti dai ricercatori hanno dimostrato che i NAMM possono ridurre fino al 75% della memoria cache richiesta durante l’esecuzione di compiti complessi, migliorando al contempo le prestazioni su sequenze particolarmente lunghe. Questa efficienza si traduce in benefici concreti anche in contesti "fuori distribuzione", come l’elaborazione di flussi video ridondanti o la gestione di decisioni ottimizzate in sistemi di apprendimento per rinforzo. Un aspetto interessante dei NAMM è la loro capacità di adattare il comportamento alle esigenze del compito. Nei problemi di codifica, ad esempio, eliminano i commenti e gli spazi vuoti, mentre nelle attività di linguaggio naturale riducono le ridondanze grammaticali non essenziali.
La versatilità e il design modulare dei NAMM rendono questa tecnologia particolarmente attraente per le aziende che necessitano di ottimizzare modelli su larga scala. La pubblicazione del codice da parte dei ricercatori rappresenta un passo verso una più ampia adozione di questa tecnica.
Con possibilità di sviluppo future, come l’integrazione dei NAMM durante la fase di addestramento degli LLM, il potenziale di questa innovazione appare promettente per innovare l’efficienza dei sistemi di AI basati su Transformer.
