MemOS: la nuova architettura che dà memoria duratura all’AI | Large language model italiano | Llm ai | Llm wikipedia | Turtles AI

MemOS: la nuova architettura che dà memoria duratura all’AI
Un sistema ispirato al cervello umano consente ai modelli linguistici di ricordare, apprendere e condividere informazioni nel tempo, con prestazioni superiori, bassa latenza e interoperabilità tra strumenti
Editorial Team9 luglio 2025

 

 

MemOS introduce una gestione strutturata della memoria per LLM, replicando le gerarchie cerebrali con MemCube e promettendo richiamo persistente, latenza ridotta e apprendimento continuo. Integrazione open source per ambienti LLM e RAG.

Punti chiave:

  • Architettura a tre livelli (API, scheduler, storage) ispirata a corteccia e ippocampo.
  • MemCube unificano testo, attivazioni e parametri con metadata e cicli di vita.
  • Iniezione KV-cache diminuisce la latenza TTFT del 94%.
  • Su benchmark LOCOMO, +159 % nel ragionamento temporale e +39 % QA multi-hop.

MemOS è stato proposto da un gruppo di ricerca guidato da Shanghai Jiao Tong University, Zhejiang University e MemTensor, e descritto in un paper pubblicato su arXiv il 4 luglio 2025. Questo sistema operativo per memoria ripensa il modo in cui gli LLM trattano le informazioni: non più come monoliti apatici, ma come sistemi in grado di accumulare esperienze strutturate e selezionabili nel tempo. Gli LLM odierni soffrono del problema dei “silos di memoria”: ogni sessione si comporta come se fosse scollegata da quella precedente, i pesi restano statici e persino tecniche come il RAG non garantiscono persistenza.

Per affrontare questo, MemOS introduce i MemCube, oggetti che includono contenuto (testo, embeddings, parametri), metadata (provenienza, versioni, permessi) e regole di ciclo di vita. Questi cubi possono essere compressi, migrati o fusi per creare strutture complesse e adattive, emulando come i neuroni formano ricordi. La memoria è orchestrata tramite una stack a tre livelli: l’interfaccia API (“corteccia”), il MemScheduler (“corteccia prefrontale”) e l’infrastruttura di storage (“ippocampo”), con tier gerarchici (caldo, tiepido, freddo).

Un elemento tecnico di spicco è la KV‑cache injection, che inserisce direttamente nelle dinamiche dell’attenzione le attivazioni rilevanti, riducendo la latenza time‑to‑first‑token del 94 %. Questo si traduce in risposte più rapide e una riduzione delle allucinazioni del modello.

Sul fronte empirico, i test su LOCOMO mostrano un miglioramento medio del 38,98 % rispetto ai sistemi di memoria OpenAI, con un incredibile +159 % nel ragionamento temporale (Medium, VentureBeat). Inoltre, MemOS ottiene una riduzione fino al 60 % dei token necessari, ottimizzando l’efficienza sia in prestazioni che risorse.

Un aspetto distintivo riguarda l’interoperabilità: MemCube portabili permettono di condividere memoria tra modelli e strumenti diversi, abbattendo le “isole” come ChatGPT e Claude. Nascono così scenari di flussi continui tra marketing, medicina e istruzione, con memoria a valore commerciale.

L’adozione di MemOS può favorire l’apprendimento continuo, in cui i modelli evolvono integrando esperienze reali, decidono cosa tenere o comprimere (memoria metacognitiva) e condividono strutture tra agenti, avvicinandosi alla coerenza cognitiva umana. Supporto open source già presente su GitHub e integrazioni con Hugging Face, API OpenAI e Ollama (Linux, presto Win/macOS).

Per chi opera con pipeline RAG, MemOS può rappresentare un upgrade: si parte da preferenze utente a breve termine, fino a modelli evoluti di conoscenza strutturata. I ricercatori suggeriscono l’integrazione progressiva per maturare un sistema personalizzato e resiliente.

In definitiva, MemOS rappresenta un nuovo modello di architettura mnemonica per l’AI, non figlia di una pura scala di modelli, ma di un design cognitivo più robusto. Nessuna conclusione, ma un’evoluzione concreta che permette agli LLM di ricordare, ragionare e adattarsi con continuità.