Mistral AI lancia il modello AI NeMo con 12 miliardi di parametri | Large Language Models Italiano | Large Language Models Examples | Large Language Models Cosa Sono | Turtles AI
Punti chiave:
- Mistral AI lancia il modello AI NeMo con 12 miliardi di parametri.
- Finestra contestuale di 128.000 token e prestazioni avanzate in ragionamento e coding.
- Introduzione del tokenizzatore Tekken per una maggiore efficienza di compressione.
- Disponibilità open-source e integrazione con il microservizio NVIDIA NIM.
Mistral AI presenta NeMo: il nuovo modello AI con 12 miliardi di parametri e una finestra contestuale di 128.000 token, nato dalla collaborazione con NVIDIA, promette performance di alto livello e una facile integrazione.
Mistral AI ha annunciato NeMo, un modello AI con 12 miliardi di parametri, sviluppato in collaborazione con NVIDIA. Questo nuovo modello si distingue per una finestra contestuale estesa fino a 128.000 token e per le sue prestazioni all’avanguardia in termini di ragionamento, conoscenza del mondo e accuratezza nel coding, posizionandosi ai vertici della sua categoria di dimensioni.
Potete scaricare i pesi del modello base o del modello instruct da Huggingface.
La partnership tra Mistral AI e NVIDIA ha dato vita a un modello che non solo spinge i confini delle performance, ma facilita anche l’adozione e l’uso. Mistral NeMo è stato progettato per essere un sostituto diretto per i sistemi che attualmente utilizzano Mistral 7B, grazie alla sua architettura standardizzata.
Per promuovere l’adozione e la ricerca, Mistral AI ha reso disponibili sia i checkpoint base pre-addestrati sia quelli istruzionali sotto licenza Apache 2.0. Questo approccio open-source è destinato a interessare ricercatori e aziende, accelerando l’integrazione del modello in diverse applicazioni.
Uno dei punti di forza di Mistral NeMo è la sua consapevolezza della quantizzazione durante l’addestramento, che permette l’inferenza in FP8 senza compromettere le prestazioni. Questa capacità può risultare cruciale per le organizzazioni che desiderano distribuire modelli linguistici di grandi dimensioni in modo efficiente.
"Mistral NeMo è progettato per applicazioni globali e multilingue. È addestrato sul function calling, ha una grande finestra contestuale ed è particolarmente forte in inglese, francese, tedesco, spagnolo, italiano, portoghese, cinese, giapponese, coreano, arabo e hindi," ha spiegato Mistral AI. "Questo è un nuovo passo verso la diffusione dei modelli AI di frontiera nelle mani di tutti, in tutte le lingue che formano la cultura umana."
Mistral NeMo introduce Tekken, un nuovo tokenizzatore basato su Tiktoken. Addestrato su oltre 100 lingue, Tekken offre una maggiore efficienza di compressione per testi in linguaggio naturale e codice sorgente rispetto al tokenizzatore SentencePiece utilizzato nei modelli Mistral precedenti. La società riferisce che Tekken è circa il 30% più efficiente nella compressione del codice sorgente e di diverse lingue principali, con guadagni ancora maggiori per coreano e arabo.
Mistral AI sostiene inoltre che Tekken supera il tokenizzatore di Llama 3 nella compressione del testo per circa l’85% di tutte le lingue, potenzialmente conferendo a Mistral NeMo un vantaggio nelle applicazioni multilingue.
I pesi del modello sono ora disponibili su HuggingFace sia per la versione base che per quella istruzionale. Gli sviluppatori possono iniziare a sperimentare con Mistral NeMo utilizzando lo strumento mistral-inference e adattarlo con mistral-finetune. Per coloro che utilizzano la piattaforma di Mistral, il modello è accessibile con il nome open-mistral-nemo.
In un riconoscimento della collaborazione con NVIDIA, Mistral NeMo è anche confezionato come microservizio di inferenza NVIDIA NIM, disponibile tramite ai.nvidia.com. Questa integrazione potrebbe semplificare il deployment per le organizzazioni già investite nell’ecosistema AI di NVIDIA.
Il rilascio di Mistral NeMo rappresenta un passo avanti significativo nella democratizzazione dei modelli AI avanzati. Combinando alte prestazioni, capacità multilingue e disponibilità open-source, Mistral AI e NVIDIA stanno posizionando questo modello come uno strumento versatile per una vasta gamma di applicazioni AI nei diversi settori e campi di ricerca.
