Pixtral Large: un passo avanti nelle AI multimodali | Immagini sfondo | | Crea immagini intelligenza artificiale | Turtles AI

Pixtral Large: un passo avanti nelle AI multimodali
Con 124 miliardi di parametri, il nuovo modello di Mistral AI eccelle nell’elaborazione di testo e immagini, offrendo prestazioni superiori in scenari complessi
Editorial Team19 novembre 2024

 


Pixtral Large è il nuovo modello multimodale open-weight sviluppato da Mistral AI, che combina un’architettura di 124 miliardi di parametri con capacità avanzate nella comprensione delle immagini e del testo. Rispetto al suo predecessore, Mistral Large 2, offre prestazioni superiori in diversi benchmark, tra cui MathVista, DocVQA e VQAv2. La sua architettura include un decoder multimodale da 123 miliardi di parametri e un encoder visivo da 1 miliardo, con una finestra di contesto da 128K che consente l’elaborazione di immagini ad alta risoluzione. Questo modello è destinato a una varietà di applicazioni, tra cui la ricerca accademica e l’uso commerciale, con licenze adatte a diversi scopi.  


Punti chiave:

  •  Pixtral Large raggiunge performance da leader nel settore nei benchmark multimodali.  
  •  Supera modelli avanzati come GPT-4o e Gemini-1.5 Pro in compiti complessi.  
  •  Il modello estende Mistral Large 2 senza compromessi sulle capacità di comprensione del testo.  
  •  Disponibile sia per uso didattico e di ricerca che commerciale.  

Mistral AI, nota per le sue innovazioni nel campo dell’AI, ha recentemente annunciato l’introduzione di "Pixtral Large", un modello multimodale di 124 miliardi di parametri che si colloca ai vertici delle prestazioni in vari compiti di comprensione del testo e delle immagini. Costruito a partire dall’architettura di Mistral Large 2, "Pixtral Large" offre una fusione avanzata di capacità linguistiche e visive, rendendolo particolarmente potente per l’analisi di documenti, grafici e immagini naturali. Rispetto al suo predecessore, "Pixtral Large" conserva l’eccellenza di Mistral Large 2 nelle prestazioni testuali, senza compromessi sulla qualità dell’analisi visiva. Questa evoluzione si traduce in un modello che, pur essendo orientato verso l’intelligenza artificiale multimodale, non rinuncia alla potenza nel trattamento del linguaggio naturale.  

Il cuore di "Pixtral Large" è rappresentato dal suo decoder multimodale da 123 miliardi di parametri e un encoder visivo con 1 miliardo di parametri. La particolarità di questo sistema risiede nella sua finestra di contesto estesa, pari a 128K, che permette al modello di gestire fino a 30 immagini ad alta risoluzione simultaneamente. Una caratteristica che, in combinazione con le capacità avanzate di elaborazione del testo, consente di affrontare con efficacia una vasta gamma di applicazioni, dal ragionamento matematico complesso all’analisi di grafici e diagrammi.  

Una delle aree in cui "Pixtral Large" si distingue è il benchmark MathVista, che valuta il ragionamento matematico complesso applicato a dati visivi. Con un punteggio di 69,4%, il modello supera nettamente altri concorrenti, dimostrando una comprensione superiore in compiti di calcolo e logica applicata a immagini. In scenari di analisi dei dati, "Pixtral Large" batte anche modelli di punta come GPT-4o e Gemini-1.5 Pro in test come ChartQA e DocVQA, che misurano la capacità di comprendere grafici e documenti complessi. Questo lo posiziona come un modello di riferimento per applicazioni che richiedono la fusione di dati visivi e testuali per una comprensione accurata e contestualizzata.  

Un altro test di rilievo è MM-MT-Bench, una valutazione basata su giudici open source che simula casi d’uso reali per i modelli multimodali. In questa competizione, "Pixtral Large" ha superato anche i più recenti modelli di punta, come il Claude-3.5 Sonnet, Gemini-1.5 Pro e GPT-4o. Questi risultati pongono "Pixtral Large" come una delle soluzioni più robuste e versatili nel panorama dei modelli multimodali, in grado di affrontare una vasta gamma di sfide in scenari pratici.  

Mistral AI ha reso disponibile "Pixtral Large" con due tipi di licenze: la Mistral Research License (MRL), che consente l’uso per scopi di ricerca e didattici, e la Mistral Commercial License, che permette l’adozione del modello in ambienti aziendali per scopi sperimentali, di collaudo e produttivi. Questo modello non è solo una risorsa per la ricerca accademica, ma anche un potente strumento per migliorare i flussi di lavoro aziendali, dall’automazione dei processi all’elaborazione semantica dei documenti, all’arricchimento dell’esperienza del cliente.  

Oltre a "Pixtral Large", anche "Mistral Large 24.11", una versione aggiornata del modello di solo testo Mistral Large, ha ricevuto miglioramenti significativi, in particolare nella comprensione del contesto lungo e nell’integrazione con flussi di lavoro RAG (Retrieval-Augmented Generation) e agent-based. Questi aggiornamenti rendono Mistral Large particolarmente adatto per casi d’uso aziendali, come la gestione della conoscenza e l’automazione delle attività. Questo modello sarà presto disponibile attraverso partner cloud come Google Cloud e Microsoft Azure.  

In un nostro articolo, avevamo esplorato le potenzialità di Pixtral e i suoi impatti nel mondo della ricerca linguistica, ma con l’arrivo di "Pixtral Large" Mistral AI segna un passo importante verso un’AI ancora più sofisticata, capace di integrare e analizzare informazioni multimodali con prestazioni all’avanguardia. 

Con la continua evoluzione delle capacità multimodali, modelli come "Pixtral Large" offrono nuove possibilità per applicazioni in ambito aziendale, educativo e di ricerca, aprendo la strada a un futuro in cui l’AI sarà sempre più in grado di comprendere e interagire con il mondo in modo completo e integrato.