Pixtral 12B: Mistral introduce un modello multimodale che elabora immagini e testo | Mistral ai | Nuovo modello ia | Uscite ia | Turtles AI

Pixtral 12B: Mistral introduce un modello multimodale che elabora immagini e testo
Disponibile su GitHub e Hugging Face, Pixtral 12B promette di ampliare il campo delle applicazioni AI.

Pixtral 12B: il modello multimodale di Mistral che integra immagini e testo. La startup francese Mistral ha lanciato Pixtral 12B, un modello da 12 miliardi di parametri progettato per gestire sia immagini che testi. Disponibile gratuitamente su GitHub e Hugging Face, questo strumento promette di cambiare il panorama delle applicazioni AI per usi accademici e di ricerca.

Punti chiave:

  • Pixtral 12B: Nuovo modello multimodale da 12 miliardi di parametri di Mistral, capace di elaborare sia immagini che testi.
  • Disponibilità gratuita: Accessibile su GitHub e Hugging Face, con licenze specifiche per uso commerciale e accademico.
  • Integrazione futura: Presto disponibile per il testing su piattaforme proprietarie di Mistral.
  • Controversie sui dati: Dibattiti sull’uso di dati pubblici protetti da copyright per l’addestramento dei modelli.

 

Mistral, la giovane startup francese nel campo dell’AI, ha recentemente annunciato il rilascio di Pixtral 12B, un modello di deep learning da 12 miliardi di parametri che può elaborare immagini oltre al testo. Si tratta di un’evoluzione significativa, considerando che molti dei modelli esistenti si concentrano esclusivamente su una modalità alla volta. La capacità multimodale di Pixtral 12B consente di rispondere a domande relative a immagini di qualsiasi dimensione e risoluzione, offrendo un potenziale vasto di applicazioni in settori come il riconoscimento delle immagini, l’annotazione automatica e l’analisi visiva.

Pixtral 12B è basato su un precedente modello di Mistral, Nemo 12B, ottimizzato per l’elaborazione del linguaggio naturale. Integrando le capacità di elaborazione delle immagini, il nuovo modello sfrutta la robustezza della rete neurale per gestire sia input testuali che visivi. La sua implementazione è simile a quella di altri modelli multimodali, come quelli della famiglia Claude di Anthropic o il noto GPT-4 di OpenAI, permettendo funzioni avanzate come la didascalia delle immagini e il conteggio degli oggetti all’interno di una foto. La versatilità del modello è supportata da un vasto numero di parametri, 12 miliardi, che ne determina una maggiore precisione e capacità di risoluzione dei problemi rispetto ai modelli con meno parametri.

Il modello Pixtral 12B è disponibile per il download su GitHub e sulla piattaforma Hugging Face tramite un link torrent. Ciò permette a sviluppatori e ricercatori di accedere liberamente al modello, di ottimizzarlo ulteriormente e di adattarlo alle proprie esigenze. Tuttavia, il modello è distribuito con una licenza per lo sviluppo che prevede l’obbligo di una licenza a pagamento per l’uso commerciale, mentre per l’uso accademico e di ricerca non sono previsti costi. Al momento, Mistral non ha fornito dettagli precisi sulla licenza applicata a Pixtral 12B; alcuni dei suoi modelli sono rilasciati con licenza Apache 2.0, ma per questo nuovo modello non è stata ancora confermata la stessa modalità.

Attualmente, non è disponibile una demo web funzionante di Pixtral 12B, ma la startup ha dichiarato che il modello sarà presto testabile su Le Chat e Le Platforme, le sue piattaforme per chatbot e API. Secondo Sophia Yang, responsabile delle relazioni con gli sviluppatori di Mistral, l’integrazione sarà implementata nel prossimo futuro, consentendo agli utenti di esplorare appieno le capacità del modello.

Un aspetto che resta da chiarire riguarda i dati utilizzati per l’addestramento di Pixtral 12B. La maggior parte dei modelli generativi di AI, compresi quelli di Mistral, è addestrata su vasti insiemi di dati pubblici disponibili online, molti dei quali sono protetti da copyright. Questa pratica ha sollevato dibattiti sulla legittimità del "fair use", con alcuni fornitori di modelli che sostengono il diritto di raccogliere qualsiasi dato pubblico, mentre i titolari di diritti d’autore sono di parere contrario e hanno avviato azioni legali contro alcuni dei principali sviluppatori di AI, come OpenAI e Midjourney.

Il rilascio di Pixtral 12B arriva dopo un importante round di finanziamenti da 645 milioni di dollari guidato da General Catalyst, che ha portato la valutazione di Mistral a 6 miliardi di dollari. Mistral, fondata poco più di un anno fa e in parte di proprietà di Microsoft, è considerata da molti come la risposta europea a OpenAI. La strategia della giovane azienda fino ad ora ha previsto il rilascio di modelli "open" gratuiti, con l’opzione di versioni gestite a pagamento e servizi di consulenza per clienti aziendali. Questa duplice strategia potrebbe contribuire a consolidare la sua posizione di rilievo nel panorama globale dell’AI.

Considerando il contesto più ampio dell’AI, Pixtral 12B rappresenta un ulteriore passo avanti nella convergenza tra la comprensione del linguaggio e l’elaborazione delle immagini. L’integrazione di queste capacità in un singolo modello non solo amplia il campo delle applicazioni possibili, ma offre anche nuove prospettive di utilizzo nei settori dell’analisi dei dati visivi e della comunicazione multimodale.