Genmo lancia Mochi 1: un nuovo modello di generazione video open source | Generatore di immagini gratis online | Ia crea immagini gratis | Ai generator | Turtles AI
Genmo ha presentato in anteprima Mochi 1, un modello open source di generazione video basato su AI, promettendo miglioramenti nella qualità del movimento e nell’aderenza alle istruzioni degli utenti. Con un finanziamento di 28,4 milioni di dollari, l’azienda mira a sviluppare la creatività dell’AI.
Punti chiave:
- Mochi 1 è un modello open source per la generazione di video, con capacità avanzate di movimento.
- L’azienda ha raccolto 28,4 milioni di dollari in finanziamenti per sviluppare l’AI creativa.
- Il modello è in grado di generare video fluidi a 30 fps e supporta durate fino a 5,4 secondi.
- Mochi 1 include una nuova architettura di elaborazione, Asymmetric Diffusion Transformer, per un’ottimizzazione efficiente dei prompt.
Genmo ha annunciato l’anteprima del suo nuovo modello di generazione video, Mochi 1, disponibile in open source. Questo strumento è progettato per migliorare significativamente la qualità del movimento nei video e per garantire un’accurata corrispondenza con le indicazioni fornite dagli utenti. Contrariamente ad altri modelli di AI, spesso inclini a interpretazioni errate delle richieste, Mochi 1 è stato sviluppato per seguire scrupolosamente le istruzioni chiare e dettagliate degli utenti, risultando così più affidabile nella generazione di contenuti video. In aggiunta al modello, è stato presentato un playground interattivo, accessibile gratuitamente, che consente agli utenti di testare Mochi 1. I pesi del modello possono essere reperiti anche sulla piattaforma Hugging Face, una risorsa molto utilizzata per modelli di AI.
Genmo ha inoltre comunicato di aver recentemente ottenuto 28,4 milioni di dollari in un round di finanziamento di serie A, con il supporto di investitori come NEA, The House Fund e Gold House Ventures. Questi fondi saranno impiegati per esplorare e sviluppare ulteriormente quello che l’azienda definisce "il cervello destro dell’AI generale", un concetto associato alla creatività. Mochi 1 è considerato un passo iniziale verso la costruzione di capacità creative nell’AI, in un settore che ha visto significativi investimenti nella generazione video, specialmente dopo il lancio di soluzioni come i generatori video di Runway AI Inc. e Sora di OpenAI.
Il nuovo modello stabilisce standard elevati per il movimento realistico nei video, incorporando dinamiche fisiche come il movimento dei fluidi, la simulazione di pelliccia e capelli, e, in particolare, il movimento umano. Mochi 1 è capace di generare video fluidi a 30 fotogrammi al secondo per una durata massima di 5,4 secondi, che rappresenta una convenzione nel settore attuale. Quando gli utenti formulano richieste chiare, il modello si dimostra particolarmente preciso nella produzione di video che rispecchiano fedelmente le istruzioni fornite, consentendo un controllo dettagliato su personaggi, scene e altre variabili creative.
Per sviluppare Mochi 1, Genmo ha adottato un modello di diffusione contenente 10 miliardi di parametri, una cifra significativa che contribuisce alla precisione e all’accuratezza del modello. L’architettura Asymmetric Diffusion Transformer, utilizzata dal team, consente una gestione efficiente dei prompt degli utenti e dei token video compressi, ottimizzando l’elaborazione del testo in favore di elementi visivi. Questo approccio crea video attraverso l’uso congiunto di token di testo e visivi, simile a quanto realizzato da Stable Diffusion 3, ma con una capacità quattro volte superiore nel flusso di testo, grazie a una dimensione nascosta più ampia. La progettazione asimmetrica dell’architettura permette di ridurre il consumo di memoria.
L’anteprima di Mochi 1 offre attualmente una qualità video a 480p, con l’intenzione di rilasciare una versione completa entro la fine dell’anno, che includerà Mochi 1 HD. Questa versione avanzata supporterà la generazione di video a 720p, promettendo una fedeltà superiore e un movimento ancora più fluido. Genmo ha sottolineato che Mochi 1 è stato sviluppato da zero, rappresentando il più grande modello di generazione video open source attualmente disponibile. Con oltre 2 milioni di utenti già attivi nei modelli chiusi dell’azienda, il rilascio del codice sorgente e dei pesi di Mochi 1 sotto licenza open source Apache 2.0 su piattaforme come GitHub e Hugging Face rappresenta un’importante opportunità per sviluppatori e ricercatori nel campo dell’AI.
In attesa del rilascio completo, l’innovazione di Mochi 1 segna un passo importante nel panorama della generazione video basata su AI.
