Allegro è un nuovo strumento per la generazione di video da testo | Midjourney ai art | Buongiorno nuovissimi | Stable diffusion image to-image | Turtles AI
Rhymes AI ha rilasciato Allegro, un modello open source per la generazione di video a partire da input testuali. Questa innovativa tecnologia promette di offrire nuove opportunità a creatori e ricercatori, favorendo la creatività visiva.
Punti chiave:
- Allegro trasforma prompt di testo in brevi videoclip di alta qualità.
- Supporta video di 6 secondi a 15 fotogrammi al secondo con risoluzione 720p.
- Utilizza tecnologie avanzate per la compressione e la generazione video.
- È completamente open source, incoraggiando la collaborazione della comunità.
Allegro, il nuovo modello di Rhymes AI, rappresenta un avanzato strumento per la generazione di video a partire da semplici descrizioni testuali. Questa tecnologia consente di creare videoclip di alta qualità, variando da 6 secondi a una risoluzione di 720x1280 pixel, con un frame rate di 15 fotogrammi al secondo, che può essere interpolato a 30 FPS. Grazie alla sua versatilità, Allegro permette agli utenti di esplorare una gamma di contenuti, dalle scene con dettagli di volti umani a dinamiche rappresentazioni di animali in movimento. Per raggiungere questo livello di qualità, Rhymes AI ha implementato una serie di processi tecnici che consentono una gestione efficace di dati video su larga scala. In particolare, è stato necessario sviluppare pipeline di elaborazione e filtraggio per estrarre video grezzi, che sono stati successivamente strutturati per facilitare l’addestramento del modello. La compressione dei video raw è un’altra fase importante, resa possibile attraverso un Video Variational Autoencoder (VideoVAE). Questo sistema consente di codificare i video in uno spazio latente spazio-temporale, mantenendo i dettagli necessari per una generazione video fluida. Al centro delle capacità di Allegro si trova l’architettura di trasformazione di diffusione, progettata per generare fotogrammi video di alta qualità e fluidità. Questa architettura si avvale di un Diffusion Transformer, dotato di tecnologie di attenzione e incorporamento della posizione, che riesce a catturare in modo efficiente le relazioni spaziali e temporali all’interno dei dati video. Mentre il modello presenta già funzionalità impressionanti, Rhymes AI sta lavorando per integrare miglioramenti futuri, come la generazione di video narrativi e la capacità di controllare il movimento all’interno delle clip. Con la decisione di rendere Allegro open source, Rhymes AI si propone di rendere la creazione di video AI più accessibile, invitando la comunità a esplorare e a sviluppare ulteriormente questa tecnologia.
Un passo importante nel panorama dei video generati dall’AI.
