Da StepFun un nuovo modello open source per il text-to-video | Generatore immagini ai | | Ia crea immagini gratis | Turtles AI

Da StepFun un nuovo modello open source per il text-to-video
Rilasciati i pesi di Step-Video-T2V, un modello di alta qualità
Editorial Team17 febbraio 2025

 


Step-Video-T2V rappresenta un avanzato modello text-to-video con 30 miliardi di parametri, capace di generare video di alta qualità fino a 204 frame. La sua efficienza è garantita da una VAE con elevata compressione spaziale e temporale, ottimizzata per la generazione di video fluidi e realistici. L’integrazione della Direct Preference Optimization (DPO) migliora ulteriormente la resa visiva, mentre il modello è valutato su un benchmark proprietario che ne conferma le prestazioni di livello SoTA.

Punti chiave:

  • Compressione avanzata: Video-VAE con rapporto spaziale 16x16 e temporale 8x per ottimizzare risorse e qualità.
  • Architettura sofisticata: Modello basato su DiT con attenzione 3D e ottimizzazioni per stabilità e coerenza.
  • Ottimizzazione guidata da preferenze umane: DPO impiegata per migliorare fedeltà e naturalezza delle animazioni.
  • Elevati requisiti hardware: Necessaria una GPU NVIDIA con almeno 80 GB di memoria per prestazioni ottimali.

Step-Video-T2V è un innovativo modello text-to-video all’avanguardia, progettato per generare video di elevata qualità basandosi su descrizioni testuali. Con una capacità di 30 miliardi di parametri, il sistema permette di produrre sequenze animate di massimo 204 frame, beneficiando di un’infrastruttura di compressione avanzata. La chiave dell’efficienza di Step-Video-T2V risiede nell’integrazione di una Video-VAE che assicura un rapporto di compressione spaziale di 16x16 e temporale di 8x, migliorando sensibilmente sia la fase di training che quella di inferenza. Questa struttura consente di ridurre significativamente il carico computazionale senza compromettere la qualità della ricostruzione video, un elemento fondamentale per l’ottimizzazione delle prestazioni.

L’architettura del modello si basa su un Transformer diffuso (DiT) con 48 livelli e altrettante teste di attenzione, ciascuna con una dimensione di 128. Il processo di generazione si avvale di un sistema di denoising basato su Flow Matching, che trasforma input rumorosi in frame latenti attraverso un meccanismo di attenzione 3D completo. I prompt vengono elaborati tramite due codificatori di testo pre-addestrati, ottimizzati per supportare sia l’inglese che il cinese, garantendo così una maggiore accessibilità e adattabilità del modello a diverse esigenze linguistiche.

Un elemento distintivo di Step-Video-T2V è l’adozione della Direct Preference Optimization (DPO), che introduce un livello di affinamento basato sul feedback umano. Questo processo consente di migliorare la qualità visiva dei video generati, riducendo artefatti e garantendo una resa più naturale e realistica. La pipeline DPO si configura come un passaggio essenziale nell’ottimizzazione del modello, poiché allinea le sue produzioni con le aspettative percettive degli utenti, elevando il livello di dettaglio e coerenza nelle sequenze video finali.

Per garantire il massimo delle prestazioni, Step-Video-T2V è stato testato su un sistema dotato di quattro GPU NVIDIA, con supporto CUDA necessario per il corretto funzionamento dell’auto-attenzione nei codificatori di testo. L’impiego di QK-Norm nell’auto-attenzione e di 3D RoPE per la gestione delle sequenze temporali assicura stabilità e adattabilità del modello anche in scenari di generazione complessi. Inoltre, per un utilizzo ottimale delle risorse GPU, il modello implementa una strategia di disaccoppiamento tra il codificatore di testo, la decodifica VAE e il Transformer DiT, garantendo un’inferenza più efficiente e bilanciata.

Le valutazioni sulle prestazioni di Step-Video-T2V sono state condotte su Step-Video-T2V-Eval, un benchmark specifico sviluppato per misurare la qualità dei video generati. I risultati hanno confermato che il modello raggiunge standard SoTA nel panorama della generazione video basata su testo, superando sia i motori open source che le soluzioni commerciali attualmente disponibili. Tuttavia, i test evidenziano che variazioni negli iperparametri di inferenza possono influenzare il bilanciamento tra fedeltà visiva e dinamicità delle animazioni, richiedendo un’accurata regolazione per ottenere il miglior compromesso possibile tra qualità e fluidità del video generato.

Step-Video-T2V rappresenta un significativo passo avanti nella generazione video automatica, combinando tecnologie di compressione, ottimizzazione basata su preferenze umane e un’infrastruttura hardware altamente performante.