Stability AI introduce Stable Virtual Camera, trasformando le immagini 2D in video 3D immersivi con una prospettiva accurata | Immagini da testo ai | Stable diffusion ai image generator | Generatore di immagini gratis | Turtles AI
Stable Virtual Camera è un modello di diffusione multi-view che trasforma immagini 2D in video 3D immersivi con profondità e prospettiva realistiche, senza necessità di ricostruzioni complesse o ottimizzazioni specifiche della scena. Supporta traiettorie della telecamera definite dall’utente e percorsi dinamici preimpostati, offrendo flessibilità nella generazione di video 3D da una o più immagini di input. Il modello è disponibile per uso di ricerca con una licenza non commerciale.
Punti chiave:
- Controllo dinamico della telecamera: Supporta traiettorie personalizzate e 14 percorsi dinamici predefiniti, tra cui 360°, lemniscata, spirale e dolly zoom.
- Input flessibili: Genera video 3D da una singola immagine o fino a 32 immagini di input.
- Proporzioni multiple: Capace di produrre video in formati quadrato (1:1), verticale (9:16), orizzontale (16:9) e altri formati personalizzati senza necessità di ulteriore addestramento.
- Generazione di video lunghi: Garantisce coerenza 3D in video fino a 1.000 fotogrammi, permettendo loop senza interruzioni e transizioni fluide.
Stable Virtual Camera rappresenta un avanzamento significativo nella generazione di video 3D a partire da immagini 2D. Questo modello di diffusione multi-view consente la creazione di video con profondità e prospettive realistiche senza la complessità delle tradizionali tecniche di ricostruzione 3D. Una delle caratteristiche distintive del modello è la capacità di generare video 3D da una singola immagine di input o fino a 32 immagini, seguendo traiettorie della telecamera definite dall’utente. Inoltre, offre 14 percorsi dinamici preimpostati, tra cui movimenti a 360°, lemniscata (percorso a forma di ∞), spirale, dolly zoom in e out, zoom in e out, spostamenti avanti e indietro, panoramiche verso l’alto, il basso, sinistra e destra, e rollio. Questa flessibilità permette agli utenti di esplorare diverse angolazioni e movimenti della telecamera senza necessità di configurazioni complesse.
Il modello supporta la produzione di video in vari formati, tra cui quadrato (1:1), verticale (9:16), orizzontale (16:9) e proporzioni personalizzate, senza richiedere ulteriore addestramento. Questa versatilità è particolarmente utile per adattarsi a diverse piattaforme e dispositivi. Inoltre, Stable Virtual Camera garantisce coerenza 3D in video fino a 1.000 fotogrammi, permettendo loop senza interruzioni e transizioni fluide, anche quando si rivisitano gli stessi punti di vista.
Nell’ambito della ricerca e dell’architettura del modello, Stable Virtual Camera ha dimostrato prestazioni all’avanguardia nei benchmark di sintesi della vista (NVS), superando modelli come ViewCrafter e CAT3D. Eccelle sia nella NVS a punto di vista ampio, che enfatizza la capacità di generazione, sia nella NVS a punto di vista piccolo, che dà priorità alla fluidità temporale. Il modello è stato addestrato come modello di diffusione multi-vista con una lunghezza di sequenza fissa, utilizzando un numero impostato di viste di input e target (M-in, N-out). Durante il campionamento, funziona come un renderer generativo flessibile, adattandosi a lunghezze di input e output variabili (P-in, Q-out). Questo è ottenuto tramite un processo di campionamento procedurale a due passaggi: prima generando viste di ancoraggio, poi rendendo viste di destinazione in blocchi per garantire risultati uniformi e coerenti.
È importante notare che, nella sua versione iniziale, Stable Virtual Camera potrebbe produrre risultati di qualità inferiore in determinati scenari. Immagini di input che presentano esseri umani, animali o texture dinamiche come l’acqua possono portare a output degradati. Inoltre, scene altamente ambigue, percorsi di telecamera complessi che intersecano oggetti o superfici, e oggetti di forma irregolare possono causare artefatti tremolanti, specialmente quando i punti di vista del target differiscono significativamente dalle immagini di input.
Stable Virtual Camera è disponibile per uso di ricerca con una licenza non commerciale. Gli interessati possono consultare il documento tecnico, scaricare i pesi su Hugging Face e accedere al codice su GitHub. Questo rilascio rappresenta un invito alla comunità di ricerca a esplorare le capacità del modello e a contribuire al suo sviluppo futuro.
Stable Virtual Camera offre una soluzione innovativa per la generazione di video 3D immersivi a partire da immagini 2D, combinando flessibilità, controllo preciso della telecamera e output di alta qualità, aprendo nuove possibilità nel campo della creatività digitale e della ricerca.
