Stability AI introduce Stable Virtual Camera, trasformando le immagini 2D in video 3D immersivi con una prospettiva accurata | Immagini da testo ai | Stable diffusion ai image generator | Generatore di immagini gratis | Turtles AI

Stability AI introduce Stable Virtual Camera, trasformando le immagini 2D in video 3D immersivi con una prospettiva accurata
Un nuovo approccio alla generazione di video 3D da immagini 2D con controllo avanzato della telecamera
Editorial Team18 marzo 2025

 

 Stable Virtual Camera è un modello di diffusione multi-view che trasforma immagini 2D in video 3D immersivi con profondità e prospettiva realistiche, senza necessità di ricostruzioni complesse o ottimizzazioni specifiche della scena. Supporta traiettorie della telecamera definite dall’utente e percorsi dinamici preimpostati, offrendo flessibilità nella generazione di video 3D da una o più immagini di input. Il modello è disponibile per uso di ricerca con una licenza non commerciale.

Punti chiave:

  • Controllo dinamico della telecamera: Supporta traiettorie personalizzate e 14 percorsi dinamici predefiniti, tra cui 360°, lemniscata, spirale e dolly zoom.
  • Input flessibili: Genera video 3D da una singola immagine o fino a 32 immagini di input.
  • Proporzioni multiple: Capace di produrre video in formati quadrato (1:1), verticale (9:16), orizzontale (16:9) e altri formati personalizzati senza necessità di ulteriore addestramento.
  • Generazione di video lunghi: Garantisce coerenza 3D in video fino a 1.000 fotogrammi, permettendo loop senza interruzioni e transizioni fluide.

Stable Virtual Camera rappresenta un avanzamento significativo nella generazione di video 3D a partire da immagini 2D. Questo modello di diffusione multi-view consente la creazione di video con profondità e prospettive realistiche senza la complessità delle tradizionali tecniche di ricostruzione 3D. Una delle caratteristiche distintive del modello è la capacità di generare video 3D da una singola immagine di input o fino a 32 immagini, seguendo traiettorie della telecamera definite dall’utente. Inoltre, offre 14 percorsi dinamici preimpostati, tra cui movimenti a 360°, lemniscata (percorso a forma di ∞), spirale, dolly zoom in e out, zoom in e out, spostamenti avanti e indietro, panoramiche verso l’alto, il basso, sinistra e destra, e rollio. Questa flessibilità permette agli utenti di esplorare diverse angolazioni e movimenti della telecamera senza necessità di configurazioni complesse.

Il modello supporta la produzione di video in vari formati, tra cui quadrato (1:1), verticale (9:16), orizzontale (16:9) e proporzioni personalizzate, senza richiedere ulteriore addestramento. Questa versatilità è particolarmente utile per adattarsi a diverse piattaforme e dispositivi. Inoltre, Stable Virtual Camera garantisce coerenza 3D in video fino a 1.000 fotogrammi, permettendo loop senza interruzioni e transizioni fluide, anche quando si rivisitano gli stessi punti di vista.

Nell’ambito della ricerca e dell’architettura del modello, Stable Virtual Camera ha dimostrato prestazioni all’avanguardia nei benchmark di sintesi della vista (NVS), superando modelli come ViewCrafter e CAT3D. Eccelle sia nella NVS a punto di vista ampio, che enfatizza la capacità di generazione, sia nella NVS a punto di vista piccolo, che dà priorità alla fluidità temporale. Il modello è stato addestrato come modello di diffusione multi-vista con una lunghezza di sequenza fissa, utilizzando un numero impostato di viste di input e target (M-in, N-out). Durante il campionamento, funziona come un renderer generativo flessibile, adattandosi a lunghezze di input e output variabili (P-in, Q-out). Questo è ottenuto tramite un processo di campionamento procedurale a due passaggi: prima generando viste di ancoraggio, poi rendendo viste di destinazione in blocchi per garantire risultati uniformi e coerenti.

È importante notare che, nella sua versione iniziale, Stable Virtual Camera potrebbe produrre risultati di qualità inferiore in determinati scenari. Immagini di input che presentano esseri umani, animali o texture dinamiche come l’acqua possono portare a output degradati. Inoltre, scene altamente ambigue, percorsi di telecamera complessi che intersecano oggetti o superfici, e oggetti di forma irregolare possono causare artefatti tremolanti, specialmente quando i punti di vista del target differiscono significativamente dalle immagini di input.

Stable Virtual Camera è disponibile per uso di ricerca con una licenza non commerciale. Gli interessati possono consultare il documento tecnico, scaricare i pesi su Hugging Face e accedere al codice su GitHub. Questo rilascio rappresenta un invito alla comunità di ricerca a esplorare le capacità del modello e a contribuire al suo sviluppo futuro.

 Stable Virtual Camera offre una soluzione innovativa per la generazione di video 3D immersivi a partire da immagini 2D, combinando flessibilità, controllo preciso della telecamera e output di alta qualità, aprendo nuove possibilità nel campo della creatività digitale e della ricerca.