Meta Reality Labs rivoluziona la visione artificiale con i modelli Sapiens | Meta AI chatbot | Meta Facebook login | Meta Business | Turtles AI
La nuova famiglia di modelli visivi Sapiens di Meta Reality Labs rappresenta un passo avanti nella comprensione delle immagini umane, ottimizzando attività cruciali come la stima della posa 2D, la segmentazione delle parti del corpo, la stima della profondità e la previsione delle normali superficiali. Questi modelli, con il supporto nativo per inferenze ad alta risoluzione, offrono un potenziale straordinario per applicazioni in ambienti reali.
Punti chiave:
- I modelli Sapiens di Meta Reality Labs eccellono in quattro compiti visivi umani: stima della posa 2D, segmentazione delle parti del corpo, stima della profondità e previsione delle normali superficiali.
- Supporto nativo per inferenze ad alta risoluzione fino a 1K, un miglioramento significativo rispetto agli approcci precedenti.
- Scalabilità delle prestazioni con modelli che vanno da 0,3 a 2 miliardi di parametri, potenziando i risultati con l’aumento della complessità del modello.
- Uso di un vasto dataset di 300 milioni di immagini umane e di dati sintetici per migliorare la precisione e la robustezza dei modelli in ambienti reali.
Meta Reality Labs ha recentemente svelato Sapiens, una nuova famiglia di modelli visivi progettati per affrontare quattro compiti fondamentali legati alla visione umana: la stima della posa 2D, la segmentazione delle parti del corpo, la stima della profondità e la previsione delle normali superficiali. Il punto di forza di questi modelli risiede nella loro capacità di gestire inferenze ad alta risoluzione, fino a 1K, che rappresenta un significativo miglioramento rispetto agli approcci precedenti. Ciò li rende particolarmente adatti per applicazioni che richiedono un alto livello di dettaglio e precisione, come la digitalizzazione umana in 3D e altre applicazioni di computer vision.
Una delle caratteristiche più innovative dei modelli Sapiens è la loro scalabilità. La performance dei modelli migliora in modo sostanziale con l’aumentare del numero di parametri, che vanno da 0,3 a 2 miliardi. Questo significa che, con un’adeguata potenza computazionale, è possibile ottenere risultati sempre migliori man mano che il modello viene potenziato. I modelli sono stati pre-addestrati su un vasto dataset di 300 milioni di immagini umane scattate in condizioni naturali e selvagge (in-the-wild), il che conferisce loro una notevole capacità di generalizzazione anche quando i dati etichettati sono scarsi o sintetici.
L’architettura di Sapiens si basa su trasformatori di visione (Vision Transformers - ViT) e utilizza un approccio di pre-addestramento auto-supervisionato con un encoder-decoder, che viene successivamente affinato per compiti specifici. Questa architettura è stata scelta per la sua semplicità e per la sua efficacia nell’elaborare immagini ad alta risoluzione. In particolare, la risoluzione nativa di pre-addestramento è stata aumentata a 1024 pixel, un salto significativo rispetto agli standard precedenti. Questo ha comportato un incremento delle operazioni di floating-point (FLOP) di circa quattro volte rispetto ai backbone di visione più grandi esistenti.
Un altro aspetto cruciale del progetto Sapiens è stato l’uso di dati sintetici e annotazioni di alta qualità per migliorare la precisione e la robustezza del modello. Ad esempio, per la stima della posa, il team ha sviluppato un set di annotazioni molto più denso rispetto a quelli esistenti, comprendente 308 punti chiave che coprono l’intero corpo, le mani, i piedi e il viso. Allo stesso modo, il vocabolario di segmentazione delle parti del corpo è stato esteso a 28 classi, includendo dettagli come capelli, lingua, denti e labbra.
Per quanto riguarda la valutazione delle prestazioni, i modelli Sapiens hanno superato consistentemente i benchmark esistenti in tutti e quattro i compiti visivi umani. Ad esempio, nella stima della posa, Sapiens ha superato il precedente stato dell’arte sul dataset Humans-5K con un miglioramento di 7,6 punti in mAP. Nella segmentazione delle parti del corpo, Sapiens ha ottenuto un incremento di 17,1 in mIoU sul dataset Humans-2K, mentre nella stima della profondità e nella previsione delle normali, ha registrato miglioramenti del 22,4% e del 53,5% rispettivamente sui dataset Hi4D e THuman2.
Questi risultati sono stati ottenuti grazie all’adozione di un approccio di pre-addestramento su larga scala combinato con annotazioni specifiche e di alta qualità, che ha permesso ai modelli di generalizzare efficacemente in ambienti reali senza la necessità di costosi e complessi set di annotazioni. L’approccio "pre-addestra e affina" adottato, in cui i modelli vengono prima pre-addestrati su un vasto dataset e poi adattati a compiti specifici con minime modifiche, si è dimostrato particolarmente efficace nel contesto delle immagini umane.
In un contesto più ampio, lo sviluppo di modelli come Sapiens riflette l’evoluzione continua della ricerca AI, in particolare nel campo della visione artificiale. Questi modelli non solo migliorano le capacità esistenti, ma aprono anche nuove possibilità per applicazioni future in settori come la realtà aumentata, la sorveglianza e l’intrattenimento digitale.
