Meta SAM 2 per la segmentazione in tempo reale di immagini e video | | | | Turtles AI
Meta Rilascia SAM 2: Innovazioni nella Segmentazione di Immagini e Video
Punti chiave :
- Unificazione della Segmentazione: SAM 2 segmenta oggetti in immagini e video in tempo reale.
- Open Source: Codice e modelli rilasciati con licenza Apache 2.0, dataset SA-V con licenza CC BY 4.0.
- Prestazioni Avanzate: Miglioramenti significativi in accuratezza e velocità rispetto ai modelli precedenti.
- Ampie Applicazioni: Dall’editing video all’annotazione di dati per sistemi di visione artificiale.
Meta ha annunciato il rilascio di SAM 2, una versione avanzata del Meta Segment Anything Model, che estende le capacità di segmentazione degli oggetti dalle immagini ai video, operando in tempo reale. SAM 2 rappresenta un passo significativo verso una segmentazione unificata di immagini e video, offrendo nuove possibilità sia per applicazioni pratiche che per la ricerca scientifica.
SAM 2 è stato rilasciato con una licenza open source Apache 2.0, permettendo a chiunque di accedere al codice e ai pesi del modello. Inoltre, Meta ha condiviso il set di dati SA-V, composto da circa 51.000 video e oltre 600.000 masklet (maschere spazio-temporali), con una licenza CC BY 4.0, rendendolo uno dei più grandi dataset di segmentazione video disponibili.
Il nuovo modello si distingue per la sua capacità di segmentare oggetti in qualsiasi video o immagine, anche se mai visti prima, grazie alla generalizzazione zero-shot. Questo consente l’utilizzo di SAM 2 senza necessità di adattamenti personalizzati, facilitando una vasta gamma di applicazioni.
SAM 2 ha potenziali utilizzi in vari settori. Può essere impiegato nell’editing video per creare nuovi effetti, migliorare gli strumenti di annotazione dei dati visivi e assistere nella costruzione di sistemi di visione artificiale avanzati. Le sue prestazioni rapide e accurate lo rendono particolarmente utile in applicazioni che richiedono segmentazione in tempo reale, come la robotica e i veicoli autonomi.
Il set di dati SA-V è stato sviluppato utilizzando un approccio interattivo model-in-the-loop, con annotatori umani che utilizzano SAM 2 per creare masklet nei video. Questo ciclo iterativo ha permesso di migliorare sia il modello che il dataset, portando a una raccolta di dati significativamente più ampia e diversificata rispetto ai set di dati precedenti.
SAM 2 introduce un’architettura di memoria avanzata per gestire la segmentazione nei video, memorizzando informazioni sugli oggetti segmentati e utilizzandole per migliorare le previsioni nei frame successivi. Questo approccio consente di mantenere l’accuratezza della segmentazione anche in presenza di occlusioni e cambiamenti di illuminazione.
I risultati di SAM 2 mostrano prestazioni superiori rispetto ai modelli precedenti, con un miglioramento significativo nella segmentazione interattiva dei video e una riduzione del tempo di interazione umana necessaria. La sua capacità di segmentare in tempo reale a 44 fotogrammi al secondo lo rende ideale per applicazioni che richiedono una risposta immediata.
Il rilascio di SAM 2 e del dataset SA-V rappresenta un importante contributo alla comunità dell’intelligenza artificiale, promuovendo ulteriori ricerche e sviluppi in questo campo. Meta invita ricercatori e sviluppatori a esplorare le potenzialità di SAM 2, sperimentando nuove applicazioni e casi d’uso che possano beneficiare delle sue avanzate capacità di segmentazione.
Con SAM 2, Meta continua a spingere i confini della visione artificiale, offrendo strumenti potenti e accessibili che possono avere un impatto significativo su vari settori, dalla creatività alla ricerca scientifica e medica.
