Nuovo studio svela i limiti visivi dei modelli AI multimodali | Bcg Generative ai pdf | Generative ai Tools for Images | Generative ai Examples | Turtles AI
Punti chiave
- I modelli multimodali di AI hanno difficoltà con semplici compiti visivi.
- Lo studio mostra che i modelli non "vedono" veramente, ma riconoscono pattern basati su dati di addestramento.
- La "cecità" dei modelli si manifesta in compiti come la sovrapposizione di forme e il conteggio di oggetti.
- Nonostante i limiti, i modelli rimangono utili per compiti specifici come l’interpretazione di azioni umane e oggetti comuni.
I modelli di linguaggio più recenti, come GPT-4o e Gemini 1.5 Pro, sono descritti come "multimodali", in grado di comprendere immagini e audio oltre al testo. Tuttavia, uno studio recente dimostra che questi modelli non vedono realmente come ci si potrebbe aspettare.
I nuovi modelli di AI come GPT-4o e Gemini 1.5 Pro sono pubblicizzati come "multimodali", capaci di comprendere immagini, audio e testo. Tuttavia, uno studio condotto dai ricercatori dell’Università di Auburn e dell’Università di Alberta rivela che queste capacità visive sono molto lontane dall’essere paragonabili a quelle umane. Sebbene i materiali promozionali di queste aziende parlino di "capacità visive" e "comprensione visiva", suggerendo che i modelli possano analizzare immagini e video, la realtà è che il loro funzionamento è basato sulla corrispondenza di pattern nei dati di input con quelli presenti nei loro set di addestramento.
Lo studio ha sottoposto i modelli multimodali a una serie di compiti visivi semplicissimi, come determinare se due forme si sovrappongono, contare il numero di pentagoni in un’immagine, o identificare quale lettera di una parola è cerchiata. Questi sono compiti che anche un bambino di prima elementare riuscirebbe a risolvere facilmente, ma che hanno messo in seria difficoltà i modelli di AI. Ad esempio, nel test delle forme sovrapposte, i modelli non sono riusciti a distinguere correttamente tra due cerchi che si sovrappongono, si toccano appena, o sono distanti tra loro.
TestRisultato dei modelli
Sovrapposizione di cerchi 18% di accuratezza con distanze ridotte (GPT-4o), 70% con distanze maggiori
Conteggio di cerchi interconnessi 100% accuratezza con cinque cerchi, risultati disastrosi con sei o più cerchi
Conteggio di pentagoni Risultati variabili e spesso inaccurati
I risultati dello studio dimostrano che, sebbene i modelli possano riconoscere pattern familiari, come i cinque cerchi del logo delle Olimpiadi, falliscono miseramente quando si tratta di configurazioni leggermente diverse. Questo suggerisce che non "vedono" veramente le immagini, ma piuttosto fanno riferimento a dati di addestramento specifici che contengono descrizioni dettagliate di certi oggetti o simboli.
Questa "cecità" dei modelli AI, come viene definita dai ricercatori, non è facilmente riconducibile a un’assenza totale di percezione visiva, ma piuttosto a un’elaborazione approssimativa e astratta delle informazioni visive. I modelli possono identificare una forma come "un cerchio a sinistra", ma non sono in grado di fare giudizi visivi complessi. Questo fenomeno è ulteriormente evidenziato quando i modelli vengono interrogati su immagini con cerchi di diversi colori sovrapposti: la risposta spesso riflette una comprensione errata, come suggerire che l’intersezione di un cerchio blu e uno verde sia di colore ciano, cosa che potrebbe sembrare plausibile solo a occhi chiusi.
Nonostante questi limiti, è importante notare che i modelli multimodali di AI sono ancora estremamente utili per compiti specifici come l’interpretazione di azioni umane, espressioni facciali e oggetti comuni. Tuttavia, gli studi come questo sono fondamentali per comprendere le reali capacità e limitazioni di questi modelli, andando oltre le affermazioni di marketing che potrebbero far credere che essi abbiano una visione pari a quella umana.
