Nuovo studio svela i limiti visivi dei modelli AI multimodali | Bcg Generative ai pdf | Generative ai Tools for Images | Generative ai Examples | Turtles AI

Nuovo studio svela i limiti visivi dei modelli AI multimodali
Uno studio dimostra che i modelli AI non vedono come gli umani

Punti chiave

  • I modelli multimodali di AI hanno difficoltà con semplici compiti visivi.
  • Lo studio mostra che i modelli non "vedono" veramente, ma riconoscono pattern basati su dati di addestramento.
  • La "cecità" dei modelli si manifesta in compiti come la sovrapposizione di forme e il conteggio di oggetti.
  • Nonostante i limiti, i modelli rimangono utili per compiti specifici come l’interpretazione di azioni umane e oggetti comuni.

 

I modelli di linguaggio più recenti, come GPT-4o e Gemini 1.5 Pro, sono descritti come "multimodali", in grado di comprendere immagini e audio oltre al testo. Tuttavia, uno studio recente dimostra che questi modelli non vedono realmente come ci si potrebbe aspettare.

 

I nuovi modelli di AI come GPT-4o e Gemini 1.5 Pro sono pubblicizzati come "multimodali", capaci di comprendere immagini, audio e testo. Tuttavia, uno studio condotto dai ricercatori dell’Università di Auburn e dell’Università di Alberta rivela che queste capacità visive sono molto lontane dall’essere paragonabili a quelle umane. Sebbene i materiali promozionali di queste aziende parlino di "capacità visive" e "comprensione visiva", suggerendo che i modelli possano analizzare immagini e video, la realtà è che il loro funzionamento è basato sulla corrispondenza di pattern nei dati di input con quelli presenti nei loro set di addestramento.

 

Lo studio ha sottoposto i modelli multimodali a una serie di compiti visivi semplicissimi, come determinare se due forme si sovrappongono, contare il numero di pentagoni in un’immagine, o identificare quale lettera di una parola è cerchiata. Questi sono compiti che anche un bambino di prima elementare riuscirebbe a risolvere facilmente, ma che hanno messo in seria difficoltà i modelli di AI. Ad esempio, nel test delle forme sovrapposte, i modelli non sono riusciti a distinguere correttamente tra due cerchi che si sovrappongono, si toccano appena, o sono distanti tra loro.

 

TestRisultato dei modelli

Sovrapposizione di cerchi                                        18% di accuratezza con distanze ridotte (GPT-4o), 70% con distanze maggiori

Conteggio di cerchi interconnessi                         100% accuratezza con cinque cerchi, risultati disastrosi con sei o più cerchi

Conteggio di pentagoni                                            Risultati variabili e spesso inaccurati

 

I risultati dello studio dimostrano che, sebbene i modelli possano riconoscere pattern familiari, come i cinque cerchi del logo delle Olimpiadi, falliscono miseramente quando si tratta di configurazioni leggermente diverse. Questo suggerisce che non "vedono" veramente le immagini, ma piuttosto fanno riferimento a dati di addestramento specifici che contengono descrizioni dettagliate di certi oggetti o simboli.

 

Questa "cecità" dei modelli AI, come viene definita dai ricercatori, non è facilmente riconducibile a un’assenza totale di percezione visiva, ma piuttosto a un’elaborazione approssimativa e astratta delle informazioni visive. I modelli possono identificare una forma come "un cerchio a sinistra", ma non sono in grado di fare giudizi visivi complessi. Questo fenomeno è ulteriormente evidenziato quando i modelli vengono interrogati su immagini con cerchi di diversi colori sovrapposti: la risposta spesso riflette una comprensione errata, come suggerire che l’intersezione di un cerchio blu e uno verde sia di colore ciano, cosa che potrebbe sembrare plausibile solo a occhi chiusi.

 

Nonostante questi limiti, è importante notare che i modelli multimodali di AI sono ancora estremamente utili per compiti specifici come l’interpretazione di azioni umane, espressioni facciali e oggetti comuni. Tuttavia, gli studi come questo sono fondamentali per comprendere le reali capacità e limitazioni di questi modelli, andando oltre le affermazioni di marketing che potrebbero far credere che essi abbiano una visione pari a quella umana.