MiniGPT-4: il nuovo arrivato | Intelligenza Artificiale in Chirurgia | Chatgpt 4 Immagini | Intelligenza Artificiale Google Gratis | Turtles AI

MiniGPT-4: il nuovo arrivato
DukeRem19 aprile 2023
  Come i nostri lettori sanno, il #GPT-4 è in grado di generare #siti web da testi scritti a mano e di identificare elementi umoristici all’interno di immagini, un’impresa che non è stata osservata in precedenti modelli di visione-linguaggio. Gli esperti ritengono che le avanzate capacità multimodali di GPT-4 possano essere attribuite all’utilizzo di un Large Language Model (LLM) più avanzato. Per studiare questo fenomeno, i ricercatori hanno presentato MiniGPT-4, che allinea un codificatore visivo congelato con un LLM congelato, Vicuna, utilizzando un solo strato di proiezione. I risultati di questo studio rivelano che MiniGPT-4 possiede molte capacità simili a quelle esibite da GPT-4, come la generazione di descrizioni dettagliate di immagini e la creazione di siti web da bozze scritte a mano. Inoltre, MiniGPT-4 mostra anche altre capacità emergenti, come la scrittura di storie e poesie ispirate a immagini date, la fornitura di soluzioni a problemi mostrati nelle immagini e l’insegnamento agli utenti di come cucinare sulla base di foto di cibo. Tuttavia, i ricercatori notano che MiniGPT-4 deve ancora affrontare diverse limitazioni. Uno dei problemi principali è l’allucinazione linguistica, poiché MiniGPT-4 eredita i limiti di LLM, come la capacità di ragionamento inaffidabile e l’allucinazione di conoscenze inesistenti. Per risolvere questo problema, i ricercatori suggeriscono di addestrare il modello con un numero maggiore di coppie immagine-testo allineate e di alta qualità, oppure di allinearlo con LLM più avanzati in futuro. Un altro limite è rappresentato dalle capacità di percezione inadeguate. La percezione visiva del MiniGPT-4 rimane limitata, in quanto potrebbe avere difficoltà a riconoscere informazioni testuali dettagliate dalle immagini e a differenziare la localizzazione spaziale. I ricercatori suggeriscono che questo problema potrebbe essere risolto con un addestramento su dati più ricchi e ben allineati, sostituendo il Q-former congelato usato nel codificatore visivo con un modello di percezione visiva più forte, o fornendo una maggiore capacità di apprendere un allineamento visivo-testuale esteso. Nonostante queste limitazioni, le capacità avanzate del linguaggio visivo di MiniGPT-4 sono state dimostrate in vari esperimenti. Il codice pre-addestrato, il modello e il set di dati del modello sono disponibili all’indirizzo https://minigpt-4.github.io/ e i ricercatori sperano che questo sviluppo apra la strada a ulteriori progressi nel campo dei modelli di linguaggio visivo.