Valutazione delle Capacità degli LLM nel Correggere Risposte Brevi in Ambito Educativo K-12 | | | | Turtles AI

Valutazione delle Capacità degli LLM nel Correggere Risposte Brevi in Ambito Educativo K-12
Editorial Team5 agosto 2024

 

 I Modelli Linguistici di Grandi Dimensioni raggiungono il Livello Desiderato? 

Uno studio empirico ha valutato le capacità degli LLM di correggere le domande a risposta breve nell’istruzione K-12. Ecco di seguito i risultati

 

 Introduzione
L’importanza della valutazione formativa nell’istruzione K-12 è ben riconosciuta. Tuttavia, la scala a cui tali valutazioni possono essere condotte è limitata dalle risorse necessarie. Questo studio esplora la capacità dei modelli linguistici di grandi dimensioni (LLM), in particolare GPT-4, di correggere risposte aperte a domande di breve risposta in contesti educativi reali, utilizzando un nuovo set di dati da Carousel, una piattaforma di quiz.

 Metodologia
Utilizzando risposte degli studenti in Scienze e Storia, abbiamo valutato le prestazioni di diverse configurazioni di GPT-4 nel correggere risposte a domande di breve risposta. Le risposte sono state valutate su un set di 1710 risposte studentesche da vari livelli scolastici (età 5-16). Abbiamo confrontato le prestazioni dei modelli con valutazioni umane esperte, misurando la concordanza tra modelli e umani tramite la metrica di Cohen’s Kappa.

 Dataset
Il dataset di Carousel includeva domande categorizzate come facili o difficili in base alla complessità e all’astrazione richiesta. Dopo aver rimosso risposte nulle e perfette (che corrispondevano esattamente alle risposte esemplari), abbiamo valutato le risposte ambigue che richiedevano un giudizio più sfumato.

 Valutazione Umana
Ratti umani, qualificati come insegnanti delle materie valutate, hanno esaminato ciascuna risposta, determinando se fosse corretta o meno. La concordanza tra i ratti umani era del 87% con un Kappa di 0.75, indicando una buona affidabilità tra ratti umani.

 Risultati del Modello
La migliore configurazione del modello (GPT-4 con prompt few-shot) ha ottenuto un Kappa di 0.70, molto vicino alle prestazioni umane (Kappa di 0.75). I risultati suggeriscono che i LLM, con un ingegneria del prompt minima, possono avvicinarsi molto alle prestazioni dei ratti umani in una varietà di materie e livelli scolastici.

 Discussione
La vicinanza delle prestazioni di GPT-4 a quelle umane suggerisce che i LLM potrebbero essere utili per compiti di valutazione formativa a basso rischio nell’istruzione K-12. La differenza di prestazioni tra i modelli GPT-3.5 e GPT-4 è stata significativa, con GPT-4 che ha migliorato notevolmente la recall senza compromettere troppo la precisione. L’aggiunta di esempi few-shot ha migliorato leggermente le prestazioni del modello.

 Conclusione
Questo studio mostra che i LLM come GPT-4 possono essere strumenti efficaci per la valutazione formativa, risparmiando tempo significativo per gli insegnanti senza compromettere la qualità della valutazione. Ulteriori ricerche potrebbero esplorare l’uso di LLM su una gamma più ampia di compiti e domande, oltre a indagare i fattori che influenzano le prestazioni dei modelli.

 Implicazioni
L’adozione di LLM nell’istruzione potrebbe rivoluzionare il modo in cui le valutazioni formative vengono eseguite, rendendole più frequenti ed efficienti. Tuttavia, è cruciale esplorare ulteriormente i limiti e le potenzialità di questi modelli per garantire che possano essere utilizzati in modo efficace e responsabile nell’educazione.