SuperGPQA: benchmark open source di Bytedance per LLM | Chatgpt app | Come usare chatgpt | Chat gpt in italiano gratis | Turtles AI

SuperGPQA: benchmark open source di Bytedance per LLM
Una valutazione innovativa dei modelli linguistici attraverso domande a scelta multipla, annotazioni esperte e un sistema di filtraggio collaborativo
Editorial Team5 marzo 2025

 

Il nuovo benchmark SuperGPQA, sviluppato da esperti e comunità open-source, offre una valutazione delle capacità degli LLM in 285 discipline, mediante domande a scelta multipla, filtraggio collaborativo ed annotazioni specialistiche.


Punti chiave:

  • Benchmark multidisciplinare con 26.529 domande a scelta multipla
  • Valutazione approfondita in 285 discipline di livello graduate
  • Meccanismo di filtraggio collaborativo Human-LLM supportato da feedback esperto
  • Indicazioni metodologiche per il miglioramento futuro degli LLM

ByteDance’s Doubao Large Model Team, in sinergia con la comunità open-source M-A-P, ha lanciato un nuovo strumento di analisi  SuperGPQA che, attraverso 26.529 quesiti a scelta multipla suddivisi in 285 ambiti disciplinari, si propone di misurare in maniera accurata le capacità di ragionamento e conoscenza dei modelli linguistici di ultima generazione; il sistema, caratterizzato da un innovativo iter di filtraggio collaborativo Human-LLM, permette di escludere interrogativi banali o ambigui, integrando risposte fornite dai modelli con il prezioso contributo di oltre 80 annotatori esperti, e offre così spunti tecnici e metodologici utili per la progettazione di futuri benchmark comparabili, un contesto che si inserisce in un panorama globale in cui strumenti analoghi, come MMLU, evidenziano la necessità di affinare ulteriormente le prestazioni dei sistemi di AI; il risultato sperimentale, che vede il modello DeepSeek-R1 raggiungere una precisione massima del 61,82%, mette in luce il divario attuale tra le capacità operative dei LLM e gli obiettivi finali dell’AI generale, fornendo una piattaforma di confronto e stimolo per progressi incrementali nel settore.
Il benchmark si configura come un prezioso punto di riferimento per future strategie di sviluppo e valutazione nel campo dell’AI.