OpenAI presenta SWE-Lancer, un benchmark per le attività di ingegneria sw | | | | Turtles AI
Un nuovo benchmark, SWE-Lancer, valuta la capacità degli LLM avanzati di operare come ingegneri software freelance. Basato su 1.400 incarichi reali di Upwork per un valore di 1 milione di dollari, esamina sia compiti tecnici che gestionali. I modelli attuali mostrano ancora limiti significativi.
Punti chiave:
- Benchmark realistico: SWE-Lancer si basa su veri incarichi freelance di Upwork, coprendo un’ampia gamma di attività.
- Valutazione rigorosa: Il test include verifiche da esperti e confronti con decisioni umane reali.
- Sfide per l’AI: I modelli avanzati faticano a completare la maggior parte dei compiti in modo autonomo.
- Open source: Viene rilasciata un’immagine Docker con benchmark pubblico per stimolare ulteriori ricerche.
L’AI può sostituire gli sviluppatori software freelance? SWE-Lancer è un nuovo benchmark progettato per rispondere a questa domanda, testando modelli linguistici di ultima generazione su incarichi reali tratti da Upwork. Il dataset include 1.400 attività di sviluppo software, con un valore totale di 1 milione di dollari in compensi effettivamente pagati. Le attività variano da semplici correzioni di bug del valore di 50 dollari fino a implementazioni complesse dal costo di 32.000 dollari. Il benchmark copre due categorie principali: compiti indipendenti, in cui i modelli devono risolvere problemi tecnici, e compiti gestionali, dove l’intelligenza artificiale deve selezionare tra diverse strategie di implementazione proposte. L’accuratezza delle risposte viene verificata con metodi rigorosi: i task tecnici sono valutati con test end-to-end e validati da ingegneri esperti, mentre le scelte manageriali vengono confrontate con le decisioni prese dagli sviluppatori umani che hanno originariamente gestito quei progetti. I risultati mostrano che, nonostante i progressi, gli attuali modelli avanzati non sono ancora in grado di completare in autonomia la maggior parte dei lavori richiesti. Per incentivare la ricerca e migliorare la comprensione dell’impatto economico dell’AI nel settore dello sviluppo software, il team dietro SWE-Lancer ha reso disponibile un’immagine Docker unificata e una versione pubblica del benchmark, chiamata SWE-Lancer Diamond. Attraverso l’analisi delle performance rispetto al valore monetario delle attività, questo strumento offre una base solida per esplorare il ruolo emergente dell’AI nel mercato del lavoro freelance.
Il confronto tra capacità umane e artificiali nel coding continua a essere una sfida aperta.
