A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents
Questo articolo introduce SWE-RPG, un benchmark unificato per gli agenti di codifica che valuta non solo il successo finale della patch, ma anche i passaggi intermedi di ragionamento come la chiarificazione dei requisiti e la pianificazione dell'implementazione, rivelando che il recupero implicito dei requisiti è il principale collo di bottiglia che limita le prestazioni degli attuali agenti nei compiti a livello di repository.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina un mondo in cui hai un assistente robotico super intelligente capace di scrivere codice informatico. Gli dai un'istruzione semplice come: "Correggi il bug in questo gioco" o "Aggiungi un nuovo livello", e lui si mette al lavoro. Questo è il sogno degli agenti di codifica AI. Per molto tempo, gli scienziati hanno testato questi robot assegnando loro un compito e vedendo se il risultato finale funzionava. Se il gioco si avvia senza crashare, il robot riceve una stella d'oro. Se crasha, riceve una X rossa.
Ma ecco il problema: una X rossa non ti dice perché il robot è fallito. Ha frainteso le tue istruzioni? Ha elaborato un piano sbagliato? O ha semplicemente digitato il codice errato? È come uno studente che viene bocciato a un test di matematica e riceve solo un punteggio di "0/10" senza vedere gli appunti dell'insegnante su dove ha sbagliato. Per rendere questi robot davvero migliori, dobbiamo vedere il loro processo di pensiero, non solo il risultato finale. Questa è la grande domanda che l'articolo affronta: Come facciamo a smettere di valutare solo la patch finale e iniziare a diagnosticare il cervello del robot?
Entra in scena SWE-RPG, un nuovo test super dettagliato progettato per sbirciare dentro la mente del robot. I ricercatori hanno costruito un benchmark (un test standardizzato) utilizzando 163 compiti di codifica reali provenienti da 31 diversi progetti software. Invece di controllare solo se il codice funziona alla fine, hanno creato riferimenti di "Verità d'Oro" (Gold Truth) per ogni singolo passaggio del viaggio del robot. Immagina di avere il libro delle ricette di un maestro chef che non mostra solo il piatto finale, ma elenca anche ogni ingrediente nascosto che lo chef ha dovuto indovinare, ogni passaggio del piano di cottura e l'esatto momento in cui il robot potrebbe essersi deviato dal percorso.
I ricercatori hanno messo alla prova tre popolari agenti di codifica (chiamati Claude Code, Codex e OpenCode), accoppiandoli con sei diversi modelli di "cervello" (LLM). I risultati sono stati un bagno di realtà. Anche i robot migliori hanno risolto solo circa il 31,5% dei compiti. Ciò significa che sono falliti quasi due terzi delle volte! Ma la vera magia di SWE-RPG è stata capire dove sono falliti. Lo studio ha scoperto che il collo di bottiglia principale non era in realtà scrivere il codice; era comprendere le regole nascoste. Circa il 24,5% - 46,0% dei fallimenti è avvenuto perché i robot non riuscivano a capire i "requisiti impliciti" — quelle cose che non hai detto ma che il robot aveva bisogno di sapere per svolgere il lavoro correttamente.
Per esempio, se chiedessi a un robot di "correggere l'importazione TSV", potrebbe correggere il codice ma accidentalmente rompere l'importazione CSV perché non si è reso conto che le due cose erano correlate. Lo studio suggerisce che, per rendere questi agenti davvero utili, dobbiamo smettere di concentrarci solo sul far scrivere loro il codice più velocemente e iniziare a insegnare loro come essere dei migliori detective, capaci di leggere tra le righe di una richiesta dell'utente. L'articolo conclude che, sebbene questi agenti siano impressionanti, faticano ancora con il lato disordinato e umano dello sviluppo software, e SWE-RPG è la nuova mappa di cui abbiamo bisogno per aiutarli a navigare in quei complicati requisiti nascosti.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.