← Ultimi articoli
🤖 AI

RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

RoadmapBench introduce un benchmark di 115 compiti di codifica complessi e a lungo termine basati su reali aggiornamenti di versioni open-source per dimostrare che gli attuali agenti AI all'avanguardia faticano notevolmente nello sviluppo software su larga scala e multi-obiettivo, risolvendo meno del 40% dei compiti anche con i modelli più avanzati.

Autori originali: Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

Pubblicato 2026-05-18
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di assumere un team di sviluppatori junior super-intelligenti e potenziati dall'IA. Vuoi sapere se possono gestire un lavoro reale: non solo correggere un singolo errore di battitura in una ricetta, ma riscrivere completamente un enorme libro di cucina di 500 pagine per aggiungere nuovi capitoli, cambiare il modo in cui gli ingredienti vengono misurati e riparare forni rotti, tutto mantenendo le vecchie ricette funzionanti per le persone che usano ancora la versione precedente.

Questo è esattamente di cosa tratta il paper ROADMAPBENCH.

Ecco la spiegazione del paper in termini semplici:

1. Il Problema: L'"Errore di Battitura" vs. La "Ristrutturazione"

Per molto tempo, abbiamo testato gli assistenti di codifica AI su piccoli e facili compiti. È come chiedere: "Puoi correggere questa singola frase in questo paragrafo?" L'IA di solito risponde: "Sì!" e prende un A+.

Ma nel mondo reale, lo sviluppo software non riguarda la correzione di una singola frase. Riguarda la ristrutturazione di un grattacielo. Devi cambiare l'impianto idraulico, il cablaggio elettrico e i sistemi degli ascensori su 50 piani diversi, tutti contemporaneamente, senza che l'edificio crolli.

Gli autori hanno realizzato che i test esistenti erano troppo facili. Erano come chiedere a un architetto di riparare un rubinetto che perde, quando il lavoro reale è progettare una nuova ala per un ospedale. Quindi, hanno costruito un nuovo test molto più difficile chiamato ROADMAPBENCH.

2. Il Nuovo Test: La Sfida dell'"Aggiornamento di Versione"

Invece di chiedere all'IA di correggere un bug, ROADMAPBENCH le fornisce una roadmap.

  • La Configurazione: L'IA viene inserita in un laboratorio digitale con una vecchia versione di un progetto software reale (come un popolare strumento open-source).
  • La Missione: All'IA viene consegnato un documento "roadmap". Questo documento dice: "Nella prossima versione di questo software, dobbiamo aggiungere queste 5 nuove funzionalità, cambiare il modo in cui funzionano queste 3 cose e correggere questi 2 bug".
  • La Scala: Non si tratta di un cambiamento minuscolo. In media, l'IA deve riscrivere 3.700 righe di codice attraverso 51 file diversi. È come chiedere all'IA di riscrivere l'intera sceneggiatura di un film, cambiare i costumi e girare di nuovo le scene, tutto in una sola volta.
  • Le Regole: L'IA non può sbirciare la "chiave delle risposte" (la nuova versione del software). Deve capirlo solo dalle istruzioni.

3. I Risultati: L'IA è ancora un "Junior"

I ricercatori hanno testato 13 dei modelli AI più intelligenti disponibili (inclusi gli ultimi modelli di aziende come Anthropic, OpenAI e Google). Hanno sottoposto questi modelli al test ROADMAPBENCH.

L'esito è stato sconvolgente:

  • Anche l'IA più intelligente (Claude-Opus-4.7) ha avuto successo solo nel 39,1% dei compiti.
  • L'IA più debole ha avuto successo solo nel 5,2% dei compiti.

La Metafora:
Se chiedessi a uno sviluppatore junior umano di ristrutturare una casa e completasse il lavoro correttamente solo 4 volte su 10, diresti: "Stanno ancora imparando". Il paper mostra che anche la nostra IA più avanzata è ancora nella fase di "apprendimento" quando si tratta di progetti software complessi e a lungo termine.

4. Dove Falliscono?

Il paper non ha contato solo i fallimenti; ha esaminato perché fallivano. Hanno trovato uno schema basato su quanto l'IA fosse "intelligente":

  • I Modelli Più Forti: Di solito riuscivano a compilare (costruire) il codice e potevano scrivere la maggior parte delle funzionalità. Ma fallivano sui dettagli. È come se avessero costruito una casa perfetta, ma la maniglia della porta fosse dal lato sbagliato, o l'interruttore della luce non accendesse davvero la luce. Capivano il quadro generale ma mancavano la logica piccola e precisa.
  • I Modelli Più Deboli: Spesso non riuscivano nemmeno a costruire la casa. Dimenticavano di installare il tetto, o provavano a mettere la cucina nel seminterrato. Fallivano a livello di costruzione di base.

5. Perché Questo È Importante (Secondo il Paper)

Gli autori sostengono che dobbiamo smettere di testare l'IA su "correzioni di errori di battitura" perché ci dà un falso senso di sicurezza. Solo perché un'IA può correggere un bug non significa che possa costruire una nuova funzionalità.

ROADMAPBENCH è un nuovo metro onesto. Ci dice che, sebbene l'IA stia migliorando, la capacità di gestire progetti software lunghi, complessi e multi-step è ancora una sfida enorme e irrisolta. Attualmente, l'IA è come un apprendista molto talentuoso che può seguire bene le istruzioni per alcuni passaggi, ma si confonde quando il progetto diventa troppo grande e complesso.

Riepilogo

  • Vecchi Test: "Puoi correggere questa singola parola rotta?" (IA: Sì!)
  • ROADMAPBENCH: "Ecco un piano per aggiornare un intero sistema software. Puoi farlo?" (IA: Posso provare, ma probabilmente sbaglierò i dettagli o dimenticherò un passaggio.)
  • Conclusione: Non siamo ancora arrivati. L'IA è intelligente, ma non è ancora pronta per essere l'ingegnere capo di un importante progetto software.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →