RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades
RoadmapBench introduceert een benchmark van 115 complexe, langetermijncodingtaken gebaseerd op echte open-source versie-upgrades om aan te tonen dat huidige state-of-the-art AI-agenten aanzienlijk moeite hebben met grootschalige, multi-doel softwareontwikkeling, waarbij zelfs met de meest geavanceerde modellen minder dan 40% van de taken wordt opgelost.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een team van superslimme, door AI aangedreven junior developers inhuurt. Je wilt weten of ze een echte baan aankunnen: niet alleen een enkele typefout in een recept oplossen, maar een enorme, 500 pagina's tellende kookboek volledig herschrijven om nieuwe hoofdstukken toe te voegen, de manier waarop ingrediënten worden gemeten te veranderen en defecte ovens te repareren – terwijl je tegelijkertijd de oude recepten werkend houdt voor mensen die nog steeds de oude versie gebruiken.
Dat is precies waar het paper ROADMAPBENCH over gaat.
Hier is de uitleg van het paper in eenvoudige termen:
1. Het Probleem: De "Typefout" versus de "Verbouwing"
Lange tijd hebben we AI-codeassistenten getest op kleine, makkelijke taken. Het is alsof je vraagt: "Kun je deze ene zin in dit alinea corrigeren?" De AI zegt meestal: "Ja!" en krijgt een A+.
Maar in de echte wereld gaat softwareontwikkeling niet over het corrigeren van één zin. Het gaat over het renoveren van een wolkenkrabber. Je moet de loodgieterswerk, de elektrische bedrading en de liftsystemen op 50 verschillende verdiepingen tegelijkertijd aanpassen, zonder dat het gebouw instort.
De auteurs realiseerden zich dat bestaande tests te makkelijk waren. Het was alsof je een architect vraagt een lekkende kraan te repareren, terwijl de echte baan het ontwerpen van een nieuw ziekenhuisvleugel is. Dus bouwden ze een nieuwe, veel moeilijkere test genaamd ROADMAPBENCH.
2. De Nieuwe Test: De "Versie-upgrade"-uitdaging
In plaats van de AI te vragen een bug op te lossen, geeft ROADMAPBENCH haar een rooster.
- De Opzet: De AI wordt in een digitale werkplaats gegooid met een oude versie van een echt softwareproject (zoals een populair open-source hulpmiddel).
- De Missie: De AI krijgt een "rooster"-document. Dit document zegt: "In de volgende versie van deze software moeten we deze 5 nieuwe functies toevoegen, de werking van deze 3 dingen veranderen en deze 2 bugs oplossen."
- De Schaal: Dit is geen kleine wijziging. Gemiddeld moet de AI 3.700 regels code herschrijven over 51 verschillende bestanden. Het is alsof je de AI vraagt het volledige script van een film te herschrijven, de kostuums te veranderen en de scènes opnieuw op te nemen, allemaal in één keer.
- De Regels: De AI mag niet kijken naar het "antwoordenboekje" (de nieuwe versie van de software). Ze moet het alleen uit de instructies afleiden.
3. De Resultaten: De AI is Nog Steeds een "Junior"
De onderzoekers testten 13 van de slimste beschikbare AI-modellen (inclusief de allerlaatste versies van bedrijven zoals Anthropic, OpenAI en Google). Ze onderwierpen deze modellen aan de ROADMAPBENCH-test.
De uitkomst was nuchter:
- Zelfs de slimste AI (Claude-Opus-4.7) slaagde slechts in 39,1% van de taken.
- De zwakste AI slaagde slechts in 5,2% van de taken.
De Metafoor:
Als je een menselijke junior developer vraagt een huis te verbouwen, en ze slagen er slechts 4 keer op de 10 in om de klus correct te voltooien, zou je zeggen: "Ze zijn nog aan het leren." Het paper toont aan dat zelfs onze meest geavanceerde AI nog in de "leerfase" zit als het gaat om complexe, langetermijnsoftwareprojecten.
4. Waar Falen Ze?
Het paper telde niet alleen de mislukkingen; het keek naar waarom ze faalden. Ze vonden een patroon gebaseerd op hoe "slim" de AI was:
- De Sterkere Modellen: Ze kregen de code meestal te compileren (bouwen) en konden de meeste functies schrijven. Maar ze faalden op de details. Het is alsof ze een perfect huis bouwden, maar de deurkruk zat aan de verkeerde kant, of de lichtschakelaar deed de lamp niet echt aan. Ze begrepen het grote geheel, maar misten de kleine, precieze logica.
- De Zwakkere Modellen: Ze konden vaak het huis niet eens bouwen. Ze vergeten het dak te installeren, of ze probeerden de keuken in de kelder te plaatsen. Ze faalden op het niveau van de basisconstructie.
5. Waarom Dit Belangrijk Is (Volgens het Paper)
De auteurs betogen dat we moeten stoppen met het testen van AI op "typefouten", omdat dit ons een vals gevoel van veiligheid geeft. Alleen omdat een AI een bug kan oplossen, betekent niet dat ze een nieuwe functie kan bouwen.
ROADMAPBENCH is een nieuwe, eerlijke liniaal. Het vertelt ons dat hoewel AI steeds beter wordt, het vermogen om lange, complexe softwareprojecten met meerdere stappen aan te kunnen, nog steeds een enorm, onopgelost probleem is. De AI is momenteel als een zeer getalenteerde leerling die instructies goed kan volgen voor een paar stappen, maar in de war raakt wanneer het project te groot en te complex wordt.
Samenvatting
- Oude Tests: "Kun je dit ene gebroken woord corrigeren?" (AI: Ja!)
- ROADMAPBENCH: "Hier is een plan om een heel softwaresysteem te upgraden. Kun jij dat doen?" (AI: Ik kan het proberen, maar ik zal waarschijnlijk de details verprutsen of een stap vergeten.)
- Conclusie: We zijn er nog niet. De AI is slim, maar ze is nog niet klaar om de leidende ingenieur te zijn op een groot softwareproject.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.