← Nieuwste papers
💻 computer science

Beyond Final Code: A Process-Oriented Error Analysis of Software Development Agents in Real-World GitHub Scenarios

Deze studie analyseert de procesgerichte fouten van AI-softwareontwikkelingsagenten op GitHub, onthult dat Python-uitvoeringsfouten de oplossingskansen beïnvloeden en identificeert drie bugs in de SWE-Bench-benchmark die de nauwkeurigheid beïnvloeden.

Oorspronkelijke auteurs: Zhi Chen, Wei Ma, Lingxiao Jiang

Gepubliceerd 2026-04-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhi Chen, Wei Ma, Lingxiao Jiang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een groep zeer slimme, maar nog jonge software-ontwerpers (we noemen ze "AI-agenten") hebt aangenomen om een enorme, complexe bouwopdracht te voltooien: het repareren van een gebrekkig huis (een softwareproject) op basis van een klachtenformulier (een GitHub-issue).

De meeste mensen kijken alleen naar het eindresultaat: "Is het huis nu wel veilig? Ja of nee?"
De auteurs van dit onderzoek, Zhi Chen en zijn team, zeggen echter: "Wacht even, laten we niet alleen naar het eindproduct kijken, maar naar hoe ze gebouwd hebben. Laten we hun dagboeken, hun foutmeldingen en hun worstelingen bekijken."

Hier is wat ze hebben ontdekt, vertaald naar alledaags taalgebruik:

1. Het Grote Geheim: Het is niet het eindresultaat, maar het proces

Vroeger keken onderzoekers alleen naar of de AI de code correct schreef. Maar in de echte wereld is software bouwen een proces van vallen en opstaan. De AI's proberen, maken fouten, lezen de foutmelding, proberen het opnieuw, en hopen dat het werkt.
De onderzoekers hebben de "trajecten" (de digitale dagboeken) van bijna 4.000 pogingen van 8 top-AI's bestudeerd. Ze wilden weten: Wat gebeurt er als de AI vastloopt? En hoe beïnvloedt dat het eindresultaat?

2. Fouten zijn niet altijd dodelijk, maar veel fouten wel

Stel je voor dat je een auto probeert te repareren.

  • Eén of twee fouten: Als de AI een paar keer per ongeluk de verkeerde moer vastdraait, kan ze dat vaak wel oplossen. Het eindresultaat is nog steeds goed.
  • Te veel fouten: Als de AI echter 15 keer per minuut de verkeerde moer vastdraait, raakt ze in paniek. Ze draait te veel schroeven los, maakt de motor te groot, en raakt de weg kwijt.
    De conclusie: Hoe meer fouten een AI maakt tijdens het proces, hoe kleiner de kans is dat het eindresultaat werkt. En het ergste? Hoe meer fouten, hoe langer ze erover doen (meer "redeneren"), wat kostbaarder en trager is.

3. De "Grote Boze Wolf" van de fouten

De onderzoekers hebben gekeken welke fouten de AI's het vaakst maken. Het is alsof ze een lijst hebben gemaakt van de meest voorkomende valkuilen in een bouwput:

  • De "Ik ken die spullen niet"-fout: De AI probeert een gereedschap te gebruiken dat ze niet hebben geïnstalleerd (bijv. ModuleNotFoundError). Dit is heel vaak, maar gelukkig weten ze dit meestal snel op te lossen.
  • De "Dit past niet"-fout: Ze proberen een vierkante bout in een ronde gat te draaien (TypeError). Ook dit komt vaak voor.
  • De "Gevaarlijke Val": Er zijn echter fouten waar de AI's echt in vastlopen. Denk aan fouten in de database (waar de gegevens in worden opgeslagen) of systeemfouten (OSError).
    • Analogie: Het is alsof de AI probeert een muur te bouwen, maar de fundering is verkeerd. Ze proberen het 10 keer, maar de muur blijft omvallen. Deze fouten zijn het moeilijkst om op te lossen.

4. De "Geheime" fouten die blijven hangen

Soms denkt de AI: "Oké, ik heb het gerepareerd!" en stuurt het resultaat op. Maar in het testlab (de testfase) blijkt dat de fout die ze eerder hadden, nog steeds aanwezig is.
Het is alsof een dokter een patiënt behandelt, denkt dat hij genezen is, maar de patiënt heeft de koorts nog steeds. Deze "sluipende" fouten zijn gevaarlijk omdat ze de AI laten denken dat het werk klaar is, terwijl het niet zo is.

5. De verrassing: Soms is het niet de AI, maar de meetlat!

Dit is misschien wel het meest interessante stukje. Tijdens het onderzoek ontdekten de auteurs 3 fouten in het SWE-Bench-systeem zelf (het systeem dat gebruikt wordt om de AI's te testen).

  • Analogie: Het is alsof je een sporter laat rennen op een baan, maar de meetlat van de scheidsrechter is verkeerd afgesteld. De sporter loopt perfect, maar de scheidsrechter zegt: "Je hebt verloren!"
    De onderzoekers hebben deze fouten gemeld aan de makers van het testsysteem. Een was al vastgezet, de andere twee worden gerepareerd. Dit betekent dat sommige AI's eerder "slecht" werden beoordeeld dan ze eigenlijk waren.

Wat betekent dit voor de toekomst?

De boodschap is duidelijk:

  1. We moeten leren van de fouten, niet alleen van het succes. Als we willen dat AI's betere software bouwen, moeten we ze leren om sneller en slimmer om te gaan met die "geheime" fouten (zoals database-problemen).
  2. Minder fouten = minder energie. Als een AI minder vaak vastloopt en minder vaak hoeft te proberen, verbruikt ze minder energie en kost het minder tijd. Dat is beter voor het milieu en voor onze portemonnee.
  3. Een standaard taal. Nu praten alle AI's in verschillende talen (sommige schrijven hun dagboek in JSON, andere in tekst). Het zou helpen als ze allemaal hetzelfde dagboekformulier gebruikten, zodat we ze makkelijker kunnen vergelijken.

Kortom: Dit onderzoek zegt: "Kijk niet alleen naar de mooie, afgewerkte code. Kijk naar de struikelblokken onderweg. Als we die struikelblokken begrijpen, kunnen we de AI's leren om steviger te lopen."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →