← Nieuwste papers
💻 computer science

ReProAgent: Tool-Augmented Multi-Stage Agentic Generation of Bug Reproduction Tests from Issue Reports

ReProAgent is een multi-stage, tool-augmented agent framework dat bestaande prompt-gebaseerde benaderingen overtreft door de generatie van bugreproductietests te deconstrueren in gelokaliseerde stadia van bugidentificatie, worteloorzaakanalyse, planning en generatie, waarmee het aanzienlijk hogere succespercentages behaalt over diverse benchmarks.

Oorspronkelijke auteurs: Quanjun Zhang, Yi Zheng, Ye Shang, Weifeng Sun, Haichuan Hu, Chunrong Fang, Zhenyu Chen, Liang Xiao

Gepubliceerd 2026-07-13
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Quanjun Zhang, Yi Zheng, Ye Shang, Weifeng Sun, Haichuan Hu, Chunrong Fang, Zhenyu Chen, Liang Xiao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective bent die een mysterie probeert op te lossen, maar het enige bewijsstuk dat je hebt een wazige, handgeschreven notitie van een getuige waarin staat: "Er gebeurde iets vreemds in de keuken!" In de wereld van software is deze notitie een issue report (foutrapport). Meestal moeten ontwikkelaars raden wat er mis is gegaan, een test schrijven om het te bewijzen en vervolgens proberen het te repareren. Maar vaak hebben ze geen test, wat het hele proces traag en frustrerend maakt.

Een tijdje probeerden slimme computerprogramma's (Large Language Models of LLM's genoemd) deze tests automatisch te schrijven. Ze waren als detectives die alleen de notitie lazen en onmiddellijk riepen: "Ik denk dat de dader de broodrooster is!" Ze pakten een paar nabijgelegen aanwijzingen (tekst uit de code) en raadden het antwoord. Maar het artikel stelt dat deze aanpak te simpel is. Het is alsof je een complex moordmysterie probeert op te lossen door alleen naar de foto van de plaats delict te kijken, zonder ooit de verdachten te ondervragen of hun alibi's te controleren. Deze oudere methoden misten vaak het echte probleem omdat ze niet begrepen hoe verschillende delen van de code (de "keuken", de "woonkamer" en de "kelder") met elkaar verbonden waren.

Ontmoet ReProAgent: Het Super-Detective Team

De auteurs van dit artikel hebben een nieuw systeem gebouwd genaamd ReProAgent. In plaats van één detective die het antwoord raadt, is ReProAgent een team van gespecialiseerde agenten die volgens een strikt, vierstaps onderzoeksproces werken. Ze raden niet alleen; ze onderzoeken, analyseren, plannen en handelen vervolgens.

Zo werkt hun "detective workflow":

  1. De Zoektocht (Bug Localization): Eerst kijkt het team niet naar het hele gebouw. Ze gebruiken speciale tools om door de code te zoeken als een bibliothecaris die een specifiek boek zoekt. Ze zoeken naar trefwoorden en volgen de "broodkruimels" (afhankelijkheden) om precies te vinden welk bestand en welke regel code de problemen veroorzaakt.
  2. Het Verhoor (Root Cause Analysis): Zodra ze de verdachte hebben gevonden, arresteren ze hem niet zomaar. Ze traceren het exacte pad dat de bug heeft afgelegd. Ze vragen: "Hoe is de fout van de voordeur naar het achterste raam gereisd?" Ze bouwen een kaart van het executiepad om te begrijpen waarom de bug gebeurde, niet alleen waar.
  3. Het Ontwerp van de Val (Test Planning): Voordat ze een val zetten, plannen ze het uit. Ze bepalen precies aan welke voorwaarden moet worden voldaan om de bug opnieuw te laten verschijnen. Het is als het opzetten van een specifiek scenario waarin de verdachte zijn misdaad moet onthullen.
  4. De Operatie (Test Generation & Review): Ten slotte schrijven ze de test (de val) en draaien deze in een veilige, geïsoleerde sandbox (een digitale speeltuin). Maar hier komt het coole gedeelte: als de test er niet in slaagt de bug te vangen, of als hij het verkeerde vangt, geeft het team niet zomaar op. Ze beoordelen het resultaat, vragen: "Hebben we de juiste crimineel gevangen?" en verfijnen vervolgens hun test. Ze blijven dit proces herhalen totdat de test de bug perfect reproduceert.

De Resultaten: Werkte het?

Het team testte ReProAgent op twee grote sets van echte softwareproblemen (genaamd SWT-bench-lite en SWT-bench-verified). De resultaten waren indrukwekkend.

  • Op de kleinere set (SWT-bench-lite) wist ReProAgent de bug in 58,43% van de gevallen te reproduceren.
  • Op de moeilijkere, geverifieerde set (SWT-bench-verified), slaagde het in 70,30% van de gevallen.

Om dit in perspectief te plaatsen, de op één na beste methode (een systeem genaamd AssertFlip) slaagde er slechts in ongeveer 38,0% van de problemen op de kleinere set op te lossen. ReProAgent versloeg niet alleen de concurrentie; het liet hen ver achter door ongeveer 20 procentpunten meer gevallen op te lossen dan het op één na beste systeem wanneer ze hetzelfde "brein" gebruikten (een model genaamd GPT-5-mini).

Het artikel controleerde ook of dit team samenwerkte met verschillende "hersenen" (andere AI-modellen zoals Qwen3-Coder en DeepSeek-V3.2). Dat deed het! Het systeem werkte goed bij al deze modellen, wat suggereert dat het proces van een detective zijn is belangrijker dan alleen het hebben van de slimste individuele detective.

Wat het NIET is

Het artikel is heel duidelijk over wat ReProAgent niet is. Het is geen toverstaf die de bugs zelf oplost. De taak is strikt om de test te schrijven die bewijst dat de bug bestaat. Echter, de auteurs ontdekten dat wanneer ze deze tests gaven aan andere systemen die wel bugs oplossen, die systemen beter werden. Bijvoorbeeld, wanneer de tests van ReProAgent werden gebruikt om een systeem genaamd SWE-agent te helpen, steeg het aantal succesvol opgeloste problemen van 143 naar 153.

De Kosten

Een super-detective zijn kost een beetje geld. Het artikel berekende dat het draaien van ReProAgent ongeveer $0,14 per geval kost. Dit is iets duurder dan sommige eenvoudigere methoden (die rond de $0,11 kosten), maar het artikel stelt dat die extra paar centen het waard zijn omdat het de problemen veel vaker daadwerkelijk oplost. Meestal had het systeem slechts ongeveer 1,29 keer de "sting operation" nodig voordat het het goed had.

De Kernboodschap

Het artikel suggereert dat om complexe softwaremysteries op te lossen, je niet kunt vertrouwen op een snelle gok op basis van een paar woorden. Je hebt een gestructureerd, meerfasig onderzoek nodig dat naar het hele plaatje kijkt, het pad van de fout volgt en het bewijs dubbelcheckt. ReProAgent laat zien dat wanneer je AI-agenten een goed proces geeft om te volgen, ze ongelooflijk effectief kunnen zijn in het vinden en bewijzen van softwarebugs, waardoor ze een wazige getuigennotitie veranderen in een kristalhelder dossier.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →