← Nieuwste papers
💻 computer science

Agentic Repository Mining: A Multi-Task Evaluation

Dit artikel toont aan dat LLM-agenten die software-repositories dynamisch kunnen verkennen via bash-opdrachten een concurrerende classificatie-accuraatheid bereiken in vergelijking met vooraf ontworpen contextbenaderingen, terwijl ze tegelijkertijd superieure robuustheid bieden tegen contextvensterbeperkingen en onafhankelijk van de grootte van de artefacten kunnen schalen.

Oorspronkelijke auteurs: Johannes Härtel

Gepubliceerd 2026-05-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Johannes Härtel

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert uit te vinden wat een specifiek stuk code in een enorm softwareproject eigenlijk doet. Is het een bug oplossen? Is het gewoon een typefout? Is het een veiligheidsrisico?

In het verleden moesten mensen dit speurwerk zelf doen. Ze lazen de code, keken naar gerelateerde bestanden, controleerden de geschiedenis en namen een oordeel. Dit is traag, duur en soms raken mensen moe en maken ze fouten.

Onlangs hebben we geprobeerd AI (Large Language Models, of LLM's) hiervoor in te zetten. Maar er is een addertje onder het gras: Context is Koning.

De Twee Detectives: De "Aktetas" versus de "Verkenner"

Het artikel vergelijkt twee manieren om AI in te zetten om deze puzzels op te lossen:

1. De "Aktetas"-detective (Eenvoudige LLM)
Stel je een detective voor die een enkele, voorverpakte aktetas krijgt. Daarin zit een specifiek bestand, een specifieke opmerking en misschien een samenvatting van het project. De detective krijgt de opdracht: "Lees alleen wat in deze aktetas staat en vertel me wat er aan de hand is."

  • Het Probleem: Als de koffer te zwaar is (te veel tekst), loopt het brein van de detective over en kan hij niet antwoorden. Als de aktetas een cruciale aanwijzing mist (zoals een bestand uit drie mappen hoger), moet de detective raden, vaak met een verkeerd antwoord.
  • De Bevinding van het Artikel: Deze detectives zijn goedkoop en snel, maar ze worstelen wanneer de "aktetas" te groot wordt of wanneer ze buiten de koffer moeten kijken.

2. De "Verkenner"-detective (Agentic LLM)
Stel je nu een detective voor die wordt afgezet in de echte softwarefabriek met een set standaardtools (zoals een zaklamp, een vergrootglas en een kaart). Ze krijgen een startpunt (bijvoorbeeld: "Kijk naar deze specifieke regel code").

  • Hoe ze werken: Ze wachten niet op een aktetas. Ze lopen rond. Ze openen de deur naar de volgende kamer (ls), lezen de specifieke pagina die ze nodig hebben (cat), zoeken naar een trefwoord (grep) en controleren de geschiedenislogs (git log). Ze lezen alleen wat ze nodig hebben om de specifieke puzzel op te lossen.
  • De Bevinding van het Artikel: Deze detectives zijn iets duurder (ze nemen meer tijd en "tokens" om na te denken) en bewegen langzamer omdat ze rond moeten lopen. Echter, ze raken nooit overweldigd door een enorme fabriek omdat ze alleen de aanwijzingen oppakken die ze nodig hebben. Ze zijn veel robuuster.

Het Grote Experiment

De onderzoekers testten deze twee detectives op vier verschillende soorten "puzzels" die in software voorkomen:

  1. Verwarringde Commits: Lost deze regel code echt een bug op, of is het gewoon het opschonen van witruimte?
  2. Veiligheidsreviews: Gaat deze opmerking in een code-review over een veiligheidslek?
  3. Onderhoud: Lost deze update een bug op, past het zich aan aan een nieuw systeem, of maakt het dingen gewoon mooier?
  4. Projecttype: Is deze GitHub-repository een echt softwareproject, of gewoon een huiswerkopdracht van een student?

Ze draaiden bijna 5.000 tests.

De Resultaten: Wie Won?

Nauwkeurigheid: Het was een gelijkspel.
Verrassend genoeg was de "Verkenner" (Agent) even nauwkeurig als de "Aktetas" (Eenvoudige LLM), zelfs al moest de Verkenner de aanwijzingen zelf vinden terwijl de Aktetas de aanwijzingen kreeg aangereikt. Dit is groot nieuws, omdat het betekent dat de AI kan uitzoeken naar wat ze moet kijken zonder dat een mens van tevoren de bestanden moet selecteren.

Robuustheid (De Eigenlijke Winnaar):
De "Aktetas"-detectives bleven falen wanneer de bestanden te groot waren. Hun "akteta's" werden te zwaar en ze crashten (dit heet een "context overflow").
De "Verkenner"-detectives crashten nooit. Ze bleven gewoon lopen, alleen de kleine stukjes lezen die ze nodig hadden, ongeacht hoe groot het softwareproject was.

Kosten:
De Verkenners waren duurder (ongeveer 1,2 tot 3 keer de kosten), maar alleen omdat ze meer stappen zetten. Echter, als het project enorm is, worden de Verkenners eigenlijk goedkoper, omdat de Aktetas-detectives crashten en opnieuw moeten worden gestart of volledig falen.

De "Ground Truth"-Verrassing

De onderzoekers keken ook naar gevallen waarin beide detectives het oneens waren met de menselijke experts (de "Ground Truth").
Ze ontdekten dat de menselijke experts vaak ongelijk hadden of dat de regels verwarrend waren.

  • Voorbeeld: Soms labelde een mens een wijziging als "onduidelijk" omdat ze niet genoeg context hadden. De "Verkenner"-AI, die door de hele fabriek had gelopen, vond het ontbrekende stukje bewijs en gaf een duidelijk antwoord.
  • De Les: Het "correcte" antwoord kan eigenlijk degene zijn die de AI vond, niet degene die de mens oorspronkelijk had opgeschreven. Het vermogen van de AI om het hele plaatje te zien, onthulde dat de oorspronkelijke labels soms gebaseerd waren op beperkte informatie.

Samenvatting in één zin

Het gebruik van AI-agenten die zelf kunnen "rondlopen" en een code-repository kunnen doorzoeken, is net zo slim als het geven van een voorverpakte samenvatting aan AI, maar het is veel betrouwbaarder wanneer de code enorm is, en het onthult vaak dat de oorspronkelijke menselijke labels belangrijke context misten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →