← Nieuwste papers
💻 computer science

Compressing Code Context for LLM-based Issue Resolution

Dit paper introduceert SWEzze, een framework dat Oracle-guided Code Distillation en een lichtgewicht model combineert om de codecontext voor LLM-gebaseerde probleemoplossing effectief te comprimeren, waardoor de tokenkosten aanzienlijk worden verlaagd en de succesratio van bugfixes op GitHub-issues verbetert.

Oorspronkelijke auteurs: Haoxiang Jia, Earl T. Barr, Sergey Mechtaev

Gepubliceerd 2026-03-31
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Haoxiang Jia, Earl T. Barr, Sergey Mechtaev

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantische bibliotheek hebt, vol met boeken over een specifiek onderwerp. Je vraagt aan een superintelligente robot (een AI) om een fout in één van die boeken te vinden en te repareren.

Het probleem? De robot moet alle boeken in de bibliotheek doorbladeren om die ene zin te vinden die hij nodig heeft. Dit kost enorm veel tijd, geld en energie. Bovendien raakt de robot in de war door alle onnodige informatie; hij vergeet waar hij naar op zoek was omdat er te veel "ruis" is.

Dit is precies het probleem dat de auteurs van dit paper proberen op te lossen. Ze hebben een slimme methode bedacht om de "boeken" (de code) te comprimeren, zodat de robot alleen het essentiële leest.

Hier is hoe het werkt, vertaald naar alledaagse taal:

1. Het Probleem: De "Te Dikke Telefoonboek"-Syndroom

Wanneer een AI een bug in software moet repareren, krijgt hij vaak een enorm stuk code voorgelegd. Dit is alsof je iemand vraagt om een specifiek woord in een telefoonboek te vinden, maar je geeft hem het hele telefoonboek van heel China.

  • Gevolg: De AI wordt afgeleid door de duizenden pagina's die niets met de fout te maken hebben. Het kost ook veel geld om al die tekst te verwerken.

2. De Oplossing: SWEzze (De Slimme Samenvatter)

De auteurs hebben een nieuw systeem bedacht, genaamd SWEzze. Denk aan SWEzze als een super-slimme redacteur die voor de AI werkt. Zijn enige taak is: "Haal alles weg wat niet nodig is, maar laat precies genoeg over zodat de oplossing nog steeds werkt."

Maar hoe weet die redacteur wat nodig is? Normaal gesproken zou hij raden of kijken naar woorden die lijken op de fout. Maar dat werkt niet goed bij code. Code is logisch; als je één stukje weghaalt, kan de hele zin onzin worden.

3. De Magische Methode: "Oracle-gestuurde Distillatie"

Hier komt het creatieve deel. Om SWEzze te leren wat belangrijk is, hebben de auteurs een trucje gebruikt:

  • De Orakel (De Meester): Stel je een onfeilbare meester voor die precies weet welke pagina's van het telefoonboek nodig zijn om de fout te vinden. Deze meester probeert duizenden combinaties van tekst uit en kijkt welke combinatie het kleinste is, maar nog steeds werkt.
  • De Leerling (SWEzze): SWEzze kijkt naar wat de meester doet. Hij ziet: "Ah, de meester hield dit stukje code over en gooide dat stukje weg."
  • Het Resultaat: SWEzze leert niet alleen te raden, maar leert de logica achter het behouden van de juiste stukjes. Hij leert om de "recept-ingredienten" te bewaren en de "kookpan" weg te laten.

4. Hoe werkt het in de praktijk?

Stel je voor dat je een recept hebt voor een taart, maar je hebt ook de volledige handleiding van de oven, het verhaal van de boer die de bloem kweekte, en de geschiedenis van suiker.

  • De oude methoden zouden proberen de handleiding van de oven korter te maken door zinnen te schrappen, maar ze haalden per ongeluk de instructie "bak op 180 graden" weg. De taart mislukt.
  • SWEzze kijkt naar het recept en zegt: "Ik heb de ovenhandleiding niet nodig, maar ik moet wel de temperatuur en de ingrediënten houden." Hij snijdt de tekst terug tot een strakke lijst van alleen de noodzakelijke stappen.

5. De Resultaten: Sneller, Goedkoper en Beter

Toen ze SWEzze testten op echte software-fouten (in een database genaamd SWE-bench), gebeurde er iets verrassends:

  • Minder tekst: De AI kreeg 50% tot 70% minder tekst te lezen.
  • Minder geld: Omdat er minder tekst is, kost het verwerken veel minder geld.
  • Beter resultaat: De AI loste meer fouten op dan voorheen! Waarom? Omdat hij niet meer afgeleid werd door de onzin. Hij kon zich volledig focussen op de echte oplossing.

Samenvattend

Dit paper introduceert een manier om AI te helpen bij het repareren van software door de "informatie-overload" te voorkomen. In plaats van de AI een berg aan informatie te geven, geven ze hem een op maat gemaakte samenvatting die is gemaakt door een slimme leerling die heeft geleerd van een meester.

Het is alsof je van een rommelige zolder (de originele code) een strakke werkplek maakt (de gecomprimeerde context) waar de AI precies weet waar hij moet zoeken, zonder dat hij zich laat afleiden door oude kranten en lege dozen. Het resultaat is een snellere, goedkopere en slimmere AI die beter werk levert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →