← Nieuwste papers
🤖 AI

CODESKILL: Learning Self-Evolving Skills for Coding Agents

CODESKILL is een op versterkingslering gebaseerd raamwerk dat leert om een compacte bank van procedurale vaardigheden met meerdere granulariteiten te extraheren, te evolueren en te onderhouden uit trajecten van codeeragenten, waardoor de prestaties op downstream-taken op benchmarks zoals SWE-Bench Verified aanzienlijk worden verbeterd in vergelijking met bestaande prompt-gebaseerde of geheugengerichte benaderingen.

Oorspronkelijke auteurs: Yanzhou Li, Yiran Zhang, Xiaoyu Zhang, Xiaoxia Liu, Yang Liu

Gepubliceerd 2026-05-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yanzhou Li, Yiran Zhang, Xiaoyu Zhang, Xiaoxia Liu, Yang Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme robotassistent leert softwarebugs op te lossen. Elke keer als de robot probeert een probleem op te lossen, doorloopt het een lang proces: het bekijkt de code, probeert een commando, ziet een fout, probeert opnieuw en lost het uiteindelijk (hopelijk) op. Deze hele reis wordt een "traject" genoemd.

Het probleem is dat als je de robot gewoon een dagboek laat bijhouden van elke enkele handeling die het ooit heeft gedaan, dat dagboek een rommelige, overweldigende berg papier zou worden. Het grootste deel bestaat uit specifieke details over één bepaalde bug die niet helpen bij de volgende.

CODESKILL is een nieuw systeem dat is ontworpen om die rommelige berg papier om te zetten in een strakke, georganiseerde handleiding die de robot daadwerkelijk kan gebruiken.

Hier is hoe het werkt, opgesplitst in eenvoudige concepten:

1. Het Probleem: Te Veel Ruis, Te Weinig Signaal

Op dit moment vertrouwen robots die proberen te leren van hun eerdere fouten vaak op starre regels of vaste prompts (zoals een leraar die zegt: "Doe altijd X als je Y ziet"). Maar software-engineering is complex. Soms slaagt de robot per ongeluk, en soms faalt het om een rare reden. Het is moeilijk te zeggen wat een herbruikbare vaardigheid is (zoals "hoe je een gebroken internetverbinding oplost") versus slechts een eenmalig toeval (zoals "hoe je de specifieke typefout in dit bestand oplost").

Bestaande methoden zijn als een bibliothecaris die boeken gewoon op de vloer stapelt zonder ze te ordenen. Ze weten niet welke boeken eigenlijk nuttig zijn voor de volgende lezer.

2. De Oplossing: De "Zelf-ontwikkelende Bibliothecaris"

CODESKILL fungeert als een slimme bibliothecaris die de kennisbank van de robot beheert (een Vaardigheidsbank genoemd). In plaats van alleen ruwe verhalen op te slaan, doet het het volgende:

  • Haalt Vaardigheden Op: Het leest de eerdere reizen van de robot en haalt de "gouden klonten" eruit – de algemene regels die op veel situaties van toepassing zijn.
  • Ontwikkelt Vaardigheden: Als de robot een vaardigheid probeert en het mislukt, gooit de bibliothecaris de vaardigheid niet zomaar weg. Het werkt de handleiding bij met de tekst: "Oh, deze regel werkt, tenzij je dit specifieke foutbericht ziet."
  • Onderhoudt de Bibliotheek: Het controleert voortdurend de bibliotheek. Als twee boeken hetzelfde zeggen, voegt het ze samen. Als een boek te specifiek of nutteloos is, gooit het het weg. Dit houdt de bibliotheek klein en efficiënt.

3. Hoe Het Leert: De "Trainer en de Atleet"

Het meest unieke deel van CODESKILL is hoe het leert om een goede bibliothecaris te zijn. Het raadt niet zomaar; het krijgt feedback van een "bevroren" atleet (de coderende robot).

  • De Atleet: Dit is de coderende robot die de daadwerkelijke problemen oplost. Het verandert zijn hersenen niet; het probeert gewoon taken op te lossen.
  • De Trainer (CODESKILL): Dit is het systeem dat de vaardigheden beheert.
  • De Trainingslus:
    1. De Trainer creëert een nieuwe regel op basis van eerdere ervaring.
    2. De Trainer geeft deze regel aan de Atleet.
    3. De Test: Lost de Atleet het probleem sneller of beter op met deze nieuwe regel?
    4. De Beloning: Als de Atleet slaagt, krijgt de Trainer een hoge score. Als de Atleet faalt, krijgt de Trainer een lage score.
    5. De Trainer gebruikt deze score om te leren: "Oké, ik moet de volgende keer betere regels schrijven."

Het artikel noemt dit Versterkend Leren. Het is als het trainen van een hond: je vertelt de hond niet alleen wat het moet doen; je geeft het een traktatie als het het goed doet, zodat het leert het gedrag te herhalen dat de traktatie oplevert.

4. Twee Soorten Vaardigheden

CODESKILL organiseert kennis in twee soorten instructies, zoals een kookboek met twee secties:

  • Opdracht-niveau Vaardigheden (Het Grote Plaatje): Dit zijn hoogwaardige strategieën. Voorbeeld: "Wanneer je ziet dat een Java-build mislukt, controleer eerst je internetverbinding en daarna je afhankelijkheden."
  • Gebeurtenis-gestuurde Vaardigheden (De Snelle Oplossingen): Dit zijn reacties op specifieke momenten. Voorbeeld: "Als je een fout ziet met de tekst 'Bestand niet gevonden', controleer direct of het bestandspad een typefout bevat."

5. De Resultaten: Een Slimmere, Snellere Robot

De onderzoekers testten CODESKILL in drie verschillende "examenzalen" (benchmarks) waar coderende robots echte softwareproblemen uit de praktijk moeten oplossen.

  • De Baseline: Een robot zonder handleiding (alleen ruwe intelligentie).
  • De Wedstrijd: Robots die oudere methoden gebruiken om eerdere taken te onthouden (zoals gewoon een dagboek lezen of vaste prompts gebruiken).
  • CODESKILL: De robot die de zelf-ontwikkelende vaardigheidsbibliotheek gebruikt.

De Uitkomst:
De robot van CODESKILL loste aanzienlijk meer problemen op dan de anderen.

  • Het verbeterde het slagingspercentage met ongeveer 9,7% in vergelijking met het hebben van helemaal geen vaardigheden.
  • Het versloeg de sterkste bestaande "geheugen"-methoden met ongeveer 4%.
  • Het loste problemen ook sneller op, met minder stappen om de oplossing te bereiken, omdat het betere instructies had om te volgen.

De Conclusie

CODESKILL is een raamwerk dat een coderende robot leert hoe te leren. In plaats van gewoon elke gebeurtenis die plaatsvond te memoriseren, leert het die ervaringen te distilleren tot een compacte, evoluerende set regels. Het fungeert als een trainer die het spelplan voortdurend verfijnt op basis van of het team het spel daadwerkelijk wint, zodat de robot na verloop van tijd beter en efficiënter wordt zonder dat het opnieuw vanaf nul geprogrammeerd hoeft te worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →