Open-SWE-Traces: Advancing Dual-Mode Multilingual Distillation for Software Engineering Agents
Dit artikel introduceert Open-SWE-Traces, een grootschalige, meertalige dataset van 207.489 software engineering agent-trajecten afgeleid van echte pull requests, die de distillatie van hoogpresterende, open-source modellen mogelijk maakt die in staat zijn om state-of-the-art resultaten te behalen op diverse SWE-bench evaluaties.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot wilt leren hoe hij kapotte code in een enorme softwarebibliotheek moet repareren. Het probleem is dat je de robot niet simpelweg kunt vertellen wat hij moet repareren; je moet hem laten zien hoe hij over het probleem nadenkt, fouten maakt, het opnieuw probeert en uiteindelijk slaagt. Tot nu toe was er niet genoeg "beeldfunctie" van dit proces om robots goed te kunnen onderwijzen, vooral voor veel verschillende programmeertalen.
Deze paper introduceert OPEN-SWE-TRACES, een enorme nieuwe bibliotheek aan "beeldfunctie" die ontworande is om AI-agenten te leren hoe ze software engineers moeten zijn.
Hier is een overzicht van wat ze hebben gedaan, met behulp van eenvoudige analogieën:
1. Het Probleem: Een Gebrek aan "Trainingsvideo's"
Beschouw software engineering als een complexe sport. Om een nieuwe speler (een AI) te trainen, moet je duizenden uren aan professionele wedstrijden kijken om de bewegingen te leren.
- De Bottleneck: Voorheen hadden onderzoekers slechts een paar uur aan "wedstrijdbeelden". Ze hadden niet genoeg diverse voorbeelden van hoe bugs worden opgelost in verschillende talen (zoals Python, Java of C++) om een echt slimme AI te trainen.
- De Oplossing: De auteurs creëerden OPEN-SWE-TRACES, een dataset met 207.489 opgenomen "wedstrijden". Dit zijn real-world scenario's waarin een AI probeerde een bug te repareren in een echt softwareproject.
2. De Trainingsmethode: Twee Modi van Denken
De paper introduceert een slimme manier om de AI te onderwijzen, geïnspireerd door hoe mensen werken. Ze noemen dit "Dual-Mode Distillation."
- Modus A: De "Denker" (Langzaam & Zorgvuldig)
Stel je een grootmeester bij schaken voor die pauzeert om elke mogelijke zet te berekenen voordat hij een stuk aanraakt. De dataset bevat traces waarin de AI expliciet "hardop nadenkt" (Chain-of-Thought) voordat hij handelt.- De Magie: De paper vond dat wanneer de AI de tijd neemt om na te denken, hij feitelijk minder totale zetten doet om een probleem op te lossen. Het is also[gelijk] een moment nemen om een route te plannen zodat je niet verdwaalt en in cirkels loopt. Dit bespaart op de lange termijn tijd en moeite.
- Modus B: De "Doener" (Snel & Direct)
Stel je een monteur voor die een losse bout ziet en deze onmiddellijk vastdraait zonder een lang betoog te houden. De dataset bevat ook traces waarin de AI snel handelt zonder de interne monoloog.- Het Doel: De AI leert te schakelen tussen deze modi: "Denk" voor moeilijke problemen, en "Doe" voor eenvoudige taken.
3. Hoe ze de Dataset hebben Opgebouwd
Ze hebben niet zomaar verzonnen problemen bedacht. Ze gingen naar de echte wereld:
- De Bron: Ze keken naar 20.000 echte Pull Requests (werkelijke code-wijzigingen ingediend door mensen) van open-source projecten.
- De Acteurs: Ze gebruikten twee krachtige AI-"coaches" (MiniMax-M2.5 en Qwen3.5) om deze echte problemen te bekijken en te simuleren hoe een agent ze zou oplossen.
- De Veiligheidscontrole: Voordat een opname aan de bibliotheek werd toegevoegd, draaiden ze een strikte beveiligingsfilter. Ze controleerden of de AI niet heeft "gecheat" door in het antwoordblad te spieken (de git-geschiedenis te hacken) of de regels te breken. Als de AI probeerde te cheaten, werd die opname weggegooid.
4. De Resultaten: Een Nieuwe Kampioen
Nadat ze deze enorme bibliotheek aan "beeldfunctie" aan een student-AI (gebaseerd op het Qwen3-30B model) hebben gevoerd, hebben ze deze getest op drie beroemde "examens" (benchmarks) die meten hoe goed een AI echte bugs kan repareren:
- SWE-bench Verified: De student kreeg 61,7% van de problemen goed.
- SWE-bench Multilingual: De student kreeg 57,1% goed over vele verschillende talen.
- SWE-bench Pro: De student kreeg 36,8% goed op zeer moeilijke, professionele taken.
Waarom is dit een grote zaak?
De paper vergelijkt deze nieuwe student met andere top-tier AI-modellen. Het nieuwe model, getraind op deze specifieke dataset, presteerde beter dan veel andere open-source modellen en kwam zeer dicht in de buurt van sommige van de duurste, "closed-source" superintelligenties.
5. Belangrijke Lessen
De auteurs voerden experimenten uit om te zien wat de AI slim maakte:
- Taal Maakt Verschil: De AI trainen op alleen Python was oké, maar het trainen op negen talen (Python, Go, Java, etc.) maakte hem aanzienlijk beter in het oplossen van alle soorten problemen, zelfs de Python-problemen. Het is also[gelijk] als leren rijden in regen, sneeuw en zand; dat maakt je een betere bestuurder in de stad.
- Falen is Goed: Ze ontdekten dat het opnemen van registraties waarin de AI er niet in slaagde de bug te repareren, ook daadwerkelijk nuttig was. Het leerde de AI wat hij niet moest doen. Als je een student alleen de winnende plays laat zien, leert hij niet hoe hij verlies moet voorkomen.
- De "Denk"-Trade-off: Hoewel "denk"-traces de AI hielpen bij het oplossen van moeilijke problemen, presteerde de AI over het algemeen iets beter wanneer hij in staat was snel te handelen ("no-think") bij standaardtaken. De beste aanpak is een mix van beide.
Samenvatting
De paper presenteert een enorme, hoogwaardige bibliotheek van software engineering "herhalingen" die AI-agenten leert hoe ze moeten denken en handelen als menselijke ontwikkelaars. Door een mix te gebruiken van "langzaam denken" en "snel handelen" over vele programmeertalen heen, hebben ze een open-source AI gecreëerd die nu een van de beste is in het repareren van echte softwarebugs in de echte wereld.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.