Immersion in the GitHub Universe: Scaling Coding Agents to Mastery
Dit paper introduceert ScaleSWE, een geautomatiseerd multi-agent systeem dat een schaalbaar en reproduceerbaar framework biedt om een groot dataset van 100.000 geverifieerde software-engineeringtaken te genereren, wat leidt tot een aanzienlijke verbetering in de prestaties van een gefinetunede coderingsagent op de SWE Bench Verified-benchmark.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme bibliotheek hebt vol met miljoenen boeken (de code van GitHub), maar je wilt een jonge, slimme robot leren om deze boeken te lezen, fouten te vinden en nieuwe hoofdstukken te schrijven. Het probleem is: je hebt geen goede oefenboeken. De meeste bestaande oefenboeken zijn te makkelijk, te verzonnen, of ze missen de echte "regels" van de bibliotheek.
Dit artikel, getiteld "Immersion in the GitHub Universe: Scaling Coding Agents to Mastery", vertelt het verhaal van hoe de auteurs een oplossing hebben bedacht om deze robot (een AI) tot een meester te maken. Ze noemen hun project Scale-SWE.
Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:
1. Het Probleem: De "Oefenboeken" zijn te schaars
Vroeger maakten mensen handmatig oefenopdrachten voor hun AI. Dat is als een leraar die één voor één oefentoetsen schrijft. Het kost veel tijd, en je komt er niet veel.
Soms probeerden ze AI te gebruiken om deze toetsen te maken, maar dat gaf vaak onzinopdrachten die niet echt werkten in de echte wereld.
De kern: Er is een tekort aan echte, moeilijke en werkende oefenopdrachten om AI's te trainen.
2. De Oplossing: Een Automatische "Oefenfabriek"
De auteurs hebben een systeem bedacht dat werkt als een geautomatiseerde fabriek met drie speciale robots (agenten) die samenwerken. Ze noemen dit Scale-SWE.
In plaats van één menselijke leraar, hebben ze drie gespecialiseerde robots ingezet die samen een complete oefenopdracht maken:
Robot 1: De Bouwer (Environment Builder)
- Wat doet hij? Elke software is anders. Sommige werken op Windows, andere op Linux, en ze hebben allemaal andere gereedschappen nodig. Deze robot bouwt een speciale, afgesloten werkplek (een "sandbox" of een digitaal laboratorium) voor elke oefening.
- Vergelijking: Stel je voor dat je een kind wilt leren koken. Je kunt niet zomaar in de keuken van een ander gaan staan. Deze robot bouwt voor elke taak een eigen, perfect uitgeruste keuken met precies de juiste pannen en ingrediënten, zodat de AI veilig kan oefenen zonder de rest van het huis (de computer) te verstoren.
Robot 2: De Toetsenmaker (Unit-test Creator)
- Wat doet hij? Hoe weet je of de AI het goed heeft gedaan? Je hebt een toets nodig. Deze robot schrijft automatisch de vragen en de antwoorden. Hij maakt twee soorten vragen:
- De "Fout-vind" vraag: Een vraag die fout gaat als de code nog niet is opgelost, maar goed gaat als de AI het heeft opgelost.
- De "Geen-terugval" vraag: Vragen die al goed waren en die de AI niet mag "kapotmaken" terwijl hij aan het werk is.
- Vergelijking: Het is alsof deze robot een trainingsparcour bouwt. Hij zorgt dat er een obstakel is dat de AI moet overwinnen, en hij heeft ook een alarm geïnstalleerd dat afgaat als de AI per ongeluk een ander obstakel omver duwt.
- Wat doet hij? Hoe weet je of de AI het goed heeft gedaan? Je hebt een toets nodig. Deze robot schrijft automatisch de vragen en de antwoorden. Hij maakt twee soorten vragen:
Robot 3: De Schrijver (Problem Statement Writer)
- Wat doet hij? De AI moet weten wat hij moet doen. Deze robot schrijft een duidelijke opdracht, gebaseerd op de echte fouten die in de code zaten. Hij zorgt dat de opdracht niet "lekt" (hij vertelt niet direct hoe het op te lossen is, maar beschrijft alleen het probleem).
- Vergelijking: Hij is de leraar die een duidelijk examenopdracht schrijft. Hij zegt niet: "Schrijf code X", maar zegt: "Deze machine stopt met werken als je knop A indrukt. Maak het weer werkend."
3. Het Resultaat: De Goudmijn
Deze fabriek heeft 6 miljoen echte verzoeken (Pull Requests) van GitHub doorlopen.
- Ze hebben 100.000 gecontroleerde, perfecte oefenopdrachten gemaakt.
- Dit is de grootste verzameling ooit, afkomstig uit 5.200 verschillende projecten.
- Het is niet alleen groter, maar ook veel diverser. Waar andere datasets vaak alleen simpele fouten bevatten, bevat deze dataset alles: van ingewikkelde logische fouten tot veiligheidsproblemen.
4. De Test: De AI wordt een Meester
Om te bewijzen dat hun "oefenboeken" goed zijn, hebben ze een AI (Qwen-30B) getraind met deze data.
- Voor de training: De AI loste maar 22% van de moeilijke problemen op.
- Na de training: De AI loste 64% op!
- Dit is een enorme sprong. De AI presteert nu beter dan veel andere grote modellen, en dat met een model dat niet eens groter is dan de concurrenten.
Conclusie
Dit artikel laat zien dat je AI's niet alleen kunt trainen met meer rekenkracht, maar vooral met beter, realistischere data. Door een automatische fabriek te bouwen die zelf de omgeving, de toetsen en de opdrachten maakt, kunnen ze AI's sneller en beter leren om echte softwareproblemen op te lossen.
Het is alsof ze van een kleine, simpele oefenhal een gigantisch, realistisch trainingscentrum hebben gebouwd, waardoor hun robot-leraar in recordtijd een meester is geworden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.