← Nieuwste papers
💻 computer science

SWE-Manager: Selecting and Synthesizing Golden Proposals Before Coding

Dit artikel introduceert SWE-Manager, een 8B reinforcement learning-model dat technische managers nabootst door de beste kandidaat-voorstel te selecteren en een "golden" oplossing voor softwareproblemen te synthetiseren zonder code uit te voeren, waarmee het een state-of-the-art prestatie bereikt op de SWE-Lancer Manager benchmark.

Oorspronkelijke auteurs: Boyin Tan, Haoning Deng, Junyuan Zhang, Junjielong Xu, Pinjia He, Youcheng Sun

Gepubliceerd 2026-07-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Boyin Tan, Haoning Deng, Junyuan Zhang, Junjielong Xu, Pinjia He, Youcheng Sun

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de kapitein bent van een schip (een softwareproject) en er heeft een storm uitgebroken (een bug of een nieuwe feature-aanvraag). Voordat je het schip kunt besturen, moet je beslissen welk pad je neemt.

In de echte wereld raadt je bemanning niet zomaar wat. Ze kunnen drie verschillende zeelieden horen roepen met drie verschillende routes:

  • Zeilman A zegt: "Neem de kortere route door het rif! Het is snel, maar riskant."
  • Zeilman B zegt: "Ga om het eiland heen. Het is veilig, maar het duurt drie dagen."
  • Zeilman C zegt: "Laten we eerst de motor repareren, en dan pas gaan. Dat is het meest grondig, maar het is duur."

Meestal moet een menselijke manager naar alle drie luisteren, de risico's afwegen, het weer controleren (de specifieke context van het probleem) en het beste plan kiezen. Dit artikel, SWE-Manager, vraagt zich af: Kan een AI leren om die manager te zijn?

Hier is het verhaal van hoe ze het gebouwd hebben, eenvoudig uitgelegd:

1. Het Probleem: AI is goed in schrijven, maar slecht in kiezen

Huidige AI-modellen (zoals de modellen die code schrijven) zijn geweldig in het genereren van één oplossing. Maar in echte softwareteams schrijven mensen vaak meerdere oplossingen en discussiëren ze vervolgens over welke het beste is.

  • De Kloof: AI is niet echt geleerd om in de "directiestoel" te gaan zitten, naar alle opties te luisteren, ze te vergelijken en te zeggen: "Oké, we gaan voor Zeilman B, maar laten we het zo aanpassen dat het sneller gaat."
  • De Vraag: Is deze vaardigheid van "de winnaar kiezen" gewoon een willekeurige menselijke voorkeur, of is er een logisch patroon dat een AI kan leren?

2. Het Detectivewerk: Wat doen echte managers?

De onderzoekers traden op als detectives. Ze bekeken duizenden echte discussies op GitHub (een plek waar programmeurs hun code delen) waar mensen discussieerden over hoe ze bugs moesten oplossen. Ze ontdekten drie grote geheimen over hoe menselijke managers kiezen:

  • Geheim #1: Het is niet willekeurig. Managers kiezen niet zomaar hun favoriet. Ze gebruiken altijd een paar "hoogwaardige regels", zoals: "Is dit veilig?" "Zal dit andere dingen breken?" "Is het makkelijk om later aan te passen?"
  • Geheim #2: Het is een vergelijking, geen test. Je kunt een voorstel niet in isolatie beoordelen. Je moet ze met elkaar vergelijken binnen de specifieke context van het probleem. (bijv. "Zeilman A is snel, maar aangezien we in een storm zitten, is veiligheid belangrijker dan snelheid.")
  • Geheim #3: Het beste plan is een mix. Vaak is het uiteindelijke plan niet zomaar het idee van één zeilman. Het is een "Gouden Voorstel" dat de beste delen van Zeilman A, de veiligheid van Zeilman B en de grondigheid van Zeilman C neemt en deze combineert tot één perfect plan.

3. De Oplossing: SWE-Manager (De AI-Manager)

Gebaseerd op deze geheimen bouwde het team SWE-Manager. Denk aan dit als een nieuw soort AI die niet alleen code schrij bent, maar ook het gesprek beheert.

In plaats van alleen te zeggen "Hier is de code", doet SWE-Manager drie dingen:

  1. Leest de Issue: Het begrijpt het probleem.
  2. Beoordeelt de Kandidaten: Het kij je naar de verschillende voorstellen (zoals de routes van de zeelieden).
  3. De "Gouden" Synthese: Het kiest de beste richting, legt uit waarom het die koos, en schrijft vervolgens een nieuw, "Gouden Voorstel" dat de beste ideeën van alle kandidaten combineert tot één duidelijke instructie.

Ze trainden een specifieke versie genaamd SWE-Manager-8B (een model met 8 miljard parameters) met een speciaal tweestaps-proces:

  • Stap 1 (School): Ze leerden het de format van het vergelijken en uitleggen (Supervised Fine-Tuning).
  • Stap 2 (Oefening): Ze lieten het oefenen met het maken van keuzes en beloonden het wanneer het de juiste keuze maakte, waardoor het leerde om te "denken" als een manager (Reinforcement Learning).

4. De Resultaten: Werkt de AI-manager?

Ze stelden de AI op twee manieren op de proef:

Test A: De "Wie is de baas?" Test (Selectie)
Ze gaven de AI een probleem en drie verschillende oplossingen, en vroegen het om de optie te kiezen die een menselijke manager gekozen zou hebben.

  • Het Resultaat: SWE-Manager-8B had het in 53% van de gevallen bij het rechte eind.
  • De Vergelijking: Een zeer krachtige, beroemde AI (GPT-5) had het in slechts 44% van de gevallen bij het rechte eind. Ondanks dat SWE-Manager een kleiner, goedkoper model is, was het beter in het kiezen van het juiste pad.

Test B: De "Helpt het bij het bouwen?" Test (Implementatie)
Ze zetten een workflow op (genaamd P2A) waarbij:

  1. Eén AI de voorstellen schrijft.
  2. SWE-Manager het beste voorstel kiest en het "Gouden Voorstel" schrijft.
  3. Een derde AI probeert de fix te bouwen op basis van dat Gouden Voorstel.
  • Het Resultaat: Wanneer SWE-Manager de manager was, slaagde het team erin om 55,6% van de problemen op te lossen.
  • De Vergelijking: Dit was beter dan wanneer er helemaal geen manager was (wat 48,5% oploste) en kwam overeen met de prestaties van het gebruiken van de gigantische GPT-5 als manager.

De Belangrijkste Conclusie

Het artikel bewijst dat het kiezen van het juiste plan een vaardigheid is die een AI kan leren.

Het gaat er niet alleen om slim genoeg te zijn om code te schrijven; het gaat erom slim genoeg te zijn om opties te vergelijken, de risico's te begrijpen en de beste ideeën te combineren tot één duidelijke instructie. Door een AI te leren te handelen als een "Technisch Manager", kunnen we softwareontwikkeling betrouwbaarder en efficiënter maken, zelfs met kleinere, goedkopere AI-modellen.

Kortom: Het artikel laat zien dat als je een AI leert om een goede rechter en een goede redacteur te zijn, het veel beter wordt in het helpen bouwen van software door mensen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →