← Nieuwste papers
💻 computer science

SWE-Together: Evaluating Coding Agents in Interactive User Sessions

Dit artikel introduceert SWE-Together, een multi-turn benchmark afgeleid van echte user-agent programmeersessies die een reactieve LLM-gebaseerde gebruikerssimulator gebruikt om programmeeragenten te evalueren op basis van zowel de uiteindelijke repository-correctheid als het aantal benodigde correctieve feedbackrondes, waarbij wordt onthuld dat sterkere agenten hogere succespercentages behalen met minder interventies.

Oorspronkelijke auteurs: Yifan Wu, Zhuokai Zhao, Songlin Li, Ho Hin Lee, Jiacheng Zhu, Shirley Wu, Tianhe Yu, Serena Li, Lizhu Zhang, Xiangjun Fan, Shengzhi Li

Gepubliceerd 2026-06-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yifan Wu, Zhuokai Zhao, Songlin Li, Ho Hin Lee, Jiacheng Zhu, Shirley Wu, Tianhe Yu, Serena Li, Lizhu Zhang, Xiangjun Fan, Shengzhi Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuwe software engineer aanneemt. In het verleden zou je hen testen door een perfect geschreven handleiding van 10 pagina's aan te leveren en te zeggen: "Bouw deze feature." Je zou wachten tot ze klaar waren, naar de uiteindelijke code kijken en ze een cijfer geven. Als de code werkte, kregen ze een A. Als dat niet zo was, kregen ze een F.

Het Probleem: Het echte leven is niet zo. In een echte baan heb je geen perfecte handleiding. Je begint met een vaag idee, de engineer bouwt iets, je realiseert je dat je een cruciaal detail bent vergeten, je corrigeert een fout die ze maakten, en je verduidelijkt je doel halverwege. De oude tests maten niet hoe goed een engineer omgaat met dit rommelige, heen-en-weer proces van communicatie. Ze maten alleen het eindproduct, en negeerden hoeveel begeleiding de engineer nodig had om daar te komen.

De Oplossing: SWE-Together
De auteurs van dit paper hebben een nieuwe testomgeving gecreëerd genaamd SWE-Together. Zie het als een "replaybare videogame" voor coding agents (AI-programmeerders).

Zo werkt het, opgedeeld in eenvoudige onderdelen:

1. Het Bronmateriaal: Beelden uit het echte leven

In plaats van nep testvragen te verzinnen, zijn de onderzoekers de echte wereld in gegaan om te vissen. Ze hebben gekeken naar 11.260 werkelijke gesprekken tussen echte mensen en AI-coding assistenten. Uit deze enorme berg hebben ze zorgvuldig 109 specifieke taken geselecteerd die perfect zijn voor een test.

  • De Filter: Ze hebben gesprekken weggegooid die te rommelig waren, geen duidelijk doel hadden of niet reproduceerbaar waren. Ze hielden alleen de gesprekken over waar de mens een duidelijk doel had, de AI echt werk verrichtte en het resultaat gecontroleerd kon worden.

2. De "Robot Gebruiker" Simulator

Dit is het slimste deel. Om een nieuwe AI te testen, kunnen ze niet simpelweg de oude berichten van de mens herhalen, want de nieuwe AI kan een ander pad inslaan. Als de nieuwe AI een andere fout maakt, maakt de volgende boodschap van de oude mens misschien geen zin meer.

Daarom hebben ze een Slimme Robot Gebruiker gebouwd.

  • Hoe het werkt: Stel je een regisseur voor die een toneelstuk bekijkt. De regisseur weet precies wat de oorspronkelijke mens wilde bereiken. Terwijl de nieuwe AI-acteur optreedt, kijkt de Robot Gebruiker toe. Als de AI van het pad afwijkt of een punt mist dat de oorspronkelijke mens wel opgemerkt zou hebben, grijpt de Robot Gebruiker in en zegt: "Wacht, ik bedoelde eigenlijk X," of "Je bent Y vergeten."
  • Het Doel: De Robot Gebruiker gedraagt zich precies zoals de oorspronkelijke mens zou hebben gedaan, maar past de timing aan op de prestaties van de nieuwe AI. Dit zorgt ervoor dat elke AI wordt getest tegen dezelfde "intentie", zelfs als ze verschillende routes nemen.

3. Het Nieuwe Scoreformulier

In de oude tests kreeg je slechts één score: Werkt de code?
In SWE-Together gebruiken ze een scoreformulier met twee delen:

  • Deel A: Het Eindcijfer (Correctheid): Heeft de AI uiteindelijk gebouwd wat de vraag was?
  • Deel B: De "Hand-holding" Score (Gebruikerscorrectie): Dit is de grote innovatie. Ze tellen hoe vaak de Robot Gebruiker de AI moest corrigeren.
    • Analogie: Stel je twee studenten voor die een wiskundetoets maken. Beiden hebben het juiste antwoord.
      • Student A heeft het zelf uitgevogeld.
      • Student B heeft het juiste antwoord, maar pas nadat de leraar hem drie keer een duwtje heeft gegeven en een grote fout heeft gecorrigeerd.
    • In SWE-Together krijgt Student A een beter cijfer omdat er minder interventie nodig was. De paper noemt dit "User Correction" (Gebruikerscorrectie).

Wat ze vonden

De onderzoekers hebben zeven van de slimste beschikbare AI-modellen getest. Dit is wat er gebeurde:

  1. Slimere AI heeft minder hulp nodig: Er was een duidelijk patroon. De "slimmere" AI-modellen (zoals Claude Opus 4.8) haalden hogere eindscores en vereisten minder correcties van de Robot Gebruiker. De "zwakkere" modellen haalden lagere scores en hadden de Robot Gebruiker nodig om hen constant te sturen en te corrigeren.
  2. De Robot Gebruiker is overtuigend: Ze hebben getest of mensen het verschil konden zien tussen de Robot Gebruiker en een echte mens. Dat konden ze niet. De simulatie was zo goed dat mensen het verschil niet betrouwbaar konden waarnemen.
  3. Efficiëntie: Sommige modellen waren sneller en gebruikten minder "tokens" (woorden/rekenkracht) om de klus te klaren, terwijl anderen langzamer maar nauwkeuriger waren.

De Kern van de Zaak

Het paper betoogt dat we moeten stoppen met het testen van AI-coders alsof ze een schriftelijk examen afleggen met een perfect antwoordmodel. We moeten ze testen alsof ze in een echt kantoor werken.

SWE-Together bewijst dat de beste coding agents niet alleen degenen zijn die uiteindelijk de code kunnen fixen; het zijn degenen die kunnen luisteren, vage instructies begrijpen en hun eigen fouten kunnen herstellen zonder dat er constant een mens hoeft in te grijpen om te zeggen: "Nee, dat is niet wat ik bedoelde."

Kortom: Het is een benchmark die AI beloont voor het zijn van een goede collaborateur (medewerker), niet alleen een goede code generator.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →