← Nieuwste papers
🤖 machine learning

SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions

Het artikel introduceert SWE-Interact, een nieuwe benchmark die coderingsagenten evalueert op realistische, multi-turn, door gebruikers gestuurde software engineering-taken, wat onthult dat sterke prestaties op traditionele single-turn benchmarks niet betrouwbaar vertalen naar de interactieve, iteratieve workflows die vereist zijn voor effectieve real-world ontwikkeling.

Oorspronkelijke auteurs: Mohit Raghavendra, Anisha Gunjal, Aakash Sabharwal, Yunzhong He

Gepubliceerd 2026-06-30
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Mohit Raghavendra, Anisha Gunjal, Aakash Sabharwal, Yunzhong He

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar onervaren architect inhuurt om een huis te bouwen.

De Oude Manier (Traditionele Benchmarks)
In het verleden testten onderzoekers deze AI-"architecten" door ze op dag één een compleet, 50 pagina's tellend blauwdruk te overhandigen. De blauwdruk bevatte elk detail: de houtsoort, de exacte tint verf, de plaatsing van elk stopcontact en het merk van de kraan. De taak van de AI was simpelweg om het plan te lezen en het huis perfect te bouwen.

  • Het Probleem: Dit weerspiegelt niet hoe echte bouwprojecten verlopen. In de echte wereld hebben klanten zelden direct een perfecte blauwdruk klaar. Ze zeggen meestal: "Ik wil een gezellig huis met een grote keuken," en veranderen vervolgens van gedachten zodra ze de voortgang zien.

De Nieuwe Manier (SWE-INTERACT)
Het paper introduceert SWE-INTERACT, een nieuwe test die een echt bouwproject simuleert.

  • De Opzet: In plaats van een perfecte blauwdruk, begint de AI met een vage opdracht: "Bouw een huis voor mij."
  • De Cliënt (De Simulator): Een computerprogramma fungeert als de "cliënt". Het zit niet alleen maar stil; het loopt actief rond op de bouwplaats.
    • Het bekijkt de fundering en zegt: "Hé, ik realiseerde me niet dat ik een kelder wilde."
    • Het bekijkt de keuken en zegt: "Eigenlijk wil ik het fornuis hier, niet daar."
    • Het controleert de bedrading en zegt: "Wacht, ik heb meer stopcontacten nodig."
  • Het Doel: De AI moet ontdekken wat de cliënt eigenlijk wil door te luisteren naar deze voortdurend veranderende opmerkingen, fouten te herstellen en het huis stukje bij beetje te bouwen, terwijl de cliënt nieuwe eisen blijft toevoegen.

De Grote Ontdekking
De onderzoekers hebben de slimste AI-codemodellen getest in beide scenario's. Dit is wat ze vonden:

  1. Goed in Lezen, Slecht in Luisteren: De modellen die uitblonken in het bouwen van huizen op basis van perfecte blauwdrukken (de "Single-Turn" test), hadden veel moeite wanneer de cliënt van gedachten veranderde. Hun succespercentage daalde van ongeveer 50% naar 25%.
  2. De "Overmoedige" Fout: De beste modellen (zoals GPT-5.5 en Opus 4.8) waren dapper genoeg om zelfs met vage instructies al te beginnen met bouwen. Ze konden herstellen en dingen repareren wanneer de cliënt hen corrigeerde. Echter, ze vergaten vaak eerdere instructies of maakten technische fouten terwijl ze probeerden te slim te zijn.
  3. De "Opgeven" Fout: Zwakkere modellen raakten in de war door het vage begin, gaven te vroeg op of negeerden de nieuwe instructies van de cliënt volledig.

Waarom Dit Belangrijk Is
Denk eraan als een videogame. De oude tests waren als een level waarin je precies weet waar de vijanden zijn en hoe de baas eruitziet. De nieuwe test is als een live-action rollenspel waarbij de "Game Master" (de cliënt) het verhaal verandert terwijl je speelt.

Het paper concludeert dat een goede programmeur niet alleen gaat over weten hoe je code schrijdt (de blauwdruk); het gaat erom dat je het geduld en de vaardigheid hebt om samen te werken met een mens die zelf nog niet precies weet wat hij wil totdat hij het ziet. De huidige AI-modellen worden hier beter in, maar ze moeten nog een lange weg afleggen voordat ze echt een menselijke ontwikkelaar kunnen vervangen in een echte, chaotische, collaboratieve omgeving.

Kortom: Het paper heeft een nieuwe "sportschool" gebouwd om AI-programmeurs te trainen, niet alleen om bevelen op te volgen, maar om daadwerkelijk te collaboreren met mensen die gaandeweg ontdekken wat ze precies willen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →