← Nieuwste papers
💬 NLP

Dialogue SWE-Bench: A Benchmark for Dialogue-Driven Coding Agents

Dit artikel introduceert Dialogue SWE-Bench, een nieuwe benchmark en een op persona gebaseerde gebruikerssimulator voor het evalueren van het vermogen van coding agents om software engineering-problemen via dialoog op te lossen, wat onthult dat dialoogvaardigheid een afzonderlijke dimensie van prestaties is die niet noodzakelijkerwijs correleert met de kracht van het coding model.

Oorspronkelijke auteurs: Brendan King, Jeffrey Flanigan

Gepubliceerd 2026-06-15
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Brendan King, Jeffrey Flanigan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een kapotte broodrooster te repareren.

De Oude Manier (Huidige Benchmarks):
Op dit moment, wanneer we AI-codeerassistenten testen, gedragen we ons als een robot die een robot een perfecte, 10 pagina's tellende handleiding geeft. De handleiding zegt: "De broodrooster is kapot omdat het verwarmingselement loszit. Draai het even vast." De AI leest de handleiding, repareert de broodrooster en wij geven het een gouden ster.

Het probleem? Echte mensen praten niet zo. Wij hebben geen perfecte handleidingen. Wij zeggen: "Hé, mijn broodrooster doet raar," en de AI moet vragen: "Maakt hij een geluid? Komt er rook uit? Wat gebeurt er als je de hendel indrukt?"

De Nieuwe Manier (Dialogue-SWEBench):
Dit paper introduceert een nieuwe testomgeving genaamd Dialogue-SWEBench. In plaats van de AI een perfecte handleiding te geven, hebben ze een simulatie opgezet waarbij de AI met een "geest-gebruiker" (ghost user) moet praten om een echt softwareprobleem op te lossen.

Zo hebben ze het gebouwd:

1. De "Geest-Gebruiker" Simulator

De onderzoekers hebben een speciaal AI-programma gemaakt om de rol van de menselijke gebruiker te spelen.

  • De Persona: Deze geest-gebruiker heeft een persoonlijkheid (zoals "angstig en voorzichtig" of "lui en ongeduldig").
  • De Kennis: De geest-gebruiker kent het volledige verhaal van de bug (zoals een geheim script), maar het is strikt verboden om alles in één keer aan de AI te vertellen. De gebruiker moet details pas onthullen als erom gevraagd wordt.
  • De Zelfcorrectie: Als de geest-gebruiker per ongeluk iets onmogelijks zegt (zoals "Ik heb de code net op mijn telefoon gedraaid"), vangt de simulator zichzelf op, zegt "Oeps, dat kan ik niet," en herschrijft het bericht om het realistisch te maken. Dit zorgt ervoor dat de test eerlijk verloopt.

2. De Testronde

In deze nieuwe test kan de AI-codeeragent niet simpelweg een bestand bekijken en het repareren. De agent moet:

  1. Luisteren naar de vage klacht van de gebruiker ("Mijn code crasht!").
  2. Verhelderende vragen stellen ("Welke foutmelding krijg je te zien?").
  3. Het antwoord krijgen.
  4. De code repareren.
  5. De reparatie verifiëren met de gebruker.

Als de AI probeert het antwoord te raden zonder te vragen, of als de AI te veel onzinnige vragen stelt, faalt het.

3. De Grote Verrassing

De onderzoekers hebben de slimste coderende AI's die beschikbaar zijn (zoals GPT-5 en anderen) getest in deze nieuwe "chat"-omgeving. Ze kwamen tot een verrassende ontdekking:

Een geweldige programmeur zijn maakt je niet automatisch een geweldige gesprekspartner.

  • De "Groot Brein" Valstrik: De grootste, krachtigste modellen (de "Grote Breinen") waren in deze nieuwe "chat"-omgeving juist slechter in het gesprek deel. Ze hadden de neiging om te veel onnodige vragen te stellen of raakten in de war van de chatflow.
  • De "Klein maar Slim" Winnaar: Een iets kleiner model (GPT-5-mini) deed het beter in het gesprek en loste meer problemen op voor minder geld.
  • Het Geheime Ingrediënt: De onderzoekers bouwden een nieuw type agent dat een "Schema" gebruikt (denk aan een checklist of een mentaal whiteboard). Terwijl de AI chat, vult het vakjes op zijn checklist in: Wat is de bug? Wat is het verwachte resultaat? Wat ontbreekt er?
    • Deze "Schema-gestuurde" agent was het beste in het oplossen van problemen omdat de agent georganiseerd bleef tijdens het gesprek, in plaats van gewoon te gokken.

4. Het Eindoordeel

Het paper concludeert dat we coderende agents tot nu toe hebben getest alsoals robots die alleen in een lab werken. Maar in de echte wereld zijn ze teamgenoten die met mensen samenwerken.

  • Codeervaardigheid ≠ Chatvaardigheid: Een model kan briljant zijn in het schrijven van code, maar verschrikkelijk in het achterhalen van wat de mens echt nodig heeft.
  • De Oplossing: Om betere coderende assistenten te maken, moeten we ze trainen om betere luisteraars en vraagstellers te worden, niet alleen betere programmeurs.

Kortom: Het paper heeft een "chat-simulator" gebouwd om te testen of coderende AI's daadwerkelijk met mensen kunnen praten om bugs op te lossen. Ze ontdekten dat de grootste, duurste modellen niet altijd de beste gesprekspartners zijn, en dat het geven van een mentale checklist de AI helpt om problemen veel beter op te lossen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →