← Nieuwste papers
💻 computer science

ReqElicitGym: An Evaluation Environment for Interview Competence in Conversational Requirements Elicitation

Dit artikel introduceert ReqElicitGym, een automatisch en interactief evaluatieomgeving voor het meten van de interviewvaardigheden van LLM's bij het eliciteren van requirements, en toont aan dat huidige modellen moeite hebben met het ontdekken van impliciete vereisten, met name op het gebied van stijl.

Oorspronkelijke auteurs: Dongming Jin, Zhi Jin, Zheng Fang, Linyu Li, XiaoTian Yang, Yuanpeng He, Xiaohong Chen

Gepubliceerd 2026-02-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Dongming Jin, Zhi Jin, Zheng Fang, Linyu Li, XiaoTian Yang, Yuanpeng He, Xiaohong Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

ReqElicitGym: De "Vraagbaak" voor AI's die Software Ontwerpen

Stel je voor dat je een zeer slimme, digitale kok hebt (een AI) die voor jou een gerecht moet koken. In het verleden was de grootste uitdaging voor deze kok om de ingrediënten correct te snijden en te bakken (de code schrijven). Maar nu kan die kok al bijna perfect koken. Het echte probleem is nu: Wat wil de klant eigenlijk eten?

Vaak zeggen klanten: "Ik wil een salade." Maar de kok weet niet: Welke groenten? Zout of peper? Warm of koud? Met of zonder dressing? Als de kok hier niet goed naar vraagt, krijg je een onsmakelijk gerecht, zelfs als de snijtechniek perfect is.

Dit papier introduceert ReqElicitGym, een soort "trainingszaal" of "simulator" om te testen hoe goed een AI is in het stellen van de juiste vragen om precies te weten wat de klant wil.

Hier is hoe het werkt, vertaald in alledaagse termen:

1. Het Probleem: De "Stomme" AI

Vroeger testten we AI's door ze te laten koken en te kijken of het eten lekker was. Maar nu willen we testen of de AI eerst goed kan vragen.
Helaas is dit lastig te testen omdat:

  • Je niet elke keer echte mensen kunt vragen om te spelen (te duur en te veel variatie).
  • Mensen soms subjectief oordelen ("Nou, het gesprek leek wel aardig").
  • Er geen standaard "proefles" is om alle AI's op dezelfde manier te testen.

2. De Oplossing: De Simulator (ReqElicitGym)

De auteurs hebben een digitale speeltuin gebouwd met drie belangrijke onderdelen:

  • De "Geheime Kaart" (De Dataset):
    Stel je voor dat je 101 verschillende scenario's hebt, zoals "Ik wil een website voor een sportwinkel" of "Ik wil een app voor een tandarts". Voor elk scenario hebben de makers een "geheime kaart" gemaakt. Op die kaart staat precies wat de klant eigenlijk wil, maar wat ze niet direct zeggen (bijvoorbeeld: "Ik wil dat de knoppen blauw zijn" of "Ik wil dat de zoekfunctie ook op foto's zoekt"). Dit is de geheime kennis die de AI moet ontdekken.

  • De "Robot-Klant" (De Oracle User):
    In plaats van een echte mens, speelt een andere AI de klant. Deze robot is slim, maar volgt strikte regels:

    • Hij zegt alleen wat er op de "geheime kaart" staat.
    • Hij geeft niet zomaar extra informatie weg. Als de interviewer (de AI die we testen) niet vraagt naar de kleur van de knoppen, zal de robot er ook niets over zeggen.
    • Dit zorgt voor een eerlijke test: de AI moet echt actief vragen stellen.
  • De "Oefenmeester" (De Task Evaluator):
    Dit is een derde AI die als een strenge leraar meekijkt. Hij luistert naar het gesprek en noteert:

    • "Goed gedaan, je vroeg naar de zoekfunctie!"
    • "Jammer, je vroeg niet naar de kleur, terwijl dat op de kaart stond."
    • "Je stopte te snel."
      Hij geeft een cijfer op basis van hoeveel "geheime wensen" de AI heeft gevonden.

3. Wat hebben ze ontdekt? (De Resultaten)

De auteurs hebben 7 populaire AI's (zoals GPT, Claude, Gemini) in deze simulator laten spelen. De resultaten waren verrassend en soms wat teleurstellend:

  • Ze zijn niet zo goed in "lezen tussen de regels":
    Zelfs de slimste AI's vonden maar ongeveer 32% van de geheime wensen. Ze waren goed in het vragen naar de basis (bijv. "Wat voor soort producten?"), maar misten vaak de subtiele details.

    • Analogie: Het is alsof ze weten dat je een auto wilt, maar ze vergeten te vragen of je een automaat of handgeschakelde versnellingsbak wilt.
  • Ze houden van "graven" in plaats van "verduidelijken":
    De AI's stelden vooral open vragen om nieuwe dingen te ontdekken (zoals "Wat wil je nog meer?"), maar waren slecht in het verduidelijken van onduidelijkheden (zoals "Bedoel je met 'snel' dat het binnen 2 seconden laadt?").

    • Analogie: Ze graven een gat in de tuin, maar ze vullen het niet goed op met de juiste stenen.
  • Ze vergeten de "sfeer" (Stijl):
    AI's waren goed in het vragen naar functies (hoe het werkt) en inhoud (wat erop staat), maar ze waren vreselijk in het vragen naar de stijl (kleuren, lettertypes, gevoel).

    • Analogie: Ze bouwen een perfect huis, maar vergeten te vragen of de muren wit of roze moeten zijn.
  • Meer nadenken helpt niet altijd:
    Ze lieten de AI's ook "nadenken" voordat ze antwoordden (een techniek genaamd CoT). Hierdoor stelden ze snellere en betere vragen, maar ze vonden nog steeds niet meer geheime wensen. Ze werden efficiënter, maar niet completer.

Conclusie

Dit papier zegt eigenlijk: "AI's kunnen nu al heel goed code schrijven, maar ze zijn nog niet goed genoeg in het luisteren en vragen stellen om te weten wat we echt nodig hebben."

Met ReqElicitGym hebben de onderzoekers nu een eerlijke manier om AI's te trainen en te testen op dit specifieke talent. Het is als een rijbewijstest voor AI's: niet alleen of ze kunnen rijden (code schrijven), maar of ze eerst goed kunnen vragen waar de passagier naartoe wil.

De boodschap is duidelijk: voordat we AI's volledig laten bouwen aan onze software, moeten we ze eerst leren hoe ze een goed gesprek kunnen voeren om de echte wensen van de mens te achterhalen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →