← Nieuwste papers
💬 NLP

PQR: A Framework to Generate Diverse and Realistic User Queries that Elicit QA Agent Failures

Het artikel introduceert PQR, een iteratief raamwerk dat query- en promptverfijning combineert om automatisch diverse, realistische gebruikersqueries te genereren die effectief falen in op LLM gebaseerde QA-agenten aan het licht brengen en blootleggen, en dat prioritaire methoden aanzienlijk overtreft bij het detecteren van onbehulpzame antwoorden.

Oorspronkelijke auteurs: Yunan Lu, Luigi Liu, Omar Yahia, Arpit Sharma, Zhou Yu

Gepubliceerd 2026-05-19
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yunan Lu, Luigi Liu, Omar Yahia, Arpit Sharma, Zhou Yu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de kwaliteitscontrolemanager bent voor een nieuwe, superslimme winkelassistent-robot. Je taak is om uit te vinden waar deze robot fouten maakt. Maar er is een addertje onder het gras: de robot is erg goed in het beantwoorden van simpele vragen, zoals "Welke kleur heeft dit overhemd?". Om zijn zwakke punten te vinden, moet je hem lastige, verwarrende of rare vragen stellen.

Het probleem is dat als je de robot rare vragen stelt die geen mens ooit zou stellen (zoals "Wat is de kleur van het getal 5?"), de robot gewoon zal zeggen: "Ik begrijp het niet." Dat vertelt je niet veel over hoe hij omgaat met échte klanten. Je moet vragen vinden die er precies uitzien als iets dat een echt persoon zou typen, maar die de robot toch in de val lokken om een slecht antwoord te geven.

Dit artikel introduceert een nieuw hulpmiddel genaamd PQR (Prompt-Query-Refinement) om dit probleem op te lossen. Denk aan PQR als een twee-persoons "Red Team" dat samenwerkt om de robot te breken, maar op een zeer specifieke manier.

De twee partners

1. De "Woorden Tovenaar" (Query Refinement)
Stel je een tovenaar voor die een normale zin pakt en ermee begint te spelen. Hij zou kunnen:

  • Typfouten: "appel" veranderen in "aple".
  • Toon: Een beleefde vraag veranderen in een chagrijnige.
  • Rollenspel: Doen alsof hij een vermoeide ouder is die haast heeft.

Deze tovenaar creëert vele variaties van een vraag om te zien of kleine veranderingen de robot doen falen. Als de tovenaar echter te wild gaat, beginnen de vragen als onzin of code te klinken, wat niet helpt bij het testen van prestaties in de echte wereld.

2. De "Regisseur" (Prompt Refinement)
Stel je een filmregisseur voor die de pogingen van de Tovenaar bekijkt. De Regisseur kijkt niet alleen toe; hij maakt aantekeningen.

  • "Hé, die chagrijnige toon werkte goed om de robot in de war te brengen!"
  • "Maar die vraag over 'kwantumfysica' was te nep. Laten we de volgende vraag meer laten klinken als een echte winkelier."

De Regisseur gebruikt deze aantekeningen om een nieuwe set instructies (een "prompt") voor de Tovenaar te schrijven. Hij zegt tegen de Tovenaar: "Probeer de volgende keer twee vragen tegelijk te stellen, maar laat het klinken als een echt persoon die haast heeft."

Hoe ze samenwerken (De lus)

PQR plaatst deze twee partners in een lus:

  1. De Regisseur geeft de Tovenaar een set instructies.
  2. De Tovenaar creëert een reeks vragen op basis van die instructies.
  3. Ze testen deze vragen op de winkelrobot.
  4. Als de robot faalt, vieren ze! Als de robot slaagt, analyseren ze waarom hij slaagde.
  5. De Regisseur past de instructies aan op basis van wat ze hebben geleerd, waardoor de volgende ronde van vragen nog realistischer en lastiger wordt.

Waarom dit beter is dan voorheen

Voor PQR probeerden onderzoekers twee hoofdmanieren om robotfouten te vinden:

  • De "Hacker"-aanpak: Ze probeerden de robot te dwingen te falen door agressieve, onnatuurlijke aanvallen. Dit vond fouten, maar de vragen klonken als een computerprogramma, niet als een mens.
  • De "Optimizer"-aanpak: Ze probeerden de vragen perfect te laten klinken, maar bleven steeds hetzelfde type vraag stellen, waardoor ze andere manieren waarop de robot kon falen, misten.

PQR is als een hybride. Het combineert het vermogen van de "Hacker" om zwakke punten te vinden met het vermogen van de "Optimizer" om menselijk te klinken.

De resultaten

De auteurs testten PQR op een e-commerce winkelbot. Ze ontdekten dat PQR veel beter was in het vinden van "onbehulpzame" antwoorden dan eerdere methoden.

  • Meer fouten gevonden: Het vond tussen de 23% en 78% meer slechte antwoorden dan de andere methoden.
  • Realistischer: De vragen die het genereerde, klonken veel meer als dingen die echte shoppers daadwerkelijk zouden typen.
  • Meer divers: Het vond niet slechts één type fout; het vond vele verschillende soorten verwarring.

De bottom line

PQR is een slim, geautomatiseerd systeem dat leert hoe het de perfecte lastige vragen moet stellen. Het probeert niet alleen de robot te breken; het probeert de robot te breken op een manier die voelt als een echte menselijke interactie. Dit helpt ontwikkelaars hun AI-agenten te repareren zodat ze betrouwbaarder zijn wanneer echte mensen ze gebruiken.

Opmerking: Het artikel testte dit specifiek op een winkelassistent om "onbehulpzame" reacties te vinden. Het keek ook kort naar "veiligheid" (het voorkomen van slechte inhoud), maar de hoofdfocus lag op het maken van de AI behulpzaam en realistisch.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →