← Nieuwste papers
🤖 AI

PromptPex: Automatic Test Generation for Language Model Prompts

Dit artikel introduceert PromptPex, een op LLM gebaseerde tool die automatisch specificaties uit prompts extraheert om diverse unit tests te genereren en te evalueren, waarmee regressies en modelspecifieke kwetsbaarheden effectiever en nauwkeuriger worden geïdentificeerd dan bestaande baseline-methoden.

Oorspronkelijke auteurs: Reshabh K Sharma, Jonathan De Halleux, Shraddha Barke, Dan Grossman, Benjamin Zorn

Gepubliceerd 2026-02-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Reshabh K Sharma, Jonathan De Halleux, Shraddha Barke, Dan Grossman, Benjamin Zorn

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer specifieke reeks instructies hebt geschreven voor een robotkok. Je zegt tegen de robot: "Neem deze zin, zoek het woord 'appel', en vertel me of het een zelfstandig naamwoord of een werkwoord is. Maar hier is de addertjes onder het gras: geef alleen het woord 'zelfstandig naamwoord' of 'werkwoord'. Voeg geen extra praatjes toe, geen 'Hier is het antwoord', en geen uitleg."

In de wereld van software wordt deze instructie een prompt genoemd. Net als code worden prompts gebruikt om applicaties te bouwen. Maar in tegenstelling tot traditionele code, die altijd op dezelfde manier draait op een specifieke computer, worden prompts uitgevoerd door "Large Language Models" (LLM's) — denk aan verschillende koks met verschillende persoonlijkheden. Eén kok (Model A) volgt je instructies misschien perfect op. Een andere kok (Model B) kan in de war raken en zeggen: "Het antwoord is: Zelfstandig naamwoord, omdat appels vruchten zijn."

Dit verschil zorgt voor een hoofdpijn voor ontwikkelaars. Als ze van kok veranderen (het model wisselen) of de instructies een klein beetje aanpassen, kan de robot plotseling de verkeerde vorm beginnen uit te spugen, waardoor de hele applicatie kapot gaat.

Ontmoet PromptPex: De "Prompt Inspecteur"

Het paper introduceert een tool genaamd PromptPex. Denk aan PromptPex als een super slimme, geautomatiseerde kwaliteitscontroleur die je helpt je instructies te testen voordat je een nieuwe kok inhuurt.

Zo werkt het, met behulp van een eenvoudige analogie:

1. De extractie van het "Regelboek"

Eerst leest PromptPex je rommelige, natuurlijke instructies en vertaalt deze naar een strikt, opsommend Regelboek.

  • Jouw Prompt: "Geef alleen de tag terug. Als dat niet kan, zeg 'Onbekend'."
  • PromptPex's Regelboek:
    1. De output moet alleen de tag zijn (geen extra woorden).
    2. Als het woord niet getagd kan worden, moet de output het woord "Onbekend" zijn.

Dit doet het door een zeer geavanceerde AI te vragen om naar je prompt te kijken en te zeggen: "Oké, wat zijn de harde regels hier?" Dit helpt de ontwikkelaar om te zien of hun instructies daadwerkelijk duidelijk zijn of dat ze ambigu zijn (zoals de verwarring over "zelfstandig naamwoord vs. uitleg" die eerder werd genoemd).

2. De "Stress Test" Generator

Zodra het Regelboek klaar is, wordt PromptPex een ondeugende testingenieur. Het vraagt de robotkok niet alleen om een normale maaltijd te bereiden; het probeert de kok te misleuken om de regels te breken.

  • De "Normale" Test: Het vraagt om een standaard zin.
  • De "Inverse" Test: Dit is het slimme gedeelte. PromptPex creëert een "omgekeerde regel" in zijn hoofd. Als de regel is "Geef alleen de tag," dan is de omgekeerde regel "Geef de tag plus een lange uitleg." Het genereert vervolgens een testgeval dat ontworpen is om te zien of de kok per ongeluk de verkeerde regel volgt.

Het creëert honderden van deze verraderlijke scenario's, waarbij ervoor wordt gezorgd dat de testinputs nog steeds geldig zijn (zoals een echte zin), maar ontworpen zijn om zwakheden bloot te leggen.

3. De "Rechter"

Ten slotte voert PromptPex deze tests uit op verschillende AI-modellen (de verschillende koks). Vervolgens gebruikt het een andere AI als "Rechter" om naar de resultaten te kijken.

  • Heeft de kok het Regelboek gevolgd?
  • Heeft het extra praatjes toegevoegd?
  • Is het er niet in geslaagd om "Onbekend" te zeggen wanneer dat wel had gemoeten?

Het doel is niet om te zien of de kok "slim" is; het doel is om te zien of de kok de regels heeft opgevolgd. Als de kok de test faalt, markeert PromptPex dit.

Waarom is dit een groot ding?

Het paper testte deze tool op 22 verschillende prompts met behulp van vier verschillende AI-modellen. Ze vergeleken PromptPex met een standaard AI die gewoon probeert goede tests te raden zonder een strikt Regelboek.

De Resultaten:

  • PromptPex was beter in het vinden van fouten. Het genereerde tests die de AI-modellen veel vaker de regels lieten breken dan de standaard tool deed.
  • Het onthult verschillen tussen modellen. Het toonde duidelijk aan dat sommige modellen beter zijn in het volgen van strikte instructies dan andere. Bijvoorbeeld, één model kan erg goed zijn in een taalkundige taak (zoals "woordsoort bepalen"), terwijl een ander model daar constant in faalt.
  • Het helpt ontwikkelaars hun prompts te verbeteren. Door precies te laten zien waar de instructies ambigu waren (bijvoorbeeld: "Het model dacht dat het oké was om een uitleg toe te voegen omdat je niet expliciet verbood dat te doen"), helpt het ontwikkelaars om hun prompts duidelijker te herschrijven.

De Kernboodschap

PromptPex is als een spellingscontrole voor logica. Het controleert niet alleen op typefouten; het controleert of je instructies duidelijk genoeg zijn om te worden gevolgd door verschillende, onvoorspelbare AI-breinen. Het helpt ontwikkelaars om ervoor te zorgen dat wanneer ze overstappen van het ene AI-model naar het andere, hun applicatie niet plotseling onzin begint uit te spugen omdat het nieuwe model een vage instructie anders interpreteert.

De auteurs ontdekten dat door vage instructies om te zetten in een strikt "Regelboek" en vervolgens die regels te onderwerpen aan een stress-test, ze meer bugs konden vangen en hun AI-tools veel beter konden begrijpen dan door simpelweg te gokken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →