When JSON Is Not Enough: Semantic Reliability of Schema-Constrained LLM Ordering Agents
Dit artikel introduceert OrderBench, een benchmark die aantoont dat hoewel JSON Schema-beperkingen syntactische geldigheid garanderen voor LLM-ordenaarsagenten, ze er niet in slagen semantische betrouwbaarheid of veiligheid te garanderen, hetgeen aanvullende domeinverificatie en fail-closed uitvoeringsmechanismen noodzakelijk maakt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer getalenteerde, supersnelle robotchef inhuurt om je bestelling op te nemen in een druk restaurant. Je spreekt tot de robot in gewoon Engels, met zinnen als: "Ik wil een burger, zonder augurk, en zorg ervoor dat deze glutenvrij is." Het is de taak van de robot om jouw woorden te vertalen naar een strikt, digitaal bonnetje dat de computer van de keuken kan lezen. Lange tijd was de grote zorg dat de robot het bonnetje in een slordig formaat zou schrijven dat de computer niet kon begrijpen—zoals krabbelen op een servetje in plaats van het invullen van een formulier. Om dit op te lossen, gaven ingenieurs de robot een rigide sjabloon (een "schema") om de robot te dwingen het bonnetje perfect te schrijven, zodat elk vakje werd aangevinkt en elk getal op de juiste plek stond.
Maar hier komt de wending: alleen omdat het bonnetje er perfect uitziet op het formulier, betekent dit nog niet dat de bestelling daadwerkelijk klopt. De robot kan het formulier foutloos invullen, maar toch "augurk toevoegen" opschrijven terwijl jij zei "geen augurk", of hij kan een burger bestellen terwijl de keuken geen vlees meer heeft. Dit artikel onderzoekt precies dat gevaar. Het stelt de vraag: Als de robot de regels van het formulier perfect volgt, kunnen we er dan op vertrouwen dat hij het eten echt goed krijgt? De onderzoekers bouwden een testkeuken om te zien of deze slimme robots echt betrouwbaar zijn of dat ze alleen maar heel goed zijn in het vervalsen van de papierwinkel.
Het Papier: Wanneer het Formulier Perfect is, maar de Bestelling Fout
Dit artikel, getiteld "When JSON Is Not Enough", onderzoekt een kritieke kloof in hoe we AI-agenten gebruiken om realistische taken af te handelen, zoals het bestellen van eten. De auteurs, onder leiding van Yin Li van de Universiteit van Birmingham, creëerden een test genaamd OrderBench. Zie OrderBench als een rigoureus, meedogenloos examen voor AI-robots die proberen restaurantbestellingen op te nemen. Ze vroegen niet alleen: "Heeft de robot een geldig bonnetje geschreven?" Ze vroegen: "Heeft de robot daadwerkelijk begrepen wat je wilde?"
De onderzoekers testten vier verschillende AI-modellen met behulp van 300 specifieke scenario's. Deze scenario's dekten lastige situaties zoals:
- Ontkenning (Negation): "Ik wil een pizza met geen kaas."
- Omvang (Scope): "Ik wil twee burgers, maar alleen de eerste moet extra saus hebben."
- Veiligheid (Safety): "Ik ben allergisch voor pinda's, maar de menukaart zegt dat deze saus ze bevat."
- Beschikbaarheid (Availability): "Ik wil de specialiteit van de dag," terwijl de specialiteit eigenlijk is uitverkocht.
Ze voerden deze tests op twee manieren uit:
- Prompt-only: De robot vertellen: "Schrijf je antwoord in een JSON-formaat" (een standaard dataformaat).
- JSON-schema modus: De robot dwingen een strikt, vooraf gedefinieerd sjabloon te gebruiken dat garandeert dat de output technisch geldig is.
De Grote Verrassing
De resultaten waren een waarschuwing voor ingenieurs. De studie toonde aan dat het perfect maken van de output (schema-geldigheid) niet betekent dat de inhoud correct is (semantische betrouwbaarheid).
Dit is wat de gegevens lieten zien:
- De "Perfecte" Papierwinkel Valstrik: Zelfs het sterkste geteste AI-model, GPT-OSS 120B-fast, behaalde 100% succes in het creëren van technisch perfecte bonnetjes in beide modi. Echter, wanneer het ging om het daadwerkelijk goed krijgen van de bestelling, daalde het succespercentage naar 83,0% in de prompt-only modus en naar 81,3% in de strikte schema modus.
- De Gevaarlijke Illusie: De meest schokkende bevinding kwam van de kleinere, zwakkere modellen. Het Gemma-2-2B model produceerde 100% technisch geldige bonnetjes wanneer het gedwongen werd tot het gebruik van het strikte schema. Toch kreeg het de werkelijke bestelling slechts 2,0% van de tijd goed. Erger nog, het maakte onveilige acceptaties—het accepteren van bestellingen die geweigerd hadden moeten worden (zoals het bestellen van een gerecht met allergenen voor iemand met een allergie)—41,7% van de tijd.
- Het Middenveld: Een ander model, Qwen3-30B-A3B, behaalde ook 100% op de technische geldigheidstest, maar het succes in de echte wereld was slechts rond de 30%, met onveilige acceptaties die rond de 15% schommelden.
Wat Dit Betekent voor de Toekomst
Het artikel betoogt dat het uitsluitend vertrouwen op "gestructureerde output" (het dwingen van de AI om een formulier in te vullen) niet genoeg is. Het is alsoals een robot die een belastingformulier kan invullen zonder een enkele typefout, maar de cijfers die hij opschrijft zijn volledig fout.
De auteurs concluderen dat schema-geldigheid een noodzakelijke eerste stap is, maar geen vervanging voor het controleren van de betekenis. Alleen omdat een AI-agent een perfect geformatteerd JSON-object kan produceren, betekent niet dat het veilig is om die agent je creditcard te laten afrekenen of je eten te laten reserveren. De studie suggereert dat we een "fail-closed" systeem nodig hebben: als de AI er niet 100% zeker van is dat de bestelling correct en veilig is, moet hij niet zomaar het bonnetje verzenden, maar stoppen en om verduidelijking vragen.
Kortom, het artikel waarschuwt ons om niet misleid te worden door de netheid van het formulier. Een robot die de regels van het formulier perfect volgt, kan nog steeds een verschrikkelijke chef zijn. We moeten de inhoud van de bestelling verifiëren, niet alleen het formaat.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.