← Nieuwste papers
💬 NLP

DeonticBench: A Benchmark for Reasoning over Rules

De paper introduceert DeonticBench, een benchmark met 6.232 taken op het gebied van contextgebonden regelredenering in real-world domeinen zoals belastingen en immigratie, die aantoont dat zelfs de meest geavanceerde grote taalmodellen en coderingsmodellen moeite hebben met het betrouwbaar oplossen van deze complexe deontische taken, zelfs met behulp van symbolische methoden zoals Prolog.

Oorspronkelijke auteurs: Guangyao Dou, Luis Brena, Akhil Deo, William Jurayj, Jingyu Zhang, Nils Holzenberger, Benjamin Van Durme

Gepubliceerd 2026-04-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Guangyao Dou, Luis Brena, Akhil Deo, William Jurayj, Jingyu Zhang, Nils Holzenberger, Benjamin Van Durme

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, maar soms wat onvoorspelbare robot hebt die alles kan lezen en begrijpen. Deze robot is een Grote Taalmodel (LLM). Hij kan gedichten schrijven, code schrijven en zelfs juridische teksten samenvatten. Maar er is een groot probleem: als je hem vraagt om een complexe regel toe te passen op een specifieke situatie (bijvoorbeeld: "Mag ik mijn bagage meenemen?" of "Hoeveel belasting moet ik betalen?"), dan maakt hij vaak fouten. Hij "hallucineert" soms, oftewel, hij verzonnt regels die er niet zijn, of hij vergeet een belangrijke detail.

De auteurs van dit paper hebben een nieuwe test ontwikkeld om precies dit probleem te meten. Ze noemen het DEONTICBENCH.

Hier is een uitleg in gewone taal, met een paar creatieve vergelijkingen:

1. Wat is het probleem? (De "Regel-Boer")

Stel je voor dat je een Regel-Boer bent. Je hebt een enorme berg met wetboeken (belastingwet, luchtvaartregels, immigratiewet, huurwet). Je moet voor elke klant een antwoord geven op basis van die regels.

  • De robot: Hij leest de wetboeken snel, maar als je hem vraagt: "Mag meneer X zijn grote koffer meenemen?", zegt hij soms "Ja" terwijl de wet zegt "Nee, want de koffer is te zwaar". Hij is slim, maar niet altijd betrouwbaar als het om strikte regels gaat.
  • De huidige tests: Veel tests vragen de robot alleen om wiskundige sommen te maken (bijv. "2 + 2 = ?"). Dat is makkelijk. Maar in het echte leven (zoals bij de belastingdienst of een immigratiebureau) moet je niet alleen rekenen, maar ook logica toepassen op lange, saaie teksten.

2. Wat is DEONTICBENCH? (De "Grote Proef")

De auteurs hebben een nieuwe test gemaakt met 6.232 moeilijke vragen. Het is alsof ze een enorme "proefschool" hebben gebouwd voor robots, met vier specifieke vakken:

  1. Belastingen: Moet Alice belasting betalen? (Net als een ingewikkelde puzzel met geld).
  2. Luchtvaart: Mag deze passagier een extra koffer meenemen? (Regels over gewicht en tarieven).
  3. Immigratie: Mag deze persoon in de VS blijven? (Regels over asiel en verblijfsvergunningen).
  4. Huurwet: Mag de verhuurder iemand eruit zetten? (Regels over huurcontracten).

De test is speciaal ontworpen om te kijken of de robot de regels echt begrijpt en niet alleen maar raadt.

3. De Twee Manieren om te Leren (De "Twee Sporen")

De onderzoekers hebben de robots op twee manieren getest, alsof je een leerling op twee manieren laat leren:

  • Manier A: De "Prater" (Direct Reasoning)
    De robot moet gewoon in gewone taal uitleggen wat het antwoord is.

    • Vergelijking: Het is alsof je de robot vraagt: "Leg uit waarom je dit antwoord hebt." Hij probeert het in zijn hoofd te bedenken en praat het uit.
    • Resultaat: Vaak verzonnen ze dingen of maakten ze logische fouten.
  • Manier B: De "Programmeur" (Symbolic/Prolog)
    Dit is de innovatieve kant. De robot moet de regels en de situatie vertalen naar een computercode (genaamd Prolog). Daarna draait een computerprogramma die code om het antwoord te berekenen.

    • Vergelijking: In plaats van de robot te laten praten, geef je hem een rekenmachine en een bouwplaat. Hij moet de wetten omzetten in een bouwplaatje (code). Als de bouwplaat goed is, geeft de rekenmachine het exacte juiste antwoord.
    • Waarom is dit slim? Als de robot een fout maakt in de code, kun je precies zien waar hij het fout heeft gedaan. Het is transparanter.

4. Wat zijn de resultaten? (De "Hardheid van de Test")

De resultaten zijn verrassend en een beetje teleurstellend voor de toekomst:

  • De robots zijn nog niet klaar: Zelfs de aller slimste robots (zoals GPT-5 en andere geavanceerde modellen) haalden op de moeilijkste vragen maar ongeveer 45% tot 50% goed. Dat is net iets beter dan gokken, maar niet goed genoeg voor een echte belastingdienst of immigratiebureau.
  • Meer denken helpt niet altijd: Soms probeer je de robot te dwingen om "dieper na te denken" (meer tijd geven), maar dat maakt het antwoord niet altijd beter. Soms maakt hij juist meer fouten.
  • Oefening baart kunst (maar niet genoeg): De onderzoekers hebben de robots extra getraind met voorbeelden (leren van fouten). Hierdoor werden ze beter in het maken van de code, maar ze konden de moeilijke vragen nog steeds niet altijd oplossen.

5. Waarom is dit belangrijk? (De "Grote Waarschuwing")

Stel je voor dat een robot in 2026 beslist of iemand een visum krijgt of hoeveel belasting je moet betalen. Als die robot een fout maakt, kan dat leiden tot:

  • Mensen die ten onrechte uit het land worden gezet.
  • Mensen die te veel of te weinig belasting betalen.
  • Groot financieel verlies.

Dit paper zegt eigenlijk: "Wees voorzichtig." We denken dat AI al heel slim is, maar als het gaat om het strikt toepassen van regels in het echte leven, is hij nog niet betrouwbaar genoeg. Hij is als een briljante student die soms de examenregels verkeerd begrijpt.

Samenvatting in één zin:

De onderzoekers hebben een nieuwe, moeilijke test gemaakt om te laten zien dat zelfs de slimste AI's nog steeds moeite hebben om strikte wetten en regels correct toe te passen op echte situaties, en dat we nog veel moeten leren voordat we ze veilig kunnen gebruiken in belangrijke banen zoals de belastingdienst of de immigratie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →