From Statute to Control Flow: Span-Grounded Deontic Trees for Defeasible Scope Parsing
Dit artikel introduceert NormBench, een meertalige benchmark met Span-Grounded Deontic Trees (SG-DT) om Silent Scope Omission in regelvolgende agenten te diagnosticeren en te mitigeren door de focus te verleggen van eindtaakresultaten naar de precieze structurele parsing van weerlegbare juridische scopes, wat onthult dat beperkte intermediaire representaties de afhandeling van uitzonderingen in complexe regelgevende contexten aanzienlijk verbeteren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Probleem: De "Stille Overslag"
Stel je voor dat je een zeer slimme, vloeiende robotassistent inhuurt om de regels van een spel te handhaven. Je geeft hem het regelboek.
- Regel 1: "Als je de bal aanraakt, krijg je een straf."
- Regel 2: "Tenzij je de keeper bent, dan mag je hem aanraken."
- Regel 3: "Maar als de keeper een rode hoed draagt, krijgt hij alsnog een straf."
Een mens leest dit en begrijpt de lagen. Maar het artikel stelt dat huidige AI-modellen vaak lijden aan Silent Scope Omission (SSO).
De AI ziet Regel 1, past deze toe en zegt vol vertrouwen: "Straf!" De AI stilleert de overslag van Regel 2 en Regel 3 volledig. De AI's antwoord klinkt redelijk en grammaticaal perfect, maar het mist de cruciale "tenzij"- en "behalve"-clausules die de uitkomst daadwerkelijk veranderen. Het is als een chef-kok die een recept perfect volgt, maar stilzwijgend vergeet de instructie "verwijder het zout als de klant een dieet volgt," wat resulteert in een gerecht dat er goed uitziet, maar verkeerd smaakt.
De Oplossing: NormBench en de "Boomkaart"
Om dit op te lossen, hebben de auteurs een nieuwe testomgeving gebouwd genaamd NormBench. Zie dit als een gespecialiseerde sportschool voor AI, gevuld met 2.290 verschillende juridische regels (afkomstig uit Chinese wetten, Amerikaanse belastingwetten en bedrijfsrichtlijnen) die specifiek zijn ontworpen om AI te misleiden met deze "stille overslagen."
In plaats van de AI alleen te vragen: "Wat is de straf?", dwingen ze de AI om een Span-Grounded Deontic Tree (SG-DT) te tekenen.
De Analogie: De Constructieblauwdruk
Stel je voor dat de wet een rommelige stapel hout is.
- De Oude Manier: De AI probeert een huis te bouwen door te gokken welk stuk hout waar hoort. Het kan een huis bouwen dat er van buiten goed uitziet, maar waarbij het dak op de verkeerde verdieping staat.
- De Nieuwe Manier (SG-DT): De AI moet eerst een blauwdruk tekenen.
- Elke tak van de blauwdruk moet verbonden zijn aan een specifiek stuk tekst (een "span") uit het originele regelboek.
- De blauwdruk moet expliciet de "uitsluitingsbewakers" (exclusion guards) tonen. Bijvoorbeeld: de AI moet een lijn tekenen die zegt: "Deze tak bestaat alleen ALS de conditie 'rode hoed' ONWAAR is."
- Dit verandert de rommelige tekst in een rigide, logisch stroomdiagram dat gecontroleerd kan worden. Als een tak ontbreekt, is de blauwdruk ongeldig.
Wat Ze Vonden: De "Hersenflaters" van de AI
De auteurs testten topmodellen (zoals GPT-5, Claude en DeepSeek) op deze nieuwe test en vonden drie grote problemen:
1. De "Recursie-verval" (De Logische Toren)
- De Analogie: Stel je voor dat je blokken opstapelt.
- Laag 1: "Doe X." (Makkelijk)
- Laag 2: "Doe X, tenzij Y." (Oké)
- Laag 3: "Doe X, tenzij Y, tenzij Z." (De AI stort in).
- De Bevinding: Naarmate de regels dieper worden (geneste uitzonderingen binnen uitzonderingen), stort de prestatie van de AI in. Het is niet dat de AI zijn geheugen tekortkomt; het is dat zijn "logische spieren" zwakker worden wanneer de logica te diep wordt. De AI kan de regels wel vinden, maar kan ze niet correct op elkaar stapelen.
2. De "Auditability Trap" (De Zelfverzekerde Leugenaar)
- De Analogie: Een student die de tekstboeken perfect uit het hoofd kent, maar de wiskunde erachter niet begrijpt.
- De Bevinding: De AI is erg goed in het vinden van de juiste zinnen in de tekst (hoge "getrouwheid" of faithfulness). Het zal de regel over de "rode hoede" perfect citeren. Maar wanneer de AI wordt gevraagd om die quote te verbinden aan het juiste deel van de logische boom, faalt het. Het lijkt erop dat de AI de wet begrijpt, maar het is eigenlijk gewoon aan het "citeren" zonder echt te "redeneren".
3. De "Domein Paradox" (Generalisten versus Specialisten)
- De Analogie: Een huisarts versus een specialist die alleen medische tijdschriften leest maar nog nooit een patiënt heeft behandeld.
- De Bevinding: Verrassend genoeg deden algemene AI-modellen (getraind op alles) het veel beter bij het begrijpen van deze juridische structuren dan specifieke "Juridische AI"-modellen (getraind op alleen recht). De juridische modellen waren te gefocust op het klinken als een advocaat (de juiste toon gebruiken) en faalden op de strikte logica die nodig is om de regels in kaart te brengen.
De Cross-Language Glitch
De auteurs testten ook of een AI dezelfde regel begrijpt in het Chinees en het Engels.
- De Bevinding: De AI kon een goede boom bouwen voor de Chinese versie en een goede boom voor de Engelse versie. Maar de twee bomen kwamen vaak niet overeen!
- De Analogie: Het is als het vertalen van een recept. De Chinese versie zegt: "Voeg zout toe, tenzij de soep al zout is." De Engelse versie zegt: "Voeg zout toe, maar als de soep zout is, doe het dan niet." De AI kan de logica voor elke taal afzonderlijk correct opbouwen, maar de "tenzij"-logica wordt tussen de twee talen door omgedraaid, wat leidt tot verschillende resultaten voor dezelfde regel.
Helpt Dit Eigenlijk?
De auteurs testten of het dwingen van de AI om eerst deze "blauwdruk" (SG-DT) te tekenen voordat het een vraag beantwoordt, de uiteindelijke antwoorden daadwerkelijk verbeterde.
- Het Resultaat: Het hangt ervan af.
- Ja: Wanneer de casus ingewikkeld is en afhangt van een specifieke uitzondering (de "actieve" uitzondering), helpt de blauwdruk de AI om de "Stille Overslag" te vermijden.
- Nee: Wanneer de casus simpel is, of als de AI al erg goed is, zorgt het dwingen om de blauwdruk te tekenen er soms voor dat de AI in de war raakt of vertraagt, wat leidt tot slechtere antwoorden.
Samenvatting
Het artikel betoogt dat om AI betrouwbaar te maken voor wetten en regels, we niet alleen kunnen vertrouwen op een gesprek. We moeten de AI dwingen om een rigide, controleerbare kaart van de regels te bouwen, waarbij elke uitzondering expliciet aan de tekst is gekoppeld. Dit helpt om de "Stille Overslagen" te vangen waarbij de AI belangrijke uitzonderingen negeert, maar het is geen wondermiddel dat alles direct oplost.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.