Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation
Dit artikel identificeert een stille "exception chain collapse"-fout in frontier LLM's tijdens geneste regel-evaluatie en stelt de Aethis Eligibility Module voor, een neuro-symbolische architectuur die onbetrouwbare modelinferentie vervangt door deterministische SMT-gebaseerde executie om auditeerbare, drift-resistente naleving te waarborgen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: Zelfverzekerd Onjuist: Ineenstorting van de Exceptieketen bij Frontier LLM Regel-evaluatie
1. Probleemstelling
Het artikel identificeert een specifieke, systematische foutmodus in frontier Large Language Models (LLM's) die wordt aangeduid als "exception chain collapse" (ineenstorting van de exceptieketen). Dit treedt op tijdens evaluatietaken voor geschiktheid die bestaan uit geneste voorwaardelijke regels van de vorm: "A is vereist TENZIJ B van toepassing is, TENZIJ C B overrulet."
Hoewel frontier LLM's goed presteren op eenvoudige multi-route logica (bijv. eenvoudige OF-vertakkingen), verslechteren ze aanzienlijk wanneer ze worden gevraagd om multi-level exceptieketens te evalueren (specifiek drie niveaus diep). Het artikel documenteert twee afzonderlijke foutpatronen:
- Exemption Anchoring (Vrijstellings-ankering): Het model behandelt vrijstellingen als secundair aan de primaire route. Als de primaire route faalt, "ankert" het model op die fout en slaagt het er niet in om onafhankelijk geldige alternatieve vrijstellingsroutes te evalueren.
- Exception Chain Collapse (Ineenstorting van de exceptieketen): Het model faalt in het correct nesten van multi-level
UNLESS-logica, waarbij het vaak onafhankelijke vrijstellingspaden (bijv. het behandelen van een "veteraan"-vrijstelling als afhankelijk van een "leeftijd"-vrijstelling) met elkaar verward.
De Kerninstabiliteit: Een cruciale bevinding is dat de nauwkeurigheid van frontier modellen op deze taken een "bewegende nalevingsgrens" is. Tussen maart en april 2026 sloten specifieke foutcellen in benchmarks stilzwijgend af onder dezelfde modelalias (bijv. GPT-5.4 en Claude Opus 4.6) zonder versie-updates. Dit maakt claims over nauwkeurigheid tijdens benchmarks onbetrouwbaar voor gereguleerde workflows waar consistentie verplicht is.
2. Methodologie
De auteurs stellen de Aethis Eligibility Module voor en evalueren deze, een neuro-symbolische architectuur die ontworig is om regel-auteurschap te scheiden van regel-executie.
De Architectie
- Fase 1: Geautomatiseerd Regel-auteurschap (LLM): Een LLM leest gezaghebbende juridische bronnen (wetgeving, beleidsrichtlijnen) en genereert regels als gestructureerde code in een beperkte Domain Specific Language (DSL). Deze fase bevat een herkomstketen (provenance chain) waarbij elke gegenereerde regel is gekoppeld aan specifieke bronverwijzingen (document-ID, sectiepad, direct citaat).
- Fase 2: De Eligibility Module (Deterministische Engine): De gegenereerde DSL wordt gecompileerd naar formele Satisfiability Modulo Theories (SMT) constraints. Een SMT-solver evalueert vervolgens deze constraints tegen gestructureerde aanvragergegevens.
- Kernmechanisme: De engine behandelt elke geschiktheidsroute als een formeel onafhankelijke booleaanse vertakking gecombineerd via disjunctie (OF). Het evalueert deze vertakkingen deterministisch, onafhankelijk van modeldrift, redeneerinspanning of prompt-formaat.
Benchmark Design
De auteurs hebben een benchmark geconstrueerd van 225 scenario's over vier domeinen:
- Life in the UK: Echte Britse immigratiewetgeving (British Nationality Act 1981).
- Engelse Taalvaardigheid: Echte Britse immigratie-instructies.
- Ruimtevaartcertificering: Een synthetische wet die gemodelleerd is naar de Britse wetgevende structuur met drie-niveau exceptieketens.
- Bouwverzekering: Synthetische polisformuleringen gemodelleerd naar Londense markt DE3/DE5 clausules met vijf-niveau exceptieketens.
De benchmark werd geëvalueerd tegen acht LLM's (vier frontier, vier production-tier) van Anthropic en OpenAI, waarbij ze werden vergeleken met de deterministische Eligibility Module.
3. Belangrijkste Bijdragen
1. Taxonomie van Foutpatronen
Het artikel karakteriseert "exception chain collapse" en "exemption anchoring" formeel als systematische fouten in de evaluatie van geneste exceptieketens. Deze fouten blijken:
- Compositioneel: Ze ontstaan door de diepte van de logica (drie niveaus) in plaats van een gebrek aan juridische kennis.
- Robuust tegen Prompting: Verbeterde prompting (bijv. "denk stap voor stap", "evalueer vrijstellingen onafhankelijk") slaagt er niet in het probleem op te lossen; in plaats daarvan ruilt het fout-negatieven in voor fout-positieven, wat de netto nauwkeurigheid verlaagt.
- Instabiel: De specifieke foutpunten verschuiven stilzwijgend bij model-updates, waardoor frontier modellen onbetrouwbaar zijn voor hoog-risico, audit-kritische beslissingen.
2. De Aethis Eligibility Module
Het artikel presenteert een neuro-symbolisch systeem dat de onzekerheid verplaatst van de inferentie-grens (waar het stil en continu is in LLM's) naar de specificatie-grens (waar het doelbewust en geaudit is).
- Garantie: De executielaag biedt wiskundig gedefinieerde semantiek. Als de regelbundel correct is geformaliseerd, is de executie 100% consistent met de specificatie, ongeacht de modelversie of configuratie.
- Auditbaarheid: Elke beslissing bevat een herkomstketen die de uitkomst direct koppelt aan de specifieke wetgevende clausule en het gevolgde logische pad.
3. Empirisch Bewijs
- Benchmark Resultaten: De Eligibility Module behaalde 100% nauwkeurigheid over alle 225 scenario's.
- LLM Prestaties: Frontier modellen vertoonden significante degradatie op de exceptieketen-taken. Bijvoorbeeld, in de maart 2026 snapshot scoorde Claude Opus 4.6 89,7% op de ruimtevaartsectie (61/68), waarbij 7 specifieke scenario's 0/3 keer faalden over onafhankelijke runs.
- Adversariële Extensie: In een v3.8 adversariële extensie (20 nieuwe scenario's voor bouwverzekering), scoorde de deterministische engine 20/20. Terwijl sommige frontier modellen 100% bereikten op de originele suite, faalden ze op de diepere adversariële gevallen (bijv. Claude Opus 4.7 faalde 2/20, GPT-5.4 default faalde 1/20).
- Externe Validatie: Op 949 hold-out gevallen van negen LegalBench-taken was de Eligibility Module aanzienlijk nauwkeuriger dan drie frontier modellen (gecombineerde McNemar's ), met de grootste marges (+41 procentpunten) op multi-prong regel-toepassingstaken.
4. Betekenis en Claims
Het artikel beweert niet dat LLM's over het algemeen onbetrouwbaar zijn of dat ze niet gebruikt kunnen worden voor juridische redenering. In plaats daarvan maakt het een bescheiden, specifieke claim:
- Verplaatsing van Onzekerheid: De primaire bijdrage is architecturaal. Door LLM's te gebruiken voor auteurschap (waar hun vloeiendheid een troef is) en SMT-solvers voor executie (waar determinisme vereist is), maakt het systeem de onzekerheid hanteerbaar. De onzekerheid wordt verplaatst naar de regel-formalisatiefase (Niveau 2), die beheersbaar is via test-gestuurde validatie en SME-review, in plaats van te blijven in de inferentiestap (Niveau 3), waar het stil en onobserveerbaar is.
- Regulatoire Verdedigbaarheid: Voor hoog-risico domeinen (immigratie, verzekeringen, veiligheidscertificering) waar fout-negatieven rechten ontzeggen en uitlegbaarheid verplicht is, biedt de deterministische executielaag een eigenschap die frontier LLM's niet kunnen bieden: invariantie. Een gecompileerde regelbundel levert vandaag hetzelfde resultaat als over zes maanden, ongeacht stille wijzigingen in de onderliggende modelgewichten.
- Beperkingen: De auteurs geven expliciet aan dat het systeem de correcte executie van een specificatie garandeert, niet de correctheid van de specificatie zelf. De kwaliteit van de regelbundel hangt af van het vermogen van de LLM om de brontekst te formaliseren (Niveau 2), wat wordt verzacht maar niet geëlimineerd door test-gestuurde validatie. Het systeem vereist momenteel gestructureerde inputs en handelt geen ongestructureerde documentextractie af.
Samenvattend stelt het artikel dat voor de evaluatie van geneste exceptieketens in gereguleerde workflows, deterministische formele executie een noodzakelijke voorwaarde is voor vertrouwen, en dat neuro-symbolische architecturen een levensvatbare weg bieden om dit te bereiken zonder het nut van LLM's voor regel-extractie op te offeren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.