← Nieuwste papers
🤖 machine learning

Evidence-Grounded Verified Agentic Reasoning: A Path Toward Eliminating LLM Hallucination in Empirical Inference via Tool-Attested Kernel Proofs

Het artikel introduceert EG-VAR, een op Lean 4 gebaseerde agentische redeneerarchitectuur die hallucinaties van LLM's in empirische inferentie elimineert door te waarborgen dat alle geverifieerde outputs structureel zijn afgeleid van geattesteerde tool calls en door de kernel gecontroleerde bewijzen, terwijl het expliciet auditeert of zich onthoudt van elke niet-onderbouwde claim.

Oorspronkelijke auteurs: Junyu Ren

Gepubliceerd 2026-07-15
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Junyu Ren

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een super-slimme, praatgrage robotassistent hebt (een LLM) die ervan houdt om verhalen over de wereld te vertellen. Het probleem? Soms wordt de robot zo zelfverzekerd over zijn eigen herinneringen dat hij feiten verzint of de werkelijke bewijzen die recht voor zijn neus liggen, negeert. Het is als een student die, wanneer hij gevraagd wordt een wiskundeprobleem te controleren aan de hand van het tekstboek, gewoon het antwoord opschrijft waarvan hij denkt dat het juist is omdat hij het uit een droom herinnert, zelfs als het tekstboek iets anders zegt.

Lange tijd probeerden mensen dit te fixen door de robot een "gereedschapskist" te geven met externe bronnen, zoals een rekenmachine of een database. Maar het artikel betoogt dat het geven van een gereedschapskist aan de robot niet genoeg is. De robot kan de gereedschapskist nog steeds negeren, of hij kan de getallen uit de gereedschapskist gebruiken maar vervolgens de logica verdraaien om het in zijn eigen verhaal te laten passen. Het is alsoos dat je een chef-kok een vers, geverifieerd ingrediënt geeft, maar hem wel laat koken hoe hij maar wil; het eindresultaat kan nog steeds een ramp zijn.

Het Grote Idee: De "Verified Claim" Fabriek

De auteurs, onder leiding van Junyu Ren, hebben een nieuw systeem gebouwd genaamd EG-VAR (Evidence-Grounded Verified Agentic Reasoning). Denk hierbij niet aan een robot die simpelweg vragen beantwoordt, maar aan een hoogbeveiligde fabriek met een zeer strikte, onvermoeibare inspecteur.

Zo werkt de fabriek, stap voor stap:

  1. De Tool Layer (De Vertrouwde Koerier): Eerst gaat een vertrouwde, saaie, deterministische machine (geen praatgrage robot) naar de bron — zoals een spreadsheet of een database — en haalt de ruwe getallen op. Deze machine stempelt deze getallen met een "Verified" zegel. Dit is de enige manier om echte data in de fabriek te krijgen.
  2. De Formalizer (De Vertaler): De praatgrage robot (een LLM) krijgt vervolgens de opdracht om de menselijke vraag te vertalen naar een strikte, wiskundige taal genaamd Lean 4. Het is alsof je de robot vraat om een juridisch contract of een wiskundig bewijs te schrijven in plaats van een paragraaf.
  3. De Kernel (De Onvermoeibare Inspecteur): Dit is het belangrijkste onderdeel. Een klein, superstrikt computerprogramma (een Lean kernel) fungeert als de inspecteur. Het controleert het "contract" van de robot regel voor regel.
    • De Gouden Regel: De inspecteur heeft een regel die luidt: "Je mag niet beweren dat een feit VERIFIED is, tenzij je kunt wijzen naar een met een zegel voorzien nummer van de Vertrouwde Koerier."
    • Als de robot een getal verzint, of als hij probeert een getal te gebruiken maar de logica verkeerd verbindt, wijst de inspecteur het hele geheel af.
  4. Het Resultaat:
    • Als het bewijs slaagt, print de fabriek een VERIFIED antwoord. Dit antwoord komt met een "reproduceerbare audit trail", wat betekent dat iedereen de berekening later opnieuw kan uitvoiten en precies kan zien hoe het antwoord is opgebouwd uit de originele data.
    • Als het bewijs faalt, gokt de fabriek niet. Hij zegt ABSTAIN (wat betekent "Ik weet het niet" of "Ik kan dit niet bewijzen"). Het is een eerlijk "Ik geef het op" in plaats van een zelfverzekerde leugen.

Wat het Papier Eigenlijk Vond

De auteurs hebben dit systeem getest op een specifieke set van 120 vragen over tabellen (spreadsheets).

  • De "Perfecte" Score: Wanneer de vragen duidelijk waren en de robot de juiste tools kreeg, behaalde EG-VAR 120 van de 120 vragen correct. Het was 100% accuraat.
  • De Competitie: Andere systemen die dezelfde tools gebruikten maar niet de strikte inspecteur hadden, haalden 114 van de 120 goed (95%). Zij maakten nog steeds fouten.
  • De "Counterfactual" Test: Dit was de echte stresstest. De auteurs namen tabellen en veranderden de getallen stiekem om de informatie te tegenspreken met wat de robot "wist" uit zijn training (zoals het veranderen van de populatie van een land naar een heel klein aantal).
    • Zonder de strikte inspecteur negeerde de robot de nieuwe getallen en hield hij zich 80% tot 90% van de tijd aan zijn oude herinneringen.
    • Met EG-VAR bleef het systeem 100% trouw aan de nieuwe, veranderde getallen. Het maakte er niet uit hoe sterk de oude herinnering van de robot ook was; de inspecteur dwong hem de nieuwe data te gebruiken.

Wat het Papier Uitsluit (De "No-Go" Zones)

Het artikel is heel duidelijk over wat dit systeem niet is en wat het niet kan doen:

  • Het is geen magische oplossing voor alle hallucinaties. Het artikel stelt expliciet dat de robot nog steeds fouten kan maken bij het vertalen van de menselijke vraag naar de wiskundige taal. Als de robot de vraag verkeerd begrijpt en de verkeerde wiskundige formule schrijft, zal de inspecteur die wiskundige formule perfect controleren, maar het antwoord zal nog steeds fout zijn voor de oorspronkelijke vraag.
    • In hun tests kwam deze "vertalingsfout" ongeveer 3,3% van de tijd voor bij één model en 1,7% bij een sterker model.
  • Het repareert geen slechte data. Als de originele spreadsheet een leugen bevat, zal het systeem die leugen getrouw verifiëren. Het systeem garandeert dat het antwoord uit de bron komt, niet dat de bron waar is.
  • Het is geen "misschien" systeem. Het artikel spreekt zich uit tegen systemen die een "betrouwbaarheidsscore" geven (zoals "Ik ben voor 80% zeker"). In plaats daarvan gebruikt EG-VAR een strikte "Ja/Nee"-poort. Je hebt óf een geverifieerd bewijs, óf je hebt een eerlijk "Ik onthoud mij van een oordeel" (abstain).

Hoe Zeker Zijn Ze?

De auteurs zijn zeer zelfverzekerd over de structurele veiligheid van hun systeem. Ze hebben wiskundig bewezen (Theorema 3.1 en 3.2) dat:

  1. Er nooit een VERIFIED antwoord kan verschijnen zonder dat dit wordt ondersteund door een gestempelde tool call.
  2. Elke stap in de logica van een VERIFIED antwoord is gecontroleerd door de kernel en is wiskundig geldig.

Echter, wat betreft de nauwkeurigheid van de vertaling van de robot van menselijke taal, zijn ze voorzichtiger. Ze hebben de foutmarges gemeten (3,3% en 1,7%) in hun specifieke tests en suggereren dat deze cijfers kunnen verbeteren als ze de robot meer trainen op het correct vertalen van vragen. Maar de "veiligheidsvloer"—de garantie dat het systeem niet stilletjes zal liegen—is ingebouwd in de architectuur, niet alleen in het brein van de robot.

De Kern van het Verhaal

EG-VAR is als een fabriek die weigert een product te verzenden, tenzij het een bonnetje kan tonen voor elk gebruikt onderdeel. Als de robot probeert een vals onderdeel binnensluipen, stopt de fabriek de lijn en zegt: "Nee, dit verzenden we niet." Het verandert het probleem van "liegende robots" in een probleem van "ontbrekende bonnetjes", wat veel makkelijker te vangen en te corrigeren is. Hoewel het niet elk probleem oplost (de robot kan nog steeds de bestelling verkeerd begrijpen), zorgt het er wel voor dat wanneer de fabriek "Verified" zegt, het ook echt "Verified" betekent.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →