← Nieuwste papers
🤖 AI

Neuro-Symbolic Verification of LLM Outputs for Data-Sensitive Domains (extended preprint)

Dit artikel stelt een hybride neuro-symbool verificatie-architectuur voor die formele logische redenering combineert met neurale semantische analyse om hallucinaties effectief te detecteren en betrouwbaarheid te waarborgen in door LLM's gegenereerde inhoud voor hoog-risico, datagevoelige domeinen, zoals gevalideerd door een reductie van 30% in de tijd voor rapportage en hoge detectiesnelheden in een real-world systeem voor de beoordeling van medische hulpmiddelen.

Oorspronkelijke auteurs: Paul Sigloch, Christoph Benzmüller

Gepubliceerd 2026-05-27
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Paul Sigloch, Christoph Benzmüller

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante, maar af en toe dromerige assistent (een AI) hebt die uitstekend rapporten schrijft, maar soms feiten verzonnen of belangrijke details vergeet. Stel je nu voor dat deze assistent werkt in een baan met hoge risico's, zoals het controleren van medische apparaten op veiligheid of het opstellen van juridische documenten. Als ze een fout maken, kan dat geld kosten, de wet overtreden of iemand pijn doen.

Dit artikel introduceert een nieuw "supervisor-systeem" dat is ontworpen om deze fouten op te vangen voordat het rapport ooit wordt verzonden. De auteurs noemen dit een Neuro-Symbolische Verificatie-systeem. Hieronder wordt uitgelegd hoe dit werkt, opgesplitst in eenvoudige concepten en analogieën:

Het Kernprobleem: De "Dromerige" Assistent

Grote Taalmodellen (LLM's) zijn als getalenteerde schrijvers die over van alles kunnen praten. Ze "hallucineren" echter soms: ze stellen met overtuiging dingen die onwaar of verzonnen zijn. In een normale chat is dit irritant. In de medische of juridische sector is het gevaarlijk. Bovendien kunnen deze bedrijven hun privédata vaak niet naar de cloud sturen (zoals servers van Google of Microsoft) vanwege strenge privacywetgeving. Ze moeten alles op hun eigen computers houden.

De Oplossing: Een Tweehoofdige Supervisor

In plaats van te vertrouwen op de AI om zijn eigen werk te controleren (wat is alsof je een student vraagt zijn eigen toets te beoordelen), hebben de auteurs een systeem gebouwd met twee verschillende "hersenen" die samenwerken:

  1. De "Logische Hersenen" (Symbolisch): Dit deel is als een strenge accountant of een controleur van regels. Het houdt zich bezig met harde feiten: data, serienummers en specifieke eisen. Het gebruikt formele logica (wiskundige regels) om te zeggen: "Ja, dit serienummer bestaat," of "Nee, je bent vergeten de datum op te nemen." Het is 100% zeker en raadt nooit.
  2. De "Intuïtieve Hersenen" (Neuraal): Dit deel is als een doorgewinterde redacteur die leest op betekenis. Het bekijkt de zinnen om te zien of ze in context logisch zijn. Het gebruikt "semantische gelijkenis" (een manier om te meten hoe dicht twee ideeën bij elkaar liggen qua betekenis) om op te merken wanneer de AI iets schrijft dat klinkt alsof het klopt, maar in werkelijkheid een leugen is.

Hoe Ze Samenwerken: De "Fabrieksvloer"

Het systeem is opgebouwd als een hoogst georganiseerde fabriek, gebruikmakend van een methode genaamd het Actor Model. Stel je een fabrieksvloer voor waar verschillende werknemers (actoren) verschillende taken uitvoeren.

  • Als één werknemer (bijvoorbeeld degene die de "betekenis" van een zin controleert) vastloopt of crasht, blijven de andere werknemers (die de "serienummers" controleren) gewoon werken. Ze crashten niet allemaal tegelijk.
  • Deze opzet stelt het systeem in staat om op lokale computers te draaien (waardoor data privé blijft), terwijl het toch complexe, parallelle taken snel kan uitvoeren.

De Realiteitstest: HAIMEDA

De auteurs hebben dit systeem getest in een real-world scenario genaamd HAIMEDA, dat experts helpt bij het schrijven van rapporten over beschadigde medische apparaten.

  • De Opzet: Een getuige-deskundige (een persoon die in de rechtbank de waarheid heeft gezworen) gebruikte het systeem om rapporten te schrijven.
  • Het Proces:
    1. Voor het Schrijven: De "Logische Hersenen" controleren de invoer. Als de expert vergeten is een foto van het kapotte apparaat te uploaden, stopt het systeem de AI met schrijven en zegt: "Wacht, je hebt eerst deze foto nodig."
    2. Na het Schrijven: De AI genereert een conceptversie. De "Intuïtieve Hersenen" lezen deze om te zien of het verhaal overeenkomt met de feiten. De "Logische Hersenen" controleren of de apparaat-ID-nummers correct zijn.
    3. De Feedback: Als de AI een detail heeft verzonnen, markeert het systeem dit en vraagt het de menselijke expert om het te corrigeren.

De Resultaten

Het artikel beweert dat dit systeem zeer goed heeft gewerkt:

  • Opvangen van Leugens: Het ving meer dan 83% van de verzonnen feiten over specifieke items (zoals serienummers) en 72% van de verzonnen verhalen (zoals valse beschrijvingen van schade) op.
  • Snelheid: Het hielp de expert om 30% sneller rapporten te schrijven, omdat de AI het zware werk van het opstellen deed en het systeem de fouten opving voordat de mens ze hoefde te vinden.
  • Privacy: Omdat alles op hun eigen computer draaide, werd er geen gevoelige patiënt- of bedrijfsdata naar internet verzonden.

De Conclusie

Het artikel betoogt dat je AI niet zomaar kunt vertrouwen om perfect te zijn in serieuze banen. In plaats daarvan heb je een hybride systeem nodig: één deel dat de harde wiskunde en regels controleert, en een ander deel dat de betekenis en context controleert. Door deze twee te combineren, krijg je een veiligheidsnet dat veel sterker is dan elk van beide alleen, waardoor AI veilig kan worden ingezet in gebieden waar fouten geen optie zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →