← Nieuwste papers
💬 NLP

Hallucination as an Anomaly: Dynamic Intervention via Probabilistic Circuits

Het artikel introduceert PCNET, een probabilistische schakeling-gebaseerde methode die hallucinaties detecteert als geometrische anomalieën in de residustroom van een LLM om dynamische, gerichte interventie mogelijk te maken via PC-LDCD, waardoor hallucinaties aanzienlijk worden verminderd terwijl de integriteit van correcte generaties wordt behouden zonder dat modelgewichtsmodificaties of externe verifiers nodig zijn.

Oorspronkelijke auteurs: Erik Nielsen, Elia Cunegatti, Marcus Vukojevic, Giovanni Iacca

Gepubliceerd 2026-05-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Erik Nielsen, Elia Cunegatti, Marcus Vukojevic, Giovanni Iacca

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een Large Language Model (LLM) voor als een zeer getalenteerde, snelpratende verhalenverteller. Deze verhalenverteller heeft bijna alles wat ooit is geschreven gelezen, maar soms, in hun enthousiasme om een verhaal te voltooien, verzinnen ze feiten die perfect klinken maar volledig onjuist zijn. Dit wordt "hallucinatie" genoemd.

Het paper dat je hebt aangeleverd introduceert een nieuw systeem genaamd PCNET en PC-LDCD om dit probleem op te lossen. Hieronder wordt uitgelegd hoe het werkt, met behulp van eenvoudige analogieën.

Het Probleem: De "Blinde Correctie"-Fout

Stel je voor dat je een film bewerkt. Je merkt op dat de acteur soms de verkeerde tekst zegt.

  • Oude Methoden: De oude manier om dit op te lossen was het inhuren van een editor die, zodra ze een mogelijke fout hoorden, onmiddellijk het script pakte en de tekst van de acteur herschreef. Het probleem? De editor was niet erg goed in het onderscheid maken tussen een echte fout en een creatieve, correcte tekst. Dus herschreven ze ook de correcte teksten van de acteur, waardoor de film verpest werd. Het paper noemt dit de "Detectie-Correctie Asymmetrie": de tools die goed zijn in het opsporen van fouten zijn te onhandig om ze te herstellen zonder de goede dingen te breken.

De Oplossing: Een Tweestaps Veiligheidssysteem

De auteurs stellen een slimmere, tweestapsbenadering voor die werkt als een bewakingsagent en een gespecialiseerde editor die samenwerken.

Stap 1: De Bewakingsagent (PCNET)

Eerst hebben ze een speciale detector gebouwd genaamd PCNET.

  • De Analogie: Stel je voor dat het brein van de verhalenverteller een gigantische, drukke dansvloer is. Wanneer ze de waarheid vertellen, dansen ze in een specifiek, goed betreden gebied (het "feitelijke manifold"). Wanneer ze beginnen te liegen of te hallucineren, drijven ze weg naar een vreemd, leeg hoekje van de kamer waar niemand danst.
  • Hoe het werkt: PCNET is als een bewakingsagent met een perfecte kaart van de dansvloer. Het hoeft niet te raden of hulp te vragen aan anderen. Het kijkt naar de huidige "dansbeweging" van de verhalenverteller (de verborgen toestand in het geheugen van de computer) en berekent direct: "Is deze danser in de veilige zone of in het vreemde hoekje?"
  • De Magie: Dit doet het met een wiskundige truc genaamd een "Probabilistische Circuit". Hierdoor kan het het antwoord direct weten zonder dat het een miljoen simulaties moet draaien of een externe expert moet raadplegen. Als de danser in het "vreemde hoekje" staat, geeft de agent een stil alarm.

Stap 2: De Gespecialiseerde Editor (PC-LDCD)

Als de agent alarm slaat, treedt een tweede systeem genaamd PC-LDCD in actie.

  • De Analogie: In plaats dat de editor het script pakt en de hele scène herschrijft (wat de flow verpest), grijpt deze editor alleen in wanneer de agent het zegt. Wanneer de agent een mogelijke leugen markeert, pauzeert de editor een fractie van een seconde. Het kijkt naar de volgende paar woorden die de verhalenverteller zou kunnen zeggen en vraagt: "Als ik dit woord kies, blijft de danser dan in de veilige zone, of duw ik hem verder het vreemde hoekje in?"
  • Het Resultaat: Het kiest het woord dat het verhaal op koers houdt. Als de agent geen alarm heeft geslagen, doet de editor niets en laat het de verhalenverteller natuurlijk stromen.

Waarom Dit Een Grote Zaal Is

Het paper heeft dit systeem getest op vier verschillende AI-modellen (variërend van klein tot medium) en vier verschillende soorten tests (zoals het beantwoorden van trivia, leesbegrip en het controleren of de AI de waarheid spreekt).

  1. Super Detectie: De "Bewakingsagent" (PCNET) was ongelooflijk nauwkeurig. Het kon hallucinaties bijna perfect opsporen (tot 99% nauwkeurigheid in sommige tests), veel beter dan eerdere methoden die gewoon gokten op basis van woordkansen.
  2. Geen Per ongeluk Verpesten: Omdat de "Editor" (PC-LDCD) alleen ingrijpt wanneer de agent zeker is, stopte het het oude probleem van het repareren van dingen die niet kapot waren.
    • De Statistiek: Oude methoden verpesten ongeveer 54% van de correcte antwoorden die ze probeerden te repareren. Het nieuwe systeem verpeste slechts ongeveer 54% van de totale pogingen (wat betekent dat het veel meer correcte antwoorden redde dan voorheen) en slaagde erin 79% van de correcte generaties die eerder verpest werden, te beschermen.
  3. Betere Waarheidsgetrouwheid: Op de "TruthfulQA"-test (die ontworpen is om AI in de val te lokken om te liegen), behaalde het nieuwe systeem de hoogste scores voor zowel waarheidsgetrouwheid als informativiteit in drie van de vier geteste modellen.

Samenvatting

Beschouw dit paper als het uitvinden van een slimme verkeerslicht voor AI.

  • Oude manier: Een politieagent die elke auto stopt om te controleren of ze te hard rijden, vaak auto's stoppend die perfect rijden, wat file veroorzaakt.
  • Nieuwe manier: Een sensor die alleen de auto's stopt die daadwerkelijk te hard rijden, waardoor iedereen anders soepel kan rijden.

Het resultaat is een AI die veel minder waarschijnlijk liegt, maar ook veel minder waarschijnlijk verward raakt of stottert wanneer het probeert de waarheid te vertellen. De auteurs hebben deze code beschikbaar gemaakt voor anderen om te gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →