← Nieuwste papers
🤖 machine learning

Integrating Local and Global Entropy for Uncertainty Quantification in LLMs

Dit artikel stelt Global-Local Uncertainty (GLU) voor, een unsupervised, single-pass methode die token-niveau entropie combineert met hidden-state geometrische entropie om effectief verschillende faalregimes te vangen, in het bijzonder de zelfverzekerde-maar-foutieve hallucinaties die lokale signalen alleen missen.

Oorspronkelijke auteurs: Johanne Medina, Tianyi Zhou, Keivin Isufaj, Aristides Gionis, Sanjay Chawla

Gepubliceerd 2026-06-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Johanne Medina, Tianyi Zhou, Keivin Isufaj, Aristides Gionis, Sanjay Chawla

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De Zelfverzekerde Leugenaar

Stel je voor dat je een zeer zelfverzekerde, welbespraakte vriend een vraag stelt. Hij antwoordt direct, met perfect grammatica en een stabiele stem. Maar hij heeft het volledig mis.

Dit is het grootste probleem met Large Language Models (LLM's) van vandaag. Ze "hallucineren" vaak (verzinnen dingen) terwijl ze 100% zeker klinken. Huidige tools proberen dit te detecteren door te luisteren naar wat het model woord voor woord zegt. Als het model onzeker lijkt over het volgende woord, markeert de tool dit als riskant.

De tekortkoming: Soms is het model heel zeker over elk afzonderlijk woord dat het zegt, maar is het gehele verhaal dat het vertelt een leugen. Huidige tools missen deze "zelfverzekerde leugenaars".

De Nieuwe Oplossing: GLU (Global-Local Uncertainty)

De auteurs van dit paper stellen een nieuwe manier voor om te controleren of een AI de waarheid spreekt. Ze noemen hun methode GLU.

Beschouw het brein van een AI als een fabriek met twee verschillende afdelingen:

  1. De "Woordkiezer" (Lokaal): Deze afdeling beslist welk woord volgt.
  2. De "Verhaalarchitect" (Globaal): Deze afdeling houdt de algemene kaart van het verhaal bij dat wordt opgebouwd.

Het paper betoogt dat je om een leugenaar te vangen, beide afdelingen moet controleren, niet alleen de Woordkiezer.

1. De Lokale Check (De Woordkiezer)

  • Hoe het werkt: Dit kijkt naar het vertrouwen van het model voor elk individueel woord. Als het model twijfelt tussen "kat" en "hond", is het lokaal onzeker.
  • De Analogie: Stel je een chefkok voor die een soep proeft. Als hij onzeker is of er genoeg zout in zit, pauzeert hij. Dat is een "lokale" onzekerheid.
  • Het Probleem: Een zelfverzekerde leugenaar is als een chefkok die de soep proeft en voor elk ingrediënt zegt: "Perfect!", zelfs als het hele gerecht vergiftigd is. De lokale check mist dit omdat elk individueel woord prima lijkt.

2. De Globale Check (De Verhaalarchitect)

  • Hoe het werkt: Dit kijkt naar de "hidden states" van het model. Dit zijn de interne wiskundige kaarten die het model gebruikt om concepten te begrijpen. De auteurs meten de "geometrische complexiteit" van deze kaarten.
  • De Analogie: Stel je voor dat de chefkok door een keuken loopt.
    • Coherent (Waarheid): Als de chef een echte soep maakt, loopt hij een rechte, strakke lijn van de koelkast naar het fornuis en dan naar de pan. Zijn pad is efficiënt en gefocust.
    • Incoherent (Hallucinatie): Als de chef een nep recept verzint, kan hij doelloos ronddwalen. Hij gaat naar de koelkast, dan naar de tuin, dan naar de garage, en dan weer terug naar de koelkast. Hij beweegt tegelijkertijd in te veel verschillende richtingen.
  • Het Inzicht: Zelfs als de chef bij elke stap "Perfect!" zegt (Lokaal), als hij door de keuken dwaalt (Globaal), dan is er iets mis. Het paper noemt dit "geometric drift" (geometrische drift).

Hoe GLU Werkt: De "Multiplicatieve Poort"

De belangrijkste innovatie van het paper is hoe het deze twee controles combineert.

  • De Oude Manier (Additief): Stel je een beveiliger voor die de scores bij elkaar optelt. "Woordvertrouwen: 9/10. Keuken dwalen: 2/10. Totaal: 11/20." Als het woordvertrouwen hoog genoeg is, laat de bewaker de persoon door, waarbij het dwalen wordt genegeerd.
  • De GLU-Manier (Multiplicatief): De auteurs gebruiken een "poort" die de scores vermenigvuldigt.
    • Als het dwalen in de keuken (Globaal) hoog is, werkt het als een volumeknop die het alarm op het woordvertrouwen harder laat klinken.
    • Het Resultaat: Zelfs als het model zelfverzekerd is over elk woord, als de interne "route" van het model dwaalt, schiet de GLU-score omhoog, waardoor het antwoord als onbetrouwbaar wordt gemarkeerd.

Wat Ze Vonden

De onderzoekers testten dit op drie verschillende AI-modellen en zes verschillende soorten vragen (zoals trivia, wiskunde en Arabische taal taken).

  1. Het Vangen van de "Zelfverzekerde maar Onjuiste": Ze ontdekten dat standaardmethoden (alleen Lokaal) een groot deel van de foute antwoorden misten omdat die antwoorden zelfverzekerd klonken. GLU ving hen omdat het het "dwalende pad" in het brein van het model zag.
  2. Beter dan de Rest: GLU presteerde beter dan alle andere "unsupervised" methoden (methoden die geen menselijke labels nodig hebben vooraf). Het was beter in het opsporen van fouten en het vertellen van de AI om "te stoppen en na te denken" voordat het een slecht antwoord geeft.
  3. Efficiënt: Het vereist niet dat de AI het antwoord meerdere keren genereert of extra rekenkracht gebruikt. Het kijkt simpelweg één keer naar het antwoord en controleert zowel de woorden als het interne pad.

Samenvatting

Het paper beweert dat om een AI te vertrouwen, je niet alleen naar de woorden moet luisteren; je moet ook kijken naar hoe het denkt. Door een controle voor woordniveau-vertrouwen te combineren met een controle voor conceptniveau-dwalen, creëert GLU een vangnet dat specifiek het type fout vangt waarbij een AI zelfverzekerd liegt. Dit doen ze zonder extra trainingsdata nodig te hebben of de AI te vertragen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →