← Nieuwste papers
💬 NLP

Geometry-Calibrated Conformal Abstention for Language Models

Dit artikel stelt Geometry-Calibrated Conformal Abstention voor, een post-hoc raamwerk dat representatiegeometrie benut om voorspellingszekerheid te kalibreren en taalmodellen in staat stelt selectief af te zien van het beantwoorden van vragen met eind-steekproefgaranties voor zowel participatiepercentages als antwoordcorrectheid, waardoor hallucinaties effectief worden gemitigeerd zonder dat hertraining vereist is.

Oorspronkelijke auteurs: Rui Xu, Yi Chen, Sihong Xie, Hui Xiong

Gepubliceerd 2026-05-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Rui Xu, Yi Chen, Sihong Xie, Hui Xiong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, goed ingelichte vriend hebt (een Large Language Model) die dol is op kletsen. Soms weet deze vriend het antwoord op je vraag direct. Op andere momenten is hij volledig in de war, maar omdat hij zo graag behulpzaam wil zijn, verzint hij een geloofwaardig klinkend verhaal in plaats toe te geven dat hij het niet weet. Dit heet "hallucinatie".

Het artikel dat je deelde, stelt een nieuwe manier voor om deze vriend te leren wanneer hij moet zeggen: "Ik weet het niet", zonder dat we zijn hele hersenen opnieuw hoeven te trainen. Ze noemen dit systeem Conformal Abstention (CA).

Hier is hoe het werkt, opgesplitst in eenvoudige concepten en analogieën:

1. Het Probleem: Het "Raadspel"

Op dit moment, als je je AI-vriend een vraag stelt die hij niet kent, voelt hij druk om een antwoord te geven. Op school, als je raadt bij een meerkeuzetoets, kun je geluk hebben en een punt scoren. Als je "Ik weet het niet" schrijft, krijg je nul. De AI leert dus dat raden altijd beter is dan onwetendheid toegeven. Dit leidt tot zelfverzekerd klinkende leugens.

2. De Oplossing: Een "Zelfvertrouwen-Check"

De auteurs hebben een post-hoc (na-gebeurtenis) systeem gebouwd dat fungeert als een beveiliger bij de deur van de antwoorden van de AI. Voordat het antwoord van de AI aan jou wordt getoond, controleert deze bewaker: "Is de AI daadwerkelijk zelfverzekerd en deskundig over dit onderwerp, of is hij gewoon aan het bluffen?"

Als de AI aan het bluffen is, stopt de bewaker het antwoord en zegt: "Ik weet het niet." Als de AI echt zelfverzekerd is, gaat het antwoord door.

3. Het Geheime Ingrediënt: "Geometrische Signalen"

Hoe weet de bewaker of de AI aan het bluffen is? Hij kijkt niet alleen naar de laatste woorden; hij kijkt naar binnen in het brein van de AI terwijl het denkt.

Stel je het brein van de AI voor als een fabriek met veel assemblagelijnen (lagen). Om een antwoord te maken, verplaatst de AI een stukje informatie (een "token") langs de lijn.

  • De Kennisinjectie (MLP): Er is een specifieke machine in de fabriek die de MLP (Multi-Layer Perceptron) heet. Denk hierbij aan de Bibliotheek waar de AI zijn feiten opslaat.
  • De Geometrische Check: Het nieuwe systeem observeert hoe de "Bibliotheek"-machine de informatie verandert terwijl deze erdoorheen gaat. Het meet drie dingen met behulp van meetkunde (vormen en hoeken):
    1. Nabijheid (Hoe dichtbij is de verandering?): Heeft de Bibliotheek-machine daadwerkelijk iets gedaan met de informatie, of is de informatie gewoon onveranderd langsgegaan? Als de Bibliotheek het heeft aangeraakt, is dat een goed teken.
    2. Rotatie (Veranderde de richting?): Heeft de Bibliotheek de informatie in een nieuwe richting gedraaid? Als de informatie wild ronddraait, kan dat betekenen dat de AI in de war is. Als het soepel draait naar een bekend feit toe, is dat goed.
    3. Uitlijning (Is het op het juiste pad?): Stel je voor dat al het "goede" kennis van de AI binnen een specifieke kegelvormige tunnel leeft. Als de informatie binnen deze tunnel blijft, is het waarschijnlijk een correct, betrouwbaar feit. Als het de tunnel verlaat, is het waarschijnlijk een hallucinatie.

De Analogie:
Stel je voor dat je een rondleidinggids vraagt naar een stad.

  • Goed antwoord: De gids wijst naar een specifiek monument, draait zijn lichaam er naartoe en loopt zelfverzekerd de hoofdstraat af (Hoge nabijheid, goede rotatie, uitgelijnd met het "toeristenpad").
  • Slecht antwoord (Hallucinatie): De gids vaag zwaait met zijn handen, draait in kringen en wijst naar een veld dat niet bestaat (Lage nabijheid, chaotische rotatie, dwalend buiten het "toeristenpad").

Het systeem gebruikt deze geometrische "lichaamstaal"-signalen om te beslissen of het antwoord betrouwbaar is.

4. De "Garantie" (Het Veiligheidsnet)

Het artikel gebruikt een wiskundige methode genaamd Conformal Prediction. Denk hierbij aan een statistische belofte.

Het systeem raadt niet zomaar; het berekent een drempelwaarde. Het belooft: "Als we alleen antwoorden doorlaten die onze geometrische check passeren, garanderen we dat 75% van de antwoorden die je ziet correct zijn."

Het garandeert ook dat de AI niet te verlegen zal zijn. Het belooft: "We zullen niet zo vaak 'Ik weet het niet' zeggen dat we 90% van de tijd stoppen met antwoorden." Het balanceert tussen veilig zijn en behulpzaam zijn.

5. De Resultaten

De auteurs hebben dit getest op zes verschillende soorten vragen (van simpele feiten tot complexe redeneringen). Ze ontdekten dat hun geometrische "lichaamstaal"-check veel beter was in het opsporen van leugens dan eerdere methoden.

  • Oude methoden waren als controleren of de AI zelfverzekerd klonk (wat leugenaars ook kunnen).
  • Hun methode controleert de interne "lichaamstaal" van de AI om te zien of hij het antwoord daadwerkelijk weet.

Samenvattend: Dit artikel geeft Large Language Models een nieuwe "leugendetector" die is ingebouwd in hun eigen interne geometrie. Het stelt hen in staat onwetendheid toe te geven wanneer ze onzeker zijn, waardoor ze, wanneer ze wel spreken, veel waarschijnlijker de waarheid spreken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →