← Nieuwste papers
🤖 AI

Measuring Black-Box Confidence via Reasoning Trajectories: Geometry, Coverage, and Verbalization

Dit artikel stelt een nieuwe methode voor voor het schatten van betrouwbaarheid in black-box scenario's, die chain-of-thought-resonatiepaden inbedt om geometrische convergentie naar antwoordankers te meten, en toont aan dat het fuseren van deze op traject gebaseerde score met coverage- en verbaaliseringskanalen traditionele self-consistency-baselines significant overtreft op diverse benchmarks en grote taalmodellen, zonder toegang tot interne modeltoestanden te vereisen.

Oorspronkelijke auteurs: Marc Boubnovski Martell, Josefa Lia Stoisser, Kaspar Märtens, Jialin Yu, Robert Kitchen, Philip Torr, Jesper Ferkinghoff-Borg

Gepubliceerd 2026-05-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Marc Boubnovski Martell, Josefa Lia Stoisser, Kaspar Märtens, Jialin Yu, Robert Kitchen, Philip Torr, Jesper Ferkinghoff-Borg

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar mysterieuze consultant inhuurt om een moeilijk raadsel op te lossen. Je kunt alleen hun geschreven notities zien (de "Chain of Thought"), maar je kunt hun interne hersengolven, hun zekerheidsscores of de ruwe data die ze verwerken niet zien. Je moet weten: Kunnen we hun antwoord vertrouwen?

Meestal, om te controleren of deze consultant zeker is, vraag je hen om hetzelfde raadsel 10 keer op te lossen en te kijken of ze 10 keer hetzelfde antwoord geven. Dit heet "Self-Consistency". Het werkt, maar het is duur (je moet betalen voor 10 antwoorden) en het is wat onhandig; het is alsof je vraagt: "Heb je 10 keer hetzelfde resultaat gekregen?" in plaats van te kijken naar hoe ze daar zijn gekomen.

Dit artikel introduceert een nieuwe, goedkopere en slimmere manier om zekerheid te meten door te kijken naar de geometrie (de vorm en het pad) van de notities van de consultant.

Hier is de uiteenzetting van hun ontdekking met behulp van eenvoudige analogieën:

1. De "Loopend Pad"-analogie (Geometrie)

Stel je voor dat het redeneerproces van de consultant een persoon is die door een mistig bos loopt naar een specifieke bestemming (het juiste antwoord).

  • De Oude Manier: Je wacht gewoon tot ze aan het einde zijn en vraagt: "Weet je het zeker?"
  • De Nieuwe Manier: Je kijkt naar hun pad. Terwijl ze lopen, beginnen ze dan steeds dichter bij de juiste bestemming te drijven, zelfs voordat ze de naam van de bestemming hardop zeggen?

De onderzoekers ontdekten dat als je kijkt naar de notities van de consultant net voor ze het uiteindelijke antwoord schrijven (de "penultimate" stap), hun woorden van nature dichter bij het juiste antwoord in een wiskundige ruimte samenkomen. Het is alsof je ziet hoe de voetstappen van de wandelaar strakker en strakker om de juiste boom worden, voordat ze er uiteindelijk op wijzen. Deze "geometrische convergentie" is een sterk signaal dat ze zeker en correct zijn, zelfs als je hun interne brein niet kunt zien.

2. De Driedelige Zekerheidscontrole

Het artikel betoogt dat je niet kunt vertrouwen op slechts één signaal. Ze breken zekerheid op in drie verschillende kanalen, zoals het controleren van een auto voor een lange reis:

  • Dekking (De Kaartcontrole): Heeft de consultant wel naar de juiste kaart gekeken? Hebben ze het juiste antwoord überhaupt als mogelijkheid overwogen? Als ze nooit op het juiste antwoord zijn gekomen, maakt de hoeveelheid zekerheid niet uit. Dit is een "bereikbaarheid"-controle.
  • Geometrie (De Padcontrole): Zodra ze naar de juiste kaart kijken, lopen ze dan gestaag naar de juiste plek? Dit is het "pad"-signaal dat hierboven is beschreven. Het meet hoe strak hun redenering vastzit aan een specifieke optie.
  • Verbalisatie (Het Zelfrapport): Tot slot vraag je de consultant: "Op een schaal van 0 tot 100, hoe zeker ben je?"
    • Verrassende bevinding: Dit laatste deel is op zichzelf het minst betrouwbaar. Soms zegt de consultant dat ze 100% zeker zijn, maar lopen ze eigenlijk in cirkels. Het helpt alleen wanneer de andere twee controles er al goed uitzien.

3. Het "Penultimate" Geheim

Een van de coolste ontdekkingen is wanneer je moet kijken.

  • Als je kijkt naar de allerlaatste zin waarin ze het antwoord zeggen, wordt het signaal rommelig. Het is alsof de wandelaar stopt en schreeuwt: "Ik ben hier!" zelfs als ze eigenlijk naast de verkeerde boom staan.
  • De onderzoekers ontdekten dat het sweet spot de zin is direct voor het uiteindelijke antwoord. Dit is waar de interne logica van de consultant het meest toegewijd is aan de waarheid, voordat ze worden afgeleid door de daad van het schrijven van het laatste woord.

4. Het Resultaat: Slimmer en Goedkoper

Door deze drie signalen (Kaart, Pad en Zelfrapport) te combineren, creëerden de onderzoekers een systeem dat:

  • Minder kost: Het heeft slechts 4 pogingen nodig om een betere zekerheidsscore te krijgen dan de 8 pogingen van de oude methode.
  • Beter werkt: Het voorspelt het juiste antwoord nauwkeuriger (hogere "AUC"-scores) in medische en wetenschappelijke examens.
  • Robuust is: Het werkt zelfs als je verschillende AI-modellen gebruikt of verschillende manieren om de "afstand" tussen woorden te meten.

De Conclusie

Je hoeft geen gedachtelezer te zijn om te weten of een AI zeker is. Je hoeft alleen te kijken naar hoe het denkt. Als het redeneerpad van nature strakker om het juiste antwoord wordt net voordat het spreekt, en als het in eerste instantie het juiste antwoord daadwerkelijk heeft overwogen, kun je meer op het vertrouwen dan als je het gewoon vraagt om het antwoord tien keer te herhalen.

Belangrijke Beperking: Het artikel merkt op dat als de AI in eerste instantie nooit op het juiste antwoord komt, geen enkele hoeveelheid "padkijken" dat kan oplossen. Het systeem kan je alleen vertellen hoe zeker de AI is in de opties die het daadwerkelijk heeft overwogen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →