← Nieuwste papers
💬 NLP

Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals

Dit artikel onderzoekt onzekerheidskwantificering voor activeringsorakels door zes methoden voor betrouwbaarheidsschatting te evalueren, waarbij wordt vastgesteld dat bootstrap-modusfrequentie de beste kalibratie biedt, terwijl log-probabiliteit dient als een kosteneffectief triagesignaal.

Oorspronkelijke auteurs: Federico Torrielli, Peter Schneider-Kamp, Lukas Galke Poech

Gepubliceerd 2026-05-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Federico Torrielli, Peter Schneider-Kamp, Lukas Galke Poech

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een super slimme robot hebt (laten we hem de "Doel" noemen) die een geheim heeft. Misschien is hij geprogrammeerd om een specifiek woord, zoals "boom", verborgen in zijn brein te houden. Je kunt het woord niet direct zien; je kunt alleen de elektrische signalen van de robot (zijn "activaties") zien wanneer hij denkt.

Nu, stel je voor dat je een tweede robot hebt, de "Orakel", wiens enige taak het is om die elektrische signalen te bekijken en ze naar gewoon Nederlands te vertalen. Hij zegt: "Het geheime woord is boom!"

Het Probleem:
De Orakel is goed in het raden van het woord, maar hij heeft een groot persoonlijkheidsgebrek: hij weet nooit wanneer hij het fout heeft. Hij zegt "Het geheime woord is boom" met exact hetzelfde vertrouwen, of hij het nu goed heeft of volledig hallucineert. Als je deze Orakel gebruikt om belangrijke beslissingen te nemen (zoals "Is deze AI veilig om vrij te geven?"), moet je weten: Hoe zeker is de Orakel echt?

Het Experiment:
De auteurs van dit artikel probeerden de Orakel te leren hoe hij moet zeggen: "Ik ben vrij zeker," of "Ik raad maar wat." Ze testten zes verschillende methoden om het vertrouwen van de Orakel te meten, een beetje zoals het proberen van zes verschillende manieren om te controleren of een weersvoorspelling betrouwbaar is.

Hier is hoe ze het testten, met eenvoudige analogieën:

De Zes Vertrouwensmethoden

  1. Het "Buikgevoel" (Log-kans):

    • Hoe het werkt: De Orakel kijkt naar het woord dat hij zojuist heeft gezegd en vraagt: "Hoe waarschijnlijk was het dat ik dit specifieke woord zou kiezen?"
    • Het Resultaat: Het is een fatsoenlijke gok, maar vaak is de Orakel te zelfverzekerd. Hij denkt dat hij 90% zeker is, terwijl hij eigenlijk maar 60% goed zit.
  2. De "Menigte-stemming" (Frequentie van Bootstrap-modus):

    • Hoe het werkt: In plaats van de Orakel één keer te vragen, vraag je hem 20 keer achter elkaar, waarbij je hem elke keer een beetje toevallig laat zijn (zoals het rollen van een dobbelsteen). Als hij 18 keer "boom" zegt en 2 keer "auto", weet je dat hij zeer zeker is. Als hij willekeurig "boom", "auto", "wolk", "rots" en "boom" zegt, weet je dat hij in de war is.
    • Het Resultaat: Dit was de winnaar. Het was het meest accuraat in het vertellen of de Orakel gelijk had of niet. Het is als een menigte mensen vragen; als ze het allemaal eens zijn, kun je het antwoord vertrouwen.
  3. Het "Eerlijk Interview" (Directe Zelfrapportage):

    • Hoe het werkt: Je vraagt de Orakel simpelweg: "Op een schaal van 0 tot 100, hoe zeker ben je?"
    • Het Resultaat: Dit was de slechtste methode. De Orakel is verschrikkelijk in zelfreflectie. Bij het grotere model was hij eigenlijk zelfzekerder wanneer hij het fout had dan wanneer hij het goed had. Het is als een student die 100% zeker is dat hij de wiskundeprobleem goed heeft, terwijl hij het volledig fout had.
  4. De "MCMC-Chain" (Kracht-steekproeven):

    • Hoe het werkt: Dit is een complexe wiskundige truc waarbij de Orakel probeert te "springen" tussen verschillende mogelijke antwoorden om te zien of hij vast komt te zitten op één antwoord.
    • Het Resultaat: Het werkte niet goed. Omdat het brein van de Orakel zo gefocust is op één antwoord, "springt" het nooit echt naar andere mogelijkheden, dus deze methode kon niet vertellen of hij zeker was of gewoon koppig.
  5. De "Touwtrekken" (Stuurgevoeligheid):

    • Hoe het werkt: Je duwt het brein van de Orakel zachtjes in verschillende richtingen om te zien of hij zijn antwoord verandert. Als het hetzelfde blijft, is hij zeker.
    • Het Resultaat: Het was te grof. Het was als proberen de temperatuur te meten met een thermometer die alleen "Heet" en "Koud" heeft.
  6. De "Multi-Chain-stemming":

    • Hoe het werkt: Vergelijkbaar met de "Menigte-stemming", maar dan met een complexere, duurdere wiskundige methode om de 20 antwoorden te genereren.
    • Het Resultaat: Het werkte redelijk, maar het was veel trager en gaf geen betere resultaten dan de simpele "Menigte-stemming".

De Grote Leerpunten

  • Het Beste Hulpmiddel: De "Menigte-stemming" (het model 20 keer vragen en kijken hoe vaak het het met zichzelf eens is) is de beste manier om te weten of de Orakel de waarheid spreekt.
  • De Valstrik: Vertrouw de Orakel nooit wanneer hij simpelweg zegt "Ik ben zeker". Het artikel vond dat wanneer de Orakel wordt gevraagd om zijn eigen vertrouwen te beoordelen, hij vaak liegt (of liever, vertrouwen hallucineert) net zo vaak als dat hij liegt over het antwoord.
  • De Kosten: De "Menigte-stemming" kost meer rekenkracht omdat je het model 20 keer moet draaien. De "Buikgevoel"-methode is sneller maar minder accuraat. De auteurs suggereren de snelle methode alleen te gebruiken als een snelle filter, maar te vertrouwen op de "Menigte-stemming" voor de uiteindelijke beslissing.

Waarom Dit Belangrijk Is

Als je een veiligheidssysteem bouwt om AI-modellen te controleren, kun je niet gewoon luisteren naar wat de Orakel zegt. Je moet weten hoeveel je moet vertrouwen wat hij zegt. Dit artikel geeft ons een handleiding over hoe je dat vertrouwen kunt opbouwen, en laat zien dat de Orakel vragen om "nog eens na te denken" (via de menigte-stemming) de meest betrouwbare manier is om hem te betrappen wanneer hij dingen verzonnen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →