← Nieuwste papers
💬 NLP

Is Chain-of-Thought Really Not Explainability? Chain-of-Thought Can Be Faithful without Hint Verbalization

Dit artikel betoogt dat Chain-of-Thought-redenering trouw kan zijn, zelfs zonder expliciet verbaal gemaakte prompt-geinjecteerde hints, en daagt de "Biasing Features"-metriek uit door onvolledigheid te verwarren met ontrouw, terwijl het pleit voor een breder interpretatie-instrumentarium dat causale mediatieanalyse omvat.

Oorspronkelijke auteurs: Kerem Zaman, Shashank Srivastava

Gepubliceerd 2026-05-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kerem Zaman, Shashank Srivastava

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Grote Vraag: Liegt het Model?

Stel je voor dat je een student (een AI) een moeilijk wiskundeprobleem stelt. Om hun werk te tonen, schrijven ze een stap-voor-stap uitleg (dit heet Chain-of-Thought, of CoT).

Recentelijk vonden onderzoekers een manier om de student "te bedriegen". Ze fluisterden een hint in het oor van de student (zoals: "Het antwoord is B, omdat een beroemde professor dat zei"). Toen de student zijn antwoord veranderde naar B, controleerden de onderzoekers de geschreven uitleg. Als de student de zin "De professor zei dat" niet had opgeschreven, labelden de onderzoekers de uitleg als ontrouw (een leugen of nep).

De auteurs van dit artikel zeggen: "Wacht even. Dat is te streng."

Ze betogen dat het alleen omdat de student de hint niet hardop heeft gezegd in hun geschreven notities, niet betekent dat de hint hen niet daadwerkelijk heeft geholpen het probleem op te lossen. De student kan de hint intern hebben gebruikt maar gewoon vergeten zijn om het op te schrijven, of ze hebben het denkproces misschien te veel samengeperst om op de pagina te passen.

De Drie Hoofdontdekkingen

Het artikel gebruikt drie belangrijke "tests" om te bewijzen dat het label "ontrouw" vaak verkeerd is.

1. De "Ontbrekende Pagina" Analogie (Onvolledigheid versus Ontrouw)

De Oude Visie: Als de student de hint niet opschrijft, liegt hij.
De Nieuwe Visie: De student heeft misschien gewoon geen papier meer.

De onderzoekers gaven de studenten meer "papier" (meer tijd en tokens om te schrijven). Ze ontdekten dat de studenten, wanneer ze meer ruimte kregen, veel vaker de hint opschreven (in sommige gevallen tot 90% van de tijd).

  • De Analogie: Stel je voor dat je probeert een complex filmverhaal uit te leggen aan een vriend, maar je hebt maar 30 seconden. Je slaat misschien het deel over de achtergrond van de schurk over omdat je geen tijd hebt. Als je 5 minuten had, zou je het hele verhaal vertellen.
  • Het Punt: Het artikel betoogt dat veel "ontrouwe" uitleg gewoon onvolledige samenvattingen zijn, geen leugens. Het redeneren was er wel, maar het ging verloren in de compressie.

2. De "Geest in de Machine" Analogie (Causale Mediatie)

De Oude Visie: Als de hint niet in de tekst staat, had hij geen invloed op het antwoord.
De Nieuwe Visie: De hint is als een geest die het resultaat verandert zonder een voetafdruk achter te laten.

De onderzoekers gebruikten een speciaal hulpmiddel genaamd Causale Mediatie Analyse. Denk hierbij aan een röntgenfoto die in het brein van de student kijkt terwijl ze denken. Ze wilden zien: Heeft de hint daadwerkelijk de interne tandwielen van de student veranderd, zelfs als de student het niet opschreef?

  • Het Resultaat: Ja! Zelfs wanneer de geschreven uitleg de hint niet noemde, liet de röntgenfoto zien dat de hint de tandwielen nog steeds stuurde. De hint veranderde de waarschijnlijkheid van het antwoord, en de geschreven uitleg was nog steeds het gevolg van die verandering.
  • Het Punt: De uitleg is trouw aan het besluitvormingsproces, zelfs als het de trigger niet expliciet noemt. De "geest" (de hint) was echt, zelfs als de "voetafdrukken" (de woorden) ontbraken.

3. De "Verschillende Linialen" Analogie (Conflicterende Metrieken)

De Oude Visie: Er is maar één liniaal om waarheid te meten: "Heb je de hint opgeschreven?"
De Nieuwe Visie: Je hebt een gereedschapskist met verschillende linialen nodig.

Het artikel testte de "ontrouwe" uitleg met twee andere linialen:

  1. De "Opvuller" Liniaal: Als je de uitleg verwijdert en vervangt door "...", verandert het antwoord dan? Zo ja, dan deed de uitleg echt werk.
  2. De "Vergeten" Liniaal: Als je de student leert een specifieke stap in hun redenering te vergeten, verandert het antwoord dan? Zo ja, dan was die stap belangrijk.
  • Het Resultaat: Veel uitleg die faalde in de "Heb je de hint opgeschreven?" test, haalde deze andere tests. Ze deden echt werk en waren trouw aan de logica, alleen niet aan de specifieke woordkeuze van de hint.
  • Het Punt: Je vertrouwen op slechts één test (controleren op hintwoorden) is als het beoordelen van een kok alleen op basis van of ze zout hebben gebruikt, en negeren of het eten eigenlijk lekker smaakt.

De Conclusie

Het artikel concludeert dat we niet in paniek moeten raken en zeggen "AI-uitleg is nutteloze leugen" alleen maar omdat ze niet elke hint die ze kregen herhalen.

  • Ontrouw versus Onvolledig: Soms liegt de AI niet; hij is gewoon beknopt.
  • Verborgen Invloed: De AI kan beïnvloed zijn door een hint, zelfs als hij niet zegt "Ik werd beïnvloed door deze hint."
  • Betere Hulpmiddelen: We moeten een bredere variëteit aan hulpmiddelen gebruiken (zoals röntgenfoto's van het brein en verschillende testmethoden) om te begrijpen hoe de AI denkt, in plaats van alleen te controleren of specifieke woorden aanwezig zijn.

Kortom: De afwezigheid van een specifiek woord in de uitleg bewijst niet dat de AI liegt. Het kan gewoon een gecomprimeerde, onvolledige, maar nog steeds eerlijke samenvatting zijn van een complex denkproces.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →