← Nieuwste papers
💻 computer science

Not All Explanations Simulate Equally: Comparing Verbalized Feature Attributions and Self-Generated Rationales

Dit artikel evalueert en vergelijkt de simuleerbaarheid van verbaal geuite feature-attributies en zelf gegenereerde rationales voor vraag-antwoordmodellen, waarbij wordt aangetoond dat het verklarend formaat, de granulariteit en de bron aanzienlijk invloed hebben op het vermogen van een LLM-rechter om het gedrag van een model in contrafectuele settings te voorspellen.

Oorspronkelijke auteurs: Pingjun Hong, Benjamin Roth

Gepubliceerd 2026-06-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Pingjun Hong, Benjamin Roth

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert te raden wat een zeer slimme, maar soms excentrieke robot als volgende zal zeggen. Je hebt een lijst met vragen, en de robot geeft antwoorden. Stel je nu voor dat je één woord in de vraag verandert (een "contrafactische" verandering) en vraagt: Kun jij voorspellen wat de robot op deze nieuwe vraag zal zeggen?

Dit artikel gaat over het testen van verschillende soorten "hints" (uitleg) om te zien welke er echt bijdragen aan het correct maken van die voorspelling door een mens (of een andere AI). De auteurs noemen dit proces simuleerbaarheid. Denk aan het als een "kristallen bol-test": Geeft de uitleg je genoeg informatie om de toekomst van het gedrag van de robot te zien?

De onderzoekers vergeleken twee hoofdtypen hints:

1. De "Highlighter" versus de "Storyteller"

Type A: De Highlighter (Verbaal geëxtraheerde kenmerken)
Stel je voor dat de robot een lang artikel leest en een vraag beantwoordt. Een "Highlighter"-uitleg wijst naar de specifieke zinnen of woorden in de tekst die de robot heeft gebruikt om zijn beslissing te nemen.

  • De experiment: De onderzoekers namen deze gemarkeerde delen en maakten er zinnen van.
    • Zinsniveau: "De robot vertrouwde op deze hele paragraaf."
    • Token-niveau: "De robot vertrouwde op het woord 'appel'."
    • Herschreven: Ze vroegen een superintelligente AI om de markering om te schrijven naar een vloeiende, lopende zin.

Type B: De Storyteller (Zelf gegenereerde rationales)
Dit is wanneer de robot gevraagd wordt om zijn eigen denkproces uit te leggen voordat of nadat hij het antwoord geeft.

  • Post-hoc: "Hier is mijn antwoord. Trouwens, hier is een korte reden voor."
  • Chain-of-Thought (CoT): "Laat me stap voor stap nadenken... Eerst keek ik naar X, toen overwoog ik Y, dus is mijn antwoord Z."

2. De Resultaten: Wat werkte er echt?

De onderzoekers gebruikten een "Rechter" (een andere krachtige AI) om te proberen het antwoord van de robot op de nieuwe, veranderde vraag te voorspellen. Ze gaven de Rechter het oorspronkelijke antwoord en één van de "hints" hierboven.

Dit is wat ze vonden, met behulp van eenvoudige analogieën:

  • De "Hele Paragraaf" wint (Zinsniveau):
    Wanneer de hint wees naar een hele zin of paragraaf, werd de Rechter veel beter in het voorspellen van de volgende zet van de robot. Het was alsof je een heel hoofdstuk van een boek kreeg om het plot te begrijpen.

    • Analogie: Als je iemand vertelt: "Het personage is boos vanwege de brief die hij net heeft gelezen," dan kunnen zij raden wat het personage daarna zal doen.
  • De "Enkele Woord" faalt (Token-niveau):
    Wanneer de hint alleen naar enkele woorden wees (zoals "appel" of "1805"), raakte de Rechter in de war of presteerde zelfs slechter dan voorheen. De context ontbrak.

    • Analogie: Als je alleen zegt: "Het personage is boos vanwege het woord 'brief'," is dat te vaag. Je weet niet wat de brief zei. De context ontbrak.
  • Vloeiendheid is een valkuil (LLM herschrijven):
    De onderzoekers probeerden de "Highlighter"-notities te nemen en een superintelligente AI te vragen om ze om te schrijven naar prachtig, vloeiend Engels. Ze dachten dat dit zou helpen. Dat deed het niet.

    • Analogie: Het is alsof je een ruwe kaart neemt en een kunstenaar vraagt om deze met prachtige kleuren en sierlijke lettertypen opnieuw te tekenen. Als de kaart nog steeds slechts één straat in plaats van de hele buurt laat zien, helpt dat mooie lettertype je niet bij het navigeren. De informatie was belangrijker dan de stijl.
  • De "Stap-voor-stap" Gids is Koning (Chain-of-Thought):
    De absoluut beste hints waren de Chain-of-Thought-uitleg. Wanneer de robot zijn redenering stap voor stap uitlegde, kon de Rechter de toekomstige antwoorden van de robot met ongelooflijke nauwkeurigheid voorspellen.

    • Analogie: Dit is alsof de robot je zijn kladblok laat zien. In plaats van alleen te zeggen: "Het antwoord is 42," zegt hij: "Ik heb 20 en 20 opgeteld, toen 18 ervan afgetrokken, dus kreeg ik 22, en toen weer 20 opgeteld..." Je kunt de logica perfect volgen, dus weet je precies wat hij hierna zal doen.

3. De Belangrijkste Conclusie

Het artikel concludeert dat niet alle uitleg gelijk is aan elkaar.

  • Context is Koning: Een brok van de oorspronkelijke tekst geven (een zin) is veel beter dan een minuscuul fragment geven (een woord).
  • Logica > Afwerking: Een ruwe, stapsgewijze logische uitleg (Chain-of-Thought) is veel nuttiger voor het voorspellen van gedrag dan een vloeiende, herschreven samenvatting van een markering.
  • Het "Waarom" doet ertoe: Om te begrijpen hoe een model zich in een nieuwe situatie zal gedragen, moet je het redeneerproces zien, niet alleen het bewijs waar het naar heeft gekeken.

Kortom: Als je de hersenen van een robot wilt begrijpen, laat me dan niet alleen de woorden zien die hij heeft gemarkeerd. Laat me het verhaal zien dat hij zichzelf vertelde om daar te komen. Dat is de enige manier om echt te voorspellen wat hij hierna zal doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →