← Nieuwste papers
🤖 AI

Inference Time Causal Probing in LLMs

Dit artikel stelt Hidden-state Driven Margin Intervention (HDMI) voor, een proefloze, op gradiënten gebaseerde methode die LLM-verborgen toestanden direct stuurt met behulp van de native output van het model om betrouwbaardere causale interventies te realiseren dan bestaande op klassificatoren afhankelijke benaderingen, en die bovendien een lookahead-variant introduceert voor tekstbewerking.

Oorspronkelijke auteurs: Sadegh Khorasani, Saber Salehkaleybar, Negar Kiyavash, Matthias Grossglauser

Gepubliceerd 2026-05-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sadegh Khorasani, Saber Salehkaleybar, Negar Kiyavash, Matthias Grossglauser

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: De "Black Box" Oplossen

Stel je een Large Language Model (LLM) voor als een superslimme, maar enigszins ondoorzichtige chef in een keuken. Deze chef kan prachtige verhalen schrijven, maar als je vraagt: "Waarom heb je zout aan deze soep toegevoegd?", heeft de chef misschien geen duidelijk antwoord. Ze "weten" gewoon dat het goed smaakt.

Wetenschappers willen begrijpen hoe deze chef beslissingen neemt. Specifiek willen ze weten: Gebruikt de chef het concept van meervoud (zoals "katten") daadwerkelijk om het werkwoord "rennen" te kiezen, of is dat gewoon toeval?

Om dit te testen, gebruiken onderzoekers een techniek genaamd Causale Probing. Het is als een "wat-als"-experiment. Ze willen zeggen: "Oké, laten we doen alsof het onderwerp meervoud is in plaats van enkelvoud. Verandert de chef het werkwoord van 'rennt' naar 'rennen'?"

Het Probleem met Oude Methoden: Het "Vertaler"-Probleem

Voorheen, om dit experiment uit te voeren, moesten onderzoekers een vertaler huren (een "probe" genoemd).

  1. Ze trainden deze vertaler om de geheime notities van de chef (de verborgen toestanden) te lezen en te raden of het onderwerp enkelvoud of meervoud was.
  2. Vervolgens gebruikten ze de feedback van de vertaler om de notities van de chef een duwtje te geven om de betekenis te veranderen.

De Tekortkoming: Deze vertaler spreekt misschien niet perfect de taal van de chef. De vertaler kan zijn eigen regels hebben voor hoe "meervoud" eruit ziet, die niet overeenkomen met hoe de chef eigenlijk denkt. Het is alsof je probeert een motorkap te repareren met een handleiding die voor een ander automerk is geschreven. Je duwt misschien de juiste knop in, maar je kunt iets anders breken omdat je het ware ontwerp van de motor niet begrijpt.

De Nieuwe Oplossing: HDMI (De "Directe Duw")

De auteurs stellen een nieuwe methode voor genaamd HDMI (Hidden-state Driven Margin Intervention).

De Analogie: In plaats van een vertaler te huren, praat HDMI direct met het hoofd van de chef.

  • Het Doel: De chef staat op het punt om "rennt" te zeggen (enkelvoud). Je wilt dat ze "rennen" zeggen (meervoud).
  • De Oude Manier: Vraag een vertaler om de "meervoud"-knop te vinden en in te drukken.
  • De HDMI-Manier: HDMI kijkt naar het uiteindelijke beslissingsproces van de chef (de output). Het berekent de exacte wiskundige "duw" die nodig is om het woord "rennen" iets waarschijnlijker te maken en "rennt" iets minder waarschijnlijk. Dit doet het door te kijken naar het verschil (de marge) tussen de twee woorden.

Waarom het beter is:

  • Geen Vertaler Nodig: Het hoeft geen apart AI-model te trainen om het concept te begrijpen. Het gebruikt het eigen brein van het model om uit te zoeken hoe de output moet worden veranderd.
  • Precisie: Omdat het de eigen "geometrie" van het model gebruikt (hoe het woorden van nature ordent), sluit het perfect aan bij hoe het model eigenlijk denkt.
  • Efficiëntie: Het is een eenvoudige, snelle berekening, zoals een snelle tik op het stuur in plaats van een lange omweg.

De "Vooruitkijkende" Upgrade: LA-HDMI

Het artikel introduceert ook een geavanceerde versie genaamd LA-HDMI (Lookahead HDMI) voor tekstbewerking.

Het Scenario: Stel je voor dat je een verhaal schrijft: "De kat sliep." Je wilt het veranderen in "De katten sliepen."

  • Het Probleem: Als je gewoon "sliep" verandert in "sliepen", kan de zin kapotgaan omdat het woord ervoor ("De") of het woord erna misschien ook moet veranderen om de grammatica vloeiend te houden.
  • De LA-HDMI Oplossing: Deze methode kijkt niet alleen naar het huidige woord; het kijkt vooruit. Het simuleert de volgende paar stappen van de zin terwijl het de verandering doorvoert.
    • Het ziet dat als het "sliep" verandert in "sliepen", het "De" niet hoeft te veranderen, maar misschien het lidwoord voor het zelfstandig naamwoord moet aanpassen als het zelfstandig naamwoord verandert.
    • Het stuurt de verborgen gedachten van het model zachtjes voordat het woord zelfs maar is geschreven, zodat de hele zin soepel en vloeiend blijft, niet alleen het ene woord dat je hebt veranderd.

Denk erom als een GPS die je niet alleen vertelt om nu linksaf te slaan, maar de hele route vooruit berekent zodat je later niet vast komt te zitten in een doodlopende straat.

Werkte Het? (De Resultaten)

De auteurs testten dit op twee grote "sportzalen" (datasets) die zijn ontworpen om grammatica en logica te testen:

  1. LGD Agreement: Controleren of onderwerpen en werkwoorden overeenkomen (bijv. "hij is" vs. "zij zijn").
  2. CausalGym: Een complexe reeks grammaticapuzzels.

Het Scorebord:
Ze maten twee dingen:

  • Volledigheid: Hebben we de betekenis succesvol veranderd? (Bijv. Is "rennt" veranderd in "rennen"?)
  • Selectiviteit: Hebben we per ongeluk andere dingen kapotgemaakt? (Bijv. Hebben we per ongeluk de tijd of de betekenis van de hele zin veranderd?)

Het Oordeel:
HDMI scoorde consequent hoger dan de oude methoden. Het was beter in het precies veranderen van wat het moest veranderen, zonder de rest van de zin in de war te sturen. Het werkte goed op verschillende soorten AI-modellen (zoals Llama en Pythia), wat bewijst dat het een robuust hulpmiddel is.

Samenvatting

  • Oude Manier: Gebruik een apart hulpmiddel om te raden hoe je het brein van de AI moet veranderen (vaak onnauwkeurig).
  • HDMI: Gebruik de eigen output van de AI om de perfecte duw te berekenen om zijn brein te veranderen (nauwkeurig en efficiënt).
  • LA-HDMI: Gebruik HDMI met een "glazen bol" om tekst vloeiend te bewerken, zodat de hele zin natuurlijk loopt, niet alleen het bewerkte woord.

Het artikel concludeert dat deze "directe duw"-benadering een betrouwbaardere manier is om te begrijpen en te controleren hoe AI-modellen denken en schrijven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →