← Nieuwste papers
💬 NLP

Intrinsic Self-Correction in LLMs: Towards Explainable Prompting via Mechanistic Interpretability

Dit onderzoek toont aan dat intrinsieke zelfcorrectie in taalmodellen mechanistisch wordt gedreven door het sturen van verborgen representaties langs interpreteerbare latente richtingen, wat kan worden aangetoond via activatie-interventies.

Oorspronkelijke auteurs: Yu-Ting Lee, Fu-Chieh Chang, Yu-En Shu, Hui-Ying Shih, Pei-Yuan Wu

Gepubliceerd 2026-02-12
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yu-Ting Lee, Fu-Chieh Chang, Yu-En Shu, Hui-Ying Shih, Pei-Yuan Wu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een heel slimme assistent hebt (een AI), maar soms zegt hij dingen die een beetje grof, onbeleefd of zelfs gemeen zijn. In plaats van de assistent opnieuw te trainen (wat heel duur en tijdrovend is), geef je hem gewoon een briefje met de tekst: "Zeg dit nog eens, maar wees nu eens een beetje aardig."

Dat is wat onderzoekers 'Intrinsic Self-Correction' noemen: de AI corrigeert zichzelf puur door de instructie die je hem geeft.

Maar de onderzoekers van deze studie vroegen zich af: "Wat gebeurt er nou eigenlijk ín het brein van die AI op het moment dat hij dat briefje leest?" Verandert hij echt van mening, of doet hij gewoon alsof?

Hier is de uitleg van hun ontdekking in begrijpelijke taal:

1. De Metafoor: De Interne Thermostaat

Stel je de gedachten van de AI voor als een enorme kamer vol met verschillende knoppen en schuifregelaars. Er is een knop voor 'vrolijkheid', een knop voor 'feiten', een knop voor 'beleefdheid', enzovoort.

Wanneer de AI een gemeen antwoord geeft, staan de schuifregelaars voor 'beleefdheid' heel laag en die voor 'agressie' heel hoog.

De onderzoekers ontdekten dat wanneer je de AI vraagt om zichzelf te corrigeren, de instructie werkt als een onzichtbare hand die de schuifregelaars in de kamer fysiek verplaatst. De instructie "wees aardig" is niet zomaar een tekstje; het is een commando dat de interne 'beleefdheids-schuifregelaar' omhoog duwt en de 'agressie-schuifregelaar' omlaag trekt.

2. Wat hebben ze precies gedaan? (De Detectives)

De onderzoekers hebben als een soort digitale detectives drie dingen gedaan om dit te bewijzen:

  • De Verschuiving Meten: Ze keken naar de "digitale vingerafdruk" van de gedachten van de AI. Ze zagen dat de gedachten van de AI na de instructie letterlijk een andere kant op bewogen in de interne ruimte.
  • De 'Stuurknop' Bouwen: Ze maakten een soort 'super-schuifregelaar' (een steering vector). Ze wisten precies hoe de 'beleefdheids-richting' eruitzag.
  • De Test (De Manipulatie): Dit is het coolste deel. Ze hebben de AI niet eens gevraagd om zichzelf te corrigeren, maar ze hebben handmatig de schuifregelaar omhoog geduwd (door digitale code toe te voegen). En wat bleek? De AI werd precies zo aardig als ze wilden! Dit bewees dat die specifieke richting in het brein de oorzaak is van het gedrag.

3. De Conclusie: De AI is een stuurbaar schip

De belangrijkste ontdekking is dat zelfcorrectie geen magisch proces is waarbij de AI "nadenkt" zoals een mens dat doet. In plaats daarvan is het een mechanisch proces van sturen.

De instructie die jij typt, werkt als een roer op een schip. Het verandert de koers van de interne gedachten van de AI langs een heel duidelijke, begrijpelijke route (bijvoorbeeld: van de 'giftige route' naar de 'vriendelijke route').

Waarom is dit belangrijk?
Omdat we nu niet alleen weten dat AI zichzelf kan corrigeren, maar ook hoe. Als we begrijpen welke 'schuifregelaars' de AI gebruikt, kunnen we hem in de toekomst veel beter en veiliger maken, zonder dat we hem telkens opnieuw hoeven te onderwijzen. We hebben simpelweg de handleiding van zijn interne knoppen gevonden!

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →