CoSToM:Causal-oriented Steering for Intrinsic Theory-of-Mind Alignment in Large Language Models
Dit paper introduceert CoSToM, een raamwerk dat causaliteitstheorie gebruikt om Large Language Models via gerichte activatiesturing in te stellen op intrinsiek Theory-of-Mind-redeneren, waardoor hun sociale vaardigheden en dialogen significant worden verbeterd zonder zware prompt-scaffolding.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Wat is het probleem? (De "Robot die niet luistert")
Stel je voor dat je een zeer slimme robot hebt die alles over de wereld weet. Als je hem vraagt: "Wat denkt mijn vriendje over deze situatie?", dan kan hij het antwoord perfect geven. Hij heeft de kennis.
Maar als je hem vervolgens vraagt om te praten met die vriendje in een gesprek, doet hij soms iets raars. Hij vergeet plotseling wat hij net wist. Hij reageert alsof hij de gedachten van de ander niet kent, zelfs als hij die kennis net heeft getoond.
Het is alsof een acteur die zijn tekst perfect heeft geleerd, op het podium staat en ineens vergeet wie zijn tegenspeler is. Hij weet het intern, maar hij gebruikt het niet in zijn gedrag. Dit noemen de auteurs een "misalignment" (een gebrek aan overeenstemming) tussen wat de robot weet en wat hij doet.
Wat is de oplossing? (COSTOM)
De auteurs hebben een nieuwe methode bedacht, genaamd COSTOM. De naam klinkt als "costume" (kostuum), maar het staat voor Causal-oriented Steering (Sturen op oorzaak en gevolg).
Je kunt COSTOM zien als een chirurgische ingreep in de hersenen van de robot, in plaats van hem gewoon nieuwe instructies te geven.
Stap 1: De "Röntgenfoto" (Causal Tracing)
Eerst kijken de onderzoekers precies waar in de "hersenen" van de robot (de lagen van het model) de informatie over gedachten en gevoelens zit opgeslagen.
- De ontdekking: Ze ontdekten dat deze informatie niet in de diepe, complexe lagen zit (zoals men dacht), maar verrassend genoeg in de allereerste lagen, vlakbij de ingang.
- De analogie: Het is alsof je denkt dat de geheime code van een bank in de kluis (diep in het gebouw) zit, maar je merkt dat hij eigenlijk op een post-it briefje ligt op de voordeur (de eerste laag).
Stap 2: Het "Sturen" (Activation Steering)
Nu weten ze waar de "gedachten-knoppen" zitten. In plaats van de hele robot opnieuw te leren (wat duur en langzaam is), sturen ze alleen die specifieke knoppen in de eerste lagen.
- Hoe werkt het? Ze gebruiken een soort "rem" en "gaspedaal" op de interne signalen. Ze zorgen ervoor dat de robot zijn eigen gedachten over de ander (wat de ander wil, gelooft, van plan is) actief vasthoudt terwijl hij een antwoord bedenkt.
- De analogie: Stel je voor dat de robot een auto is die vaak de weg vergeet. COSTOM is niet het vervangen van de hele motor, maar het installeren van een GPS die constant de route herhaalt in het hoofd van de bestuurder, zodat hij nooit de afslag mist.
Waarom is dit zo goed?
- Het is lichtgewicht: Ze hoeven de hele robot niet te herschrijven. Ze passen slechts een heel klein stukje aan (zoals het vervangen van een paar schroeven in een heel groot schip).
- Het werkt echt: Na deze ingreep praat de robot niet alleen slimmer over gedachten, maar hij gedraagt zich ook als iemand die echt luistert. In onderhandelingen en overredingstaken (zoals in de tests) reageert hij veel menselijker en empathischer.
- Het is stabiel: Zonder COSTOM verdwijnt de "gedachten-informatie" vaak als de robot verder praat (het verdampt). Met COSTOM blijft die informatie helder en sterk, van begin tot eind van het gesprek.
Samenvattend
Stel je voor dat je een robot wilt die een goede gesprekspartner is.
- Vroeger: Je gaf hem een lange lijst met regels: "Denk eraan dat de ander honger heeft." Maar hij vergeet het snel.
- Met COSTOM: De onderzoekers kijken in de robot, vinden precies waar het idee "honger" zit opgeslagen, en zorgen ervoor dat dit idee altijd actief blijft terwijl de robot praat.
Het resultaat is een robot die niet alleen slim is, maar ook sociaal slim: hij begrijpt wat jij voelt en denkt, en hij gebruikt dat begrip om echt goede gesprekken te voeren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.