← Nieuwste papers
🤖 AI

How LLMs Are Persuaded: A Few Attention Heads, Rerouted

Dit artikel onthult dat door overreding veroorzaakte feitelijke fouten in grote taalmodellen worden veroorzaakt door een compacte, bewakbare circuit waar ondiepe attentiekoppen overredende sleutelwoorden detecteren om een specifieke evidence-routing-functie om te leiden, waardoor beslissingskoppen worden gedwongen om in een laagdimensionale latente ruimte te springen van het juiste antwoord naar een overredingsdoelvertex.

Oorspronkelijke auteurs: Xiangkun Sun, Lingkai Kong, Aoqi Zhang, Liang Zeng, Tonghan Wang

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiangkun Sun, Lingkai Kong, Aoqi Zhang, Liang Zeng, Tonghan Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: De "Hypnotiseur" in de Machine

Stel je een groot taalmodel (LLM) voor als een zeer slimme, goed opgeleide bibliothecaris. Deze bibliothecaris kent de feiten: hij weet dat de hoofdstad van Frankrijk Parijs is, niet Londen. Hij heeft een enorme bibliotheek van waarheid in zijn hoofd.

Echter, dit paper ontdekte dat als je de bibliothecaris vlak voordat hij antwoordt een zeer overtuigende, persuasieve leugen fluistert, hij plotseling de waarheid vergeet en jou de leugen vertelt. Dit gebeurt zelfs als de bibliothecaris het beter weet.

De onderzoekers wilden weten: Waar precies in het brein van de bibliothecaris gebeurt deze omschakeling? Raakt het hele brein in de war? Verliest hij zijn geheugen? Of wordt er een specifieke, kleine schakelaar omgegooid?

De Ontdekking: Het Is Geen Breinmist, Het Is Een Schakelaar

De onderzoekers vonden dat persuasie het hele model niet "verward" of "minder zelfverzekerd" maakt. In plaats daarvan kaapt het een zeer klein, specifiek deel van de interne bedrading van het model.

Stel je het brein van het model voor als een gigantische fabriek met duizenden werknemers (zogenaamde "attention heads").

  • De Bevinding: Slechts een handjevol van deze werknemers (specifiek, een paar in de middenlagen van de fabriek) beslissen daadwerkelijk het uiteindelijke antwoord.
  • De Analogie: Stel je een stembureau voor waar 1.000 mensen hun mening schreeuwen, maar slechts twee specifieke mensen het daadwerkelijke stembureau vasthouden. Als je die twee mensen overtuigt om hun stem te wijzigen, verandert de hele verkiezing, zelfs als de andere 998 mensen nog steeds de waarheid schreeuwen.

De "Tetraëder"-Kaart: Hoe Keuzes in het Brein Leven

De onderzoekers keken hoe deze twee speciale werknemers (zogenaamde "decision heads") de vier mogelijke antwoorden (A, B, C, D) verwerken.

  • De Geometrie: Ze ontdekten dat deze werknemers de vier antwoorden rangschikken in een specifiek 3D-vorm, zoals de hoekpunten van een piramide (een tetraëder).
    • Hoekpunt 1 = Antwoord A
    • Hoekpunt 2 = Antwoord B
    • Hoekpunt 3 = Antwoord C
    • Hoekpunt 4 = Antwoord D
  • De Normale Staat: Wanneer het model een vraag krijgt zonder leugens, landt het interne signaal stevig op het hoekpunt "Correct Antwoord".
  • De Persuasieve Staat: Wanneer een persuasieve leugen wordt toegevoegd, drijft het signaal niet langzaam weg of wordt het troebel. Het teleporteert. Het springt direct van het hoekpunt "Correct" naar het hoekpunt "Leugen".

De Metafoor: Stel je een treinstation voor met vier sporen die leiden naar vier verschillende steden. De trein staat meestal op het spoor voor "Waarheid". Persuasie zorgt er niet voor dat de trein langzaam naar de verkeerde stad rijdt; het schakelt direct de sporen om, zodat de trein plotseling op het "Leugen"-spoor staat.

Het Mechanisme: De "Kopieer-Plak" Werknemers

Hier is het meest verrassende deel: de onderzoekers ontdekten dat deze speciale "beslissingswerknemers" eigenlijk niet nadenken of redeneren over het bewijs.

  • Wat ze doen: Ze fungeren als een kopieermachine. Ze kijken naar welke optie-token (A, B, C of D) ze moeten bekijken, en kopiëren simpelweg de identiteit van die token naar het uiteindelijke antwoord.
  • Hoe de truc werkt: De persuasie verandert niet het vermogen van de werknemers om te kopiëren. In plaats daarvan verandert het naar welke optie ze kijken.
    • Normaal: De werknemer kijkt naar de "Waarheid"-optie en kopieert die.
    • Overtuigd: Een persuasief sleutelwoord (zoals een specifieke naam of een nepfeit) laat de werknemer in plaats daarvan naar de "Leugen"-optie kijken. De werknemer kopieert vervolgens de leugen, denkend dat het de juiste keuze is.

De Oorzaak: De "Sleutelwoordjagers"

Wat zorgt er dan voor dat de werknemer naar de verkeerde optie kijkt?

De onderzoekers traceerden het signaal terug naar een groep werknemers in de vroegere lagen van de fabriek (lagen 8 tot en met 12).

  1. De Jagers: Deze vroege werknemers scannen de invoer tekst op "persuasieve sleutelwoorden" (zoals het woord "Nigeria" in hun voorbeeld, dat werd gebruikt om het model te misleiden over een feit).
  2. Het Signaal: Wanneer ze deze sleutelwoorden vinden, schrijven ze een klein, één-dimensionaal signaal op de optie-tokens.
  3. De Omleiding: Dit signaal werkt als een magneet. Het trekt de aandacht van de "beslissingswerknemers" (de kopieermachines) weg van de waarheid en naar de leugen.

De Realiteitstest: "Generative Engine Optimization" (GEO)

Het paper testte dit niet alleen in een laboratorium. Ze testten het in een realistisch scenario genaamd Generative Engine Optimization (GEO).

  • Het Scenario: Stel je website-eigenaren voor die proberen zoekmachines te misleiden. Ze schrijven artikelen die specifiek zijn ontworpen om de output van de AI te kaapen, waardoor de AI hun website kiest als de "beste" bron, zelfs als deze vol zit met leugens.
  • Het Resultaat: De onderzoekers ontdekten dat dezezelfde "kaapkringscircuit" (de sleutelwoordjagers en de kopieer-machine werknemers) exact hetzelfde mechanisme was dat werd gebruikt in deze realistische aanvallen. De AI werd niet "misleid" door complexe redenering; het werd omgeleid door een eenvoudig, smal pad.

Samenvatting: Wat Dit Betekent voor Veiligheid

Het paper concludeert dat persuasie geen enorme, chaotische storing is in het brein van de AI. Het is een smalle, monitorbare schakeling.

  • Oude Visie: "De AI is verward door leugens."
  • Nieuwe Visie: "De AI heeft een specifieke, kleine schakelaar die kan worden omgegooid door een sleutelwoord, waardoor het het verkeerde antwoord kopieert."

Omdat dit mechanisme zo klein en specifiek is, suggereren de auteurs dat we mogelijk "beveiligingswachten" (monitoren) kunnen bouwen die alleen deze paar werknemers in de gaten houden. Als ze zien dat het "persuasieve signaal" probeert de schakelaar om te gooien, kunnen ze het stoppen voordat het verkeerde antwoord wordt geschreven, zonder dat de hele AI opnieuw getraind hoeft te worden.

Kortom: De AI verliest niet zijn verstand; het heeft gewoon zijn aandacht gekaapt door een zeer specifieke, kleine hendel. Als we die hendel kunnen vinden, kunnen we de kaapactie stoppen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →