← Nieuwste papers
💬 NLP

Understanding Unreliability of Steering Vectors in Language Models: Geometric Predictors and the Limits of Linear Approximations

Deze thesis onderzoekt waarom stuurvectoren in taalmodellen onbetrouwbaar zijn, en concludeert dat hun effectiviteit afhangt van de lineaire benaderbaarheid van het doelgedrag, wat leidt tot praktische diagnostische criteria en de noodzaak van robuustere methoden die niet-lineaire representaties in ogenschouw nemen.

Oorspronkelijke auteurs: Joschka Braun

Gepubliceerd 2026-02-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Joschka Braun

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Titel in het Kort

"Waarom het 'stuur' van een AI soms vastloopt: Een onderzoek naar de geometrie van gedachten."

Stel je voor dat een groot taalmodel (zoals een slimme chatbot) een gigantisch, onzichtbaar landschap is. In dit landschap liggen alle mogelijke antwoorden en gedachten verspreid. De onderzoekers van deze scriptie (Joschka Braun) hebben ontdekt dat we proberen om dit landschap te 'sturen' met een heel simpele tool: een rechte lijn. Soms werkt dit perfect, maar vaak is het resultaat willekeurig en onbetrouwbaar.


1. Het Probleem: De "Stuurvector" is een onbetrouwbare kompasnaald

Stel je voor dat je een enorme, intelligente robot hebt die graag helpt, maar soms ook leugens vertelt of onbeleefd is. Je wilt hem "eerlijk" maken.

Onderzoekers hebben een truc bedacht: ze meten wat de robot denkt als hij eerlijk is, en wat hij denkt als hij oneerlijk is. Het verschil tussen die twee gedachten is een vector (een pijl in een denkbeeldige ruimte). Als ze die pijl toevoegen aan de robot's gedachten, zou hij eerlijker moeten worden.

Het probleem:
Soms werkt dit geweldig. Maar vaak gebeurt er iets raars:

  • Bij vraag A wordt de robot eerlijker.
  • Bij vraag B wordt hij juist oneerlijker.
  • Bij vraag C gebeurt er niets.

De onderzoekers vroegen zich af: Waarom werkt dit stuur soms en soms niet? Is het de robot, de vraag, of de manier waarop we de stuurpijl berekenen?


2. De Oplossing: Twee Geometrische Regels

De scriptie komt met twee simpele, visuele regels om te voorspellen of het sturen zal werken.

Regel 1: De "Rijrichting" (Directionele Overeenkomst)

Stel je voor dat je een groep vrienden vraagt om naar het noorden te wijzen.

  • Situatie A (Goed): Iedereen wijst precies naar het noorden. Als je nu een gemiddelde pijl tekent, wijst die ook perfect naar het noorden. Je kunt de robot makkelijk sturen.
  • Situatie B (Slecht): De ene vriend wijst naar het noorden, de andere naar het oosten, een derde naar het zuiden. Als je een gemiddelde pijl tekent, wijst die misschien naar het midden (bijvoorbeeld noordoost). Die pijl helpt niemand echt.

De bevinding: Als de "stuurpijl" die we berekenen niet goed overeenkomt met de richting waarin de robot eigenlijk al denkt, werkt het sturen niet. De robot is dan verward over wat "eerlijkheid" eigenlijk betekent in zijn hoofd.

Regel 2: De "Scheidingslijn" (Scheidbaarheid)

Stel je voor een klaslokaal met twee groepen kinderen: diegenen die "ja" zeggen en diegenen die "nee" zeggen.

  • Situatie A (Goed): De "ja-kinderen" staan in een strakke rij links, en de "nee-kinderen" in een strakke rij rechts. Er is een duidelijke, lege ruimte ertussen. Als je nu een lijn trekt en de "nee-kinderen" over die lijn duwt, staan ze allemaal aan de "ja-kant".
  • Situatie B (Slecht): De kinderen staan door elkaar heen. De "ja-kinderen" staan ook tussen de "nee-kinderen" door. Als je nu een lijn trekt en de groep duwt, schuif je misschien de ene "nee-kind" naar de "ja-kant", maar duw je een ander "ja-kind" per ongeluk naar de "nee-kant".

De bevinding: Als de gedachten van de robot over een bepaald onderwerp (bijv. eerlijkheid) niet duidelijk gescheiden zijn in zijn hoofd, kun je ze niet met één simpele duw (stuurvector) veranderen zonder chaos te veroorzaken.


3. De Oorzaak: Een Hamer voor een Schroef?

De onderzoekers concluderen dat het probleem niet ligt bij de vraag die we stellen (de prompt), maar bij de robot zelf.

  • Sommige concepten (zoals "is dit een hond of een kat?") zijn voor de robot als een rechte lijn. Die zijn makkelijk te sturen.
  • Andere concepten (zoals "is dit een beleefd antwoord?") zijn voor de robot als een krullend pad of een spiraal.

De methode die ze gebruiken (CAA) is als een rechte hamer. Je kunt een rechte hamer gebruiken om een rechte spijker in te slaan (dat werkt goed). Maar als je diezelfde hamer probeert te gebruiken om een kromme schroef vast te draaien, werkt het niet. Je beschadigt alleen de muur.

De "stuurvector" is te simpel (te recht) om de complexe, kromme gedachten van de robot te vangen.


4. De Verrassende Bevinding: Het maakt niet uit hoe je het vraagt

De onderzoekers probeerden het sturen op verschillende manieren:

  • Met simpele vragen.
  • Met instructies ("Wees eerlijk").
  • Met voorbeelden (5-shot learning).

Het resultaat: Het maakt bijna niet uit hoe je de robot vraagt om te leren. Of je nu een simpele vraag stelt of een complexe instructie geeft, de robot leert steeds een andere "richting" voor hetzelfde concept. Maar of het werkt of niet, hangt af van de robot zelf, niet van jouw vraag. Als het concept in de robot verward is, helpt geen enkele vraagformulering.


Conclusie in Eén Zin

Je kunt een slimme AI niet betrouwbaar "sturen" met een simpele rechte lijn als zijn gedachten over dat onderwerp in zijn hoofd verward en krom zijn; je moet eerst begrijpen hoe die gedachten eruitzien voordat je ze kunt veranderen.

Wat betekent dit voor de toekomst?
We moeten stoppen met het hopen dat simpele trucjes altijd werken. In plaats daarvan moeten we nieuwe methoden ontwikkelen die kunnen omgaan met de complexe, kromme manier waarop AI's de wereld zien, net zoals we een schroevendraaier nodig hebben voor een schroef, en niet alleen een hamer.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →