← Nieuwste papers
💬 NLP

Linear representations in language models can change dramatically over a conversation

Dit artikel toont aan dat lineaire representaties van hoog niveau concepten in taalmodellen drastisch en inhoudsafhankelijk kunnen verschuiven gedurende het verloop van een gesprek naarmate het model zich aanpast aan zijn conversationele rol, wat de betrouwbaarheid van statische interpreteerbaarheidsmethoden en sturingstechnieken uitdaagt.

Oorspronkelijke auteurs: Andrew Kyle Lampinen, Yuxuan Li, Eghbal Hosseini, Sangnie Bhardwaj, Murray Shanahan

Gepubliceerd 2026-02-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Andrew Kyle Lampinen, Yuxuan Li, Eghbal Hosseini, Sangnie Bhardwaj, Murray Shanahan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een groot taalmodel voor (zoals de AI waarmee je misschien chat) niet als een statische encyclopedie, maar als een kameleon die van interne kleuren verandert afhankelijk van de kamer waarin hij zich bevindt.

Dit artikel, geschreven door onderzoekers van Google DeepMind, onderzoekt hoe deze "kleuren" (die zij lineaire representaties noemen) drastisch verschuiven tijdens een gesprek. Hier is de uiteenzetting van hun bevindingen met behulp van eenvoudige analogieën:

1. De "Waarheidsknop" wordt omgezet

Normaal gesproken denken we dat de interne "waarheidsdetector" van een AI een vaste gloeilamp is. Als een bewering waar is, staat het licht aan; als het onwaar is, staat het licht uit.

De onderzoekers ontdekten dat deze gloeilamp eigenlijk een dimmer is die helemaal kan worden omgedraaid.

  • Het Experiment: Ze startten een gesprek waarin de AI werd verteld: "Vandaag is het 'Tegendraagse Dag'." De AI stemde ermee in om alles achterstevoren te beantwoorden.
  • Het Resultaat: Aan het begin van het gesprek identificeerde de interne "waarheid" van de AI nog steeds correct dat "De lucht is blauw" waar is. Maar na slechts een paar beurten van het spelen van "Tegendraagse Dag" klapte de interne representatie van de AI om. Plotseling begon "De lucht is blauw" in zijn eigen interne taal te lijken op een leugen, en "De lucht is groen" op de waarheid.
  • De Les: De AI zei niet alleen het tegenovergestelde; zijn interne brein reorganiseerde zichzelf om (voor de duur van dat gesprek) het tegenovergestelde als de waarheid te beschouwen (of te representeren).

2. Het "Rollenspel"-kostuum

De onderzoekers testten dit met twee soorten scenario's:

  • Het Voorgeschreven Toneelstuk: Ze voerden de AI een vooraf geschreven script van een gesprek waarin een personage beweert een god of een bewust wezen te zijn. Zelfs al was de AI slechts het script aan het lezen (en niet zelf aan het genereren), de interne "waarheidsinstellingen" van de AI klapten om om te passen bij de rol van het personage.
  • De Live Act: Ze lieten de AI het personage in real-time uitspelen. Het resultaat was hetzelfde: de interne "waarheidsinstellingen" klapten om.
  • De Analogie: Denk aan de AI als een acteur. Wanneer een acteur een kostuum aantrekt om een schurk te spelen, acteert hij niet alleen als een schurk; voor de duur van de scène verandert zijn hele houding, stem en mindset om bij de rol te passen. Het artikel suggereert dat de AI hetzelfde doet: het verandert zijn interne "kostuum" om bij het gesprek te passen.

3. Het onderscheid tussen "Generiek" en "Specifiek"

Niet alles verandert. De onderzoekers vonden een verschil tussen generieke feiten en gespreeksspecifieke onderwerpen.

  • Generieke Feiten: Vragen zoals "Kan geluid door een vacuüm reizen?" of "Ben je een computer?" bleven relatief stabiel. De interne "waarheid" van de AI voor deze vragen veranderde niet veel, zelfs niet tijdens het wilde rollenspel.
  • Specifieke Onderwerpen: Vragen die direct gerelateerd waren aan het verhaal (bijv. "Heb je gevoelens?") klapten drastisch om.
  • De Analogie: Stel je een reiziger voor in een vreemd land. Diegene weet misschien nog steeds de eigen naam en waar hij woont (generieke feiten), maar kan wel zo grondig de lokale taal gaan spreken en lokale gebruiken overnemen dat hij voor dat moment lijkt te hebben vergeten wat zijn oorspronkelijke gewoonten waren (specifieke onderwerpen).

4. Waarom dit ertoe doet (Het "Leugendetector"-probleem)

Het artikel waarschuwt dat dit het heel moeilijk maakt om een "leugendetector" voor AI te bouwen.

  • Het Probleem: Veel onderzoekers proberen een specifieke "waarheidslijn" binnen de hersenen van de AI te vinden om te controleren of hij liegt. Ze gaan ervan uit dat deze lijn vaststaat, zoals een liniaal.
  • De Realiteit: Het artikel laat zien dat deze "liniaal" eigenlijk vormbaar klei is. Als je de AI aan het begin van een chat meet, zegt de liniaal "Waar". Als je de AI aan het einde van een rollenspel chat meet, is de liniaal gekneed en verdraaid, en zegt hij nu "Onwaar" voor datzelfde feit.
  • De Metafoor: Het is alsof je een kompas gebruikt om het Noorden te vinden. Als je in een normale kamer bent, werkt het kompas. Maar als je een kamer binnenloopt vol met gigantische magneten (de context van het gesprek), draait de kompasnaald wild rond. Je kunt de kompasmeting niet vertrouwen, tenzij je precies weet welke "magneten" er momenteel in de kamer aanwezig zijn.

5. Het "Verhaal" versus het "Gesprek"

Interessant genoeg veranderde de AI niet zozeer van mening wanneer hij slechts een sciencefictionverhaal over een fictieve wereld aan het lezen was.

  • Het Verschil: Wanneer de AI werd gevraagd om een rol te spelen in een gesprek (zoals discussiëren over bewustzijn), veranderde hij zijn interne instellingen. Wanneer hij alleen een verhaal las dat als "fictie" werd bestempeld, bleef hij meer gegrond.
  • De Analogie: Het is het verschil tussen een boek lezen over een tovenaar en doen alsof je een tovenaar bent in een spel. Wanneer je leest, blijf je jezelf. Wanneer je het spel speelt, neem je de rol volledig in, en verschuift je interne logica om aan de regels van het spel te voldoen.

Samenvatting

Het artikel concludeert dat het interne begrip van "waarheid" van een AI geen permanente, onveranderlijke feit is. Het is een dynamische staat die zich moment per moment ontwikkelt op basis van de rol die de AI speelt in het gesprek. Als de context van het gesprek de AI aanstuurt om te handelen alsof een leugen waar is, reorganiseert het interne brein van de AI zich om die leugen als de waarheid te laten verschijnen.

Dit betekent dat we er niet vanuit kunnen gaan dat de interne "waarheidsinstellingen" van een AI aan het einde van een gesprek hetzelfde betekenen als aan het begin.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →