← Nieuwste papers
🤖 machine learning

Emergent Causal-Geometric Dynamics Across Depth in Large Language Models

Dit artikel synthetiseert geometrische en causale perspectieven om een diepte-afhankelijke dynamiek in decoder-only LLMs bloot te leggen waarbij een scherpe overgang van contextverwerking naar vorming van voorspellingen gepaard gaat met een geleidelijke geometrische herorganisatie, wat aantoont dat hoekstructuur in late lagen voorspellende gelijkenis codeert terwijl normen ontkoppeld blijven, en aldus vaststelt dat effectieve interventie vereist dat men het emergente globale dynamische structuur van het netwerk begrijpt in plaats van geïsoleerde lagen.

Oorspronkelijke auteurs: Shahar Haim, Daniel C McNamee

Gepubliceerd 2026-05-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shahar Haim, Daniel C McNamee

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een Large Language Model (LLM) niet voor als een magische zwarte doos, maar als een meerdere verdiepingen tellende fabriek waar een ruw idee aan de onderkant binnenkomt en een eindproduct (een voorspeld woord) aan de bovenkant verlaat.

Lange tijd hebben wetenschappers deze fabriek op twee verschillende manieren bestudeerd, maar ze waren het niet helemaal eens over hoe deze twee perspectieven bij elkaar passen:

  1. Het Geometrische Perspectief: Ze keken naar de "vorm" van de data terwijl deze de verdiepingen opliep, en merkten op dat de data georganiseerder en abstracter wordt naarmate het hoger komt.
  2. Het Causale Perspectief: Ze probeerden de data op verschillende verdiepingen te "prikken" om te zien wat er gebeurde. Ze ontdekten dat prikken op de vroege verdiepingen veranderde hoe het model de invoer begreep, terwijl prikken op de latere verdiepingen het eindantwoord veranderde.

Dit artikel verbindt deze twee perspectieven. Het onthult dat de fabriek eigenlijk twee distincte fasen van werk heeft, gescheiden door een scherpe overgangspunt.

Fase 1: De "Contextverwerking"-verdieping (De onderste twee derde)

Stel je de onderste verdiepingen van de fabriek voor als het Onderzoek en Ontwikkeling (O&O)-team.

  • Wat ze doen: Wanneer een zin binnenkomt (bijvoorbeeld: "Laten we wat kalenderrekenen doen..."), is dit team druk bezig met het verzamelen van alle aanwijzingen. Ze kijken naar de woorden, de volgorde en de betekenis van de hele zin.
  • De Geometrie: In deze fase is de data rommelig en hoogdimensionaal. Het is als een chaotische brainstormsessie waar elk detail telt.
  • De Test: Als je hier probeert het model te "sturen" (door de invoerwoorden te veranderen), werkt dat. Maar als je hier probeert een specifiek antwoord af te dwingen, werkt dat niet goed. Het model is nog steeds bezig met het verhaal uit te werken, niet met het schrijven van het einde.

De Overgang: De "Overdracht"

Iets in het midden van de fabriek (ongeveer het laatste derde deel van de lagen) is er een scherpe schakelaar. Het model stopt met alleen "nadenken over de context" en begint met "het beslissen over het antwoord".

Fase 2: De "Voorspellingvorming"-verdieping (De bovenste derde)

De bovenste verdiepingen zijn de Assemblagelijn.

  • Wat ze doen: Het O&O-team heeft de voltooide blauwdruk aan dit team doorgegeven. Nu is de taak puur om het volgende woord te kiezen.
  • De Geometrie (De Grote Ontdekking): Hier wordt het artikel interessant. De wetenschappers ontdekten dat de data in dit bovenste gedeelte zichzelf organiseert in een zeer specifieke, tweeledige code:
    1. De Richting (De Pijl): Stel je voor dat elk mogelijk antwoord een specifieke richting in de ruimte heeft. In dit bovenste gedeelte vertelt de richting waarin de data wijst het model precies welk woord het moet kiezen. Als de data naar het "Noorden" wijst, zegt het model "Januari". Als het naar het "Zuiden" wijst, zegt het "Februari".
    2. De Grootte (Het Volumeknopje): De grootte (of lengte) van de datavektor draagt andere informatie—zoals hoe zeker het model is of details over de specifieke zin—maar het bepaalt niet welk woord wordt gekozen. Het is als een volumeknopje dat het antwoord harder of zachter maakt, maar niet verandert wat het antwoord is.

Het "Stuurwiel"-Experiment

Om dit te bewijzen, probeerden de onderzoekers twee soorten "sturen":

  • Veranderen van de Grootte (Volume): Ze probeerden alleen de "grootte" van de data in de bovenste verdiepingen te veranderen om een ander antwoord af te dwingen. Resultaat: Het werkte niet. Het model bleef hetzelfde woord zeggen, misschien wel met meer of minder zekerheid.
  • Veranderen van de Richting (Pijl): Ze probeerden alleen de "richting" van de data in de bovenste verdiepingen te veranderen. Resultaat: Het werkte perfect! Ze konden het antwoord van het model direct omschakelen van "Januari" naar "Februari" door simpelweg de richting van de data te roteren.

De Conclusie

Het artikel concludeert dat je een AI niet kunt begrijpen of controleren door ernaar te kijken als één grote klomp.

  • Vroege lagen gaan over context. Ze zijn gevoelig voor de invoerwoorden, maar geven nog niet om de geometrie van het eindantwoord.
  • Late lagen gaan over voorspelling. Ze gebruiken een specifieke "richtingscode" om de output te beslissen.

De Analogie:
Stel je voor dat je een brief schrijft.

  • De onderste lagen zijn jij die je gedachten, herinneringen en feiten verzamelt (de context).
  • De bovenste lagen zijn je hand die daadwerkelijk de pen vasthoudt.
  • Het artikel toont aan dat om te veranderen wat je schrijft (de voorspelling), je niet je gedachten hoeft te veranderen (de grootte van de data); je hoeft alleen maar de richting te veranderen waarin je hand beweegt (de hoekige geometrie).

Dit verklaart waarom sommige eerdere pogingen om AI te controleren faalden: mensen probeerden het "volume" (norm) te veranderen of keken naar de "gedachten" (vroege lagen), terwijl ze het "stuurwiel" (richting van de late lagen) hadden moeten sturen. Het artikel biedt een kaart die precies aangeeft waar het "stuurwiel" zich bevindt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →