← Nieuwste papers
🤖 AI

Transformers converge to invariant algorithmic cores

Dit artikel introduceert Algorithmic Core Extraction (ACE) om aan te tonen dat onafhankelijk getrainde transformers, ondanks variërende gewichtsconfiguraties, convergeren naar compacte, invariante algoritmische subruimtes die hun gedrag beheersen, wat een gedeelde computationele structuur onthult onder de schijnbare complexiteit en een nieuw pad biedt voor mechanistisch begrip en controle.

Oorspronkelijke auteurs: Joshua S. Schiffman

Gepubliceerd 2026-07-08
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Joshua S. Schiffman

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Verschillende Wegen, Dezelfde Bestemming

Stel je voor dat je van je huis naar een specifieke koffiebar probeert te rijden.

  • Bestuurder A neemt een route door de buitenwijken, dan een snelweg, en dan een steegje.
  • Bestuurder B neemt een route door het stadscentrum, dan een park, en dan een brug.
  • Bestuurder C neemt een totaal andere route met een veerboot en een trein.

Als je naar hun kaarten kijkt (de specifieke wegen die ze reden), lijken ze totaal niet op elkaar. Ze zijn volkomen verschillend. Echter, als je kijkt naar wat ze eigenlijk doen (het proces van het rijden naar de koffiebar), doen ze allemaal precies hetzelfde.

Dit artikel stelt dat AI-modellen (specifiek "Transformers") op dezelfde manier werken. Wanneer we twee AI-modellen trainen om dezelfde taak uit te voeren, eindigen ze met een compleet andere interne "bedrading" (gewichten en parameters). Maar diep vanbinnen gebruiken ze allemaal dezelfde verborgen "motor" om de klus te klaren.

De auteurs noemen deze verborgen motor een Algorithmic Core (Algoritmische Kern).

Het Probleem: Naar het Verkeerde Kijken

Normaal gesproken proberen wetenschappers te begrijpen hoe AI werkt door te kijken naar de specifieke bedrading van één enkel model. Het artikel zegt dat dit riskant is. Het is alsof je de kaart van Bestuurder A bestudeert en denkt: "Ah, dus om bij koffie te komen, moet je wel door dat steegje." Maar dat is slechts een toevalligheid van de route van Bestuurder A. Bestuurder B nam dat steegje niet.

Het artikel suggereert dat we moeten stoppen met kijken naar de specifieke wegen (de rommelige, unieke details van één trainingsronde) en moeten gaan zoeken naar het Invariante (de onveranderlijke waarheid die alle bestuurders delen).

De Oplossing: Het Vinden van de "Kern"

De auteurs hebben een hulpmiddel gemaakt genaamd ACE (Algorithmic Core Extraction). Zie ACE als een speciale röntgenbril.

  1. Het filtert de ruis eruit: Het negeert de miljoenen unieke details die één AI anders maken dan een andere.
  2. Het vindt de motor: Het isoleert een kleine, compacte "kern" binnen de AI die absoluut noodzakelijk is om de taak uit te voeren. Als je deze kern verwijdert, faalt de AI. Als je alleen deze kern overhoudt, werkt de AI nog steeds perfect.
  3. Het bewijst dat ze hetzelfde zijn: Hoewel de AI's er aan de buitenkant anders uitzien, laat ACE zien dat ze allemaal dezelfde wiskundige "motor" binnenin verbergen.

Drie Experimenten: Van Simpel naar Complex

Het artikel testte dit idee in drie verschillende scenario's:

1. De Simpele Puzzel (Markov Chains)
Ze leerden drie verschillende AI's een simpel spel: het voorspellen van de volgende stap in een reeks.

  • Resultaat: De drie AI's leerden met compleet verschillende interne kaarten. Hun "bedrading" was bijna totaal verschillend.
  • De Kern: Maar toen ACE in de kern keek, vond het dat alle drie de AI's een kleine, driedimensionale "kern" verborgen die exact dezelfde wiskunde uitvoerde. Het was alsolijk het vinden dat drie verschillende automotoren allemaal exact dezelfde 3-cilinder zuigeropstelling gebruikten, ook al zagen de rest van de auto's er anders uit.

2. Het "Grokking" Mysterie (Modulaire Additie)
"Grokking" is een vreemd fenomeen waarbij een AI plotseling van het falen op een wiskundig probleem overgaat naar het perfect oplossen ervan, vaak na een lange tijd van alleen maar antwoorden memoriseren.

  • De Ontdekking: De auteurs ontdekten dat op het moment dat de AI "grokkt" (plotseling begrijpt), er een compacte, cirkelvormige "kern" ontstaat. Deze kern werkt als een klok die getallen roteert om de wiskunde op te lossen.
  • De Twist: Als je de AI blijft trainen nadat deze heeft geleerd, wordt deze kern "opgeblazen". Hij begint veel meer ruimte te gebruiken dan nodig is, gevuld met redundante kopieën van dezelfde wiskunde.
  • De Les: Het artikel stelde vast dat het hebben van veel redundante manieren om een probleem op te lossen, de AI daadwerkelijk helpt om sneller te leren. Het is alsof je een team van mensen hebt die allemaal hetzelfde antwoord schreeuwen; uiteindelijk komt het juiste antwoord sneller door.

3. De Werkelijkheid (Taalmodellen)
Ten slotte keken ze naar zes enorme, echte-wereld AI-modellen (zoals GPT-2, LLaMA en anderen) die worden gebruikt voor het schrijven van tekst. Deze modellen zijn enorm en zeer verschillend van elkaar.

  • De Taak: Ze richtten zich op onderwerp-werkwoordovereenkomst (weten of een zin "is" of "zijn" nodig heeft).
  • De Ontdekking: In alle zes de enorme modellen is er een enkele, onzichtbare "lijn" (een 1-dimensionale as) in het brein van de AI die bepaalt of een zin enkelvoud of meervoud is.
  • De Magische Truk: Als je deze enkele lijn neemt en deze "omdraait" (de richting omkeert), begint de AI direct grammaticafouten te maken. Het verandert "The cat is" naar "The cat are."
  • De Uitlijning: Hoewel deze modellen door verschillende bedrijven zijn gebouwd, op verschillende data zijn getraind en verschillende groottes hebben, gebruiken ze allemaal exact dezelfde lijn om grammatica af te handelen. Het is alsof elk menselijk brein, ongeacht cultuur of taal, exact dezelfde neurale schakelaar gebruikt om te beslissen tussen "Ik" en "Wij".

Waarom Dit Belangrijk Is

Het artikel concludeert dat er onder het rommelige, complexe oppervlak van AI een eenvoudigere, gedeelde structuur ligt.

  • Kijk niet naar de laklaag: De specifieke kleuren en vormen van de AI (de parameters) zijn slechts toevalligheden van hoe het getraind is.
  • Kijk naar de motor: De "Algorithmic Core" is het echte ding. Het is het deel dat hetzelfde blijft, ongeacht wie de AI bouwt of hoe ze de AI bouwen.

Door deze kernen te vinden, kunnen we AI beter begrijpen en controleren. In plaats van te proberen een miljoen kleine draadjes te repareren, kunnen we gewoon de ene "schakelaar" vinden die het gedrag controleert waar we om geven.

Samenvattende Analogie

Stel je drie verschillende architecten voor die een huis bouwen.

  • Architect A gebruikt hout.
  • Architect B gebruikt baksteen.
  • Architect C gebruikt staal.

Als je naar de materialen kijkt, zijn ze totaal verschillend. Maar als je kijkt naar het bouwplan voor de trap, zul je misschien ontdekken dat alle drie de architecten exact hetzelfde ontwerp van 10 treden hebben gebruikt, omdat dat de meest efficiënte manier is om omhoog te gaan.

Dit artikel zegt: "Stop met discussiëren over het hout, de baksteen en het staal. Laten we de trappen bestuderen."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →