← Nieuwste papers
💻 computer science

Pattern Selectivity is Not Task-Causal Structure: A Cross-Architecture Mechanistic Study of Composed-Task Circuits in 1B-Class Language Models

Deze cross-architecturale mechanistische studie toont aan dat een verenigd "screen-and-ablate"-protocol voor het identificeren van taakcircuits inconsistente causale claims oplevert over verschillende 1B-klasse taalmodellen, wat onthult dat identieke gedragscapaciteiten worden geïmplementeerd via verschillende aandachtspatroonstructuren en voorstelt dat MoE-modellen specifiek vertrouwen op een fundamenteel substraat van de positie van de vorige token voor samengestelde taken.

Oorspronkelijke auteurs: Yongzhong Xu

Gepubliceerd 2026-06-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yongzhong Xu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je drie verschillende chefs (AI-modellen) hebt die allemaal precies hetzelfde gerecht hebben geleerd te maken: een complex recept genaamd "Indirect Object Identification" (IOI). Je wilt weten hoe ze dit gerecht bereiden. Gebruiken ze dezelfde gereedschappen? Volgen ze dezelfde stappen?

Dit artikel is als een voedingscriticus die drie verschillende keukens binnenstapt om dit uit te zoeken. De criticus gebruikt een standaard testmethode: ze identificeren een specifiek gereedschap (zoals een garde of een mes), verwijderen het, en kijken of het gerecht uit elkaar valt.

Hier is wat het artikel vond, eenvoudig uitgelegd:

1. Hetzelfde Gerecht, Verschillende Recepten

De grote verrassing is dat alle drie de chefs het gerecht perfect maken, maar ze gebruiken volkomen verschillende gereedschappen om het te doen.

  • Chef A (Pythia): Gebruikt een "Previous Token"-gereedschap. Dit is als een chef die naar het ingrediënt kijkt dat hij zojuist heeft opgepakt om te beslissen wat hij nu gaat doen.
  • Chef B (OLMo): Gebruikt een "S-Inhibition"-gereedschap. Dit is als een chef die specifiek het hoofdingrediënt onderdrukt zodat het bijgerecht kan schitteren.
  • Chef C (OLMoE): Gebruikt een "Name-Mover"-gereedschap. Dit is als een chef die fysiek de naam van het bijgerecht pakt en naar de voorkant van het bord verplaatst.

De Les: Alleen omdat twee modellen een probleem op dezelfde manier oplossen (het juiste antwoord geven), betekent dit niet dat ze ook dezelfde interne "circuit" of mechanisme gebruiken. Je kunt er niet vanuit gaan dat wat werkt voor de ene AI, ook werkt voor een andere.

2. Het "Vissersexpeditie"-probleem

De onderzoekers waren bezorgd dat als ze genoeg verschillende gereedschappen zouden proberen, ze misschien gewoon geluk zouden hebben en er eentje zouden vinden die toevallig lijkt te werken. Om te bewijzen dat ze niet aan het vissen waren, gebruikten ze een "Matched Random" controle.

Denk hieraan als volgt: Als je de werkelijke garde van de chef verwijdert en de taart stort in, dan is dat goed. Maar als je een willekeurige lepel uit de lade haalt en de taart stort ook in, dan was de garde niet speciaal; de hele keuken was gewoon fragiel.

Het artikel laat zien dat voor de meeste taken, het verwijderen van het specifieke gereedschap dat de onderzoekers vonden voor een enorme instorting zorgde, terwijl het verwijderen van willekeurige gereedschappen niets deed. Dit bewijst dat ze de echte "geheime saus" voor elk specif kind model hadden gevonden.

3. De Vijf Typen "Gereedschappen"

Het artikel creëerde een nieuwe manier om te categoriseren wat er gebeurt wanneer je een gereedschap verwijdert. Het is niet alleen "het werkt" of "het werkt niet". Ze vonden vijf duidelijke uitkomsten:

  1. De Primaire Oorzaak: De hoofdmotor. Als je deze verwijdert, stopt de auto. (bijv. het "Previous Token"-gereedschap bij Chef A).
  2. De Secundaire Oorzaak: Een reservemotor. De auto rijdt nog wel als je deze verwijdert, maar hij sputtert.
  3. De Correlatie: Een glimmende decoratie. Het lijkt alsof het in de motorruimte hoort, maar als je het verwijdert, rijdt de auto prima. Het was alleen maar meegelift.
  4. De Interferentie: Een saboteur. Als je dit gereedschap verwijdert, rijdt de auto zelfs beter. In één geval ontdekten de onderzoekers gereedschappen die de prestaties van de AI zelfs verslechtten, en het verwijderen ervan loste het probleem op.
  5. De Null: Een gereedschap dat niets doet. Het verwijderen ervan verandert niets.

4. Het "MoE"-Mysterie (De Speciale Geval)

Een van de chefs (OLMoE) is een "Mixture of Experts" (MoE). Stel je voor dat deze chef een team van 64 specialisten heeft, maar er mogen er slechts 8 tegelijkertijd koken.

De onderzoekers ontdekten een vreemd patroon bij deze chef:

  • Voor drie van de vier verschillende recepten vertrouwde deze chef zwaar op het "Previous Token"-gereedschap als fundament. Het was alsof de hele keuken van deze chef gebouwd was op een lopende band die het laatste item simpelweg doorgaf.
  • Echter, voor het "Indirect Object"-recept schakelde deze chef over naar het "Name-Mover"-gereedschap.

De Hypothese: Het artikel suggereert dat voor dit specifieke type AI (MoE), het "Previous Token"-gereedschap de standaard "ruggengraat" is die alles bij elkaar houdt. De AI bouwt complexe taken op bovenop deze eenvoudige ruggengraat, tenzij de taak specifiek een ander soort aandacht vereist (zoals het kopiëren van een naam aan het einde).

5. Waarom "Top-1" Accuraatheid Niet Genoeg Is

Het artikel waarschuwt ook dat alleen kijken naar of de AI het "juiste antwoord" geeft (Top-1 accuraatheid), misleidend kan zijn.

Soms verandert het verwijderen van een gereedschap niet het uiteindelijke antwoord, maar maakt het de AI minder zelfverzekerd. Het is als een student die de wiskundevraag nog steeds goed beantwoordt, maar wiens handschrift onvast wordt en die begint te twijfelen. Als je alleen het antwoord controleert, mis je het feit dat de student moeite heeft. De onderzoekers ontdekten dat voor sommige modellen de "marge" (hoeveel beter het juiste antwoord is dan het foute antwoord) krimpt, zelfs als het antwoord hetzelfde blijft.

Samenvatting

  • Het Recept Werkt, De Gereedschappen Niet: Je kunt het "mechanisme" van de ene AI niet zomaar kopiëren naar een andere. Ze lossen dezelfde problemen op met verschillende interne tandwielen.
  • Pas Op voor "Saboteurs": Soms zijn de onderdelen waarvan je denkt dat ze helpen, juist de onderdelen die de AI hinderen.
  • MoE-Modellen Zijn Uniek: Modellen met "experts" (MoE) lijken voor de meeste taken sterk te vertrouwen op een specifieke "Previous Token"-ruggengraat, wat een nieuwe ontdekking is.
  • Kijk Dieper: Controleer niet alleen of de AI het goed heeft; controleer ook hoe zelfverzekerd de AI is, want de "zelfverzekerdheid" kan juist het echte verhaal vertellen.

Het artikel concludeert dat hoewel we een geweldige methode hebben om deze "circuits" (het recept) te vinden, we er niet vanuit kunnen gaan dat de circuits hetzelfde zijn bij verschillende modellen. Elke AI is een unieke machine met zijn eigen interne logica.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →