← Nieuwste papers
🤖 machine learning

Architecture Determines Observability in Transformers

Dit artikel toont aan dat het vermogen van een transformer om intern signalen over de kwaliteit van zijn eigen beslissingen te behouden (waarneembaarheid) geen generieke eigenschap is, maar een emergent kenmerk dat wordt bepaald door specifieke architectonische keuzes en trainingsrecepten, en dat vaak instort in modellen die anders een lage loss bereiken.

Oorspronkelijke auteurs: Thomas Carmichael

Gepubliceerd 2026-04-29
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Thomas Carmichael

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Zekere Leugenaar"

Stel je voor dat je een toets maakt met een AI-student. Soms geeft deze student een fout antwoord, maar is hij 100% zeker dat hij gelijk heeft. Hij zegt: "Ik ben er zeker van dat dit de hoofdstad van Frankrijk is!" terwijl hij "Berlijn" opschrijft.

Huidige veiligheidstools (zogenaamde "vertrouwensmonitoren") kijken naar hoe zeker de AI klinkt. Als de AI zeker klinkt, gaat de tool ervan uit dat het antwoord correct is. Maar zoals dit artikel laat zien, missen deze tools een hele categorie fouten waarbij de AI met zekerheid het verkeerde antwoord geeft.

De Oplossing: Luisteren naar de "Fluisteringen"

De onderzoekers ontdekten dat, zelfs wanneer de AI zegt dat hij zeker is, zijn interne brein (de "verborgen lagen") misschien een ander verhaal fluistert. Het is als een persoon die zegt "Ik ben goed!" terwijl zijn handen trillen.

Als je naar die interne fluisteringen kunt luisteren (de "activaties"), kun je de fouten opvangen die de vertrouwensmonitor mist. Het artikel noemt dit Observability: het vermogen om de interne "waarheid" van de AI te lezen vanuit zijn middenlagen.

De Twist: Het Gaat Niet om Intelligentie, Maar om Blauwdrukken

De meest verrassende bevinding is dat niet alle AI-modellen deze "fluisteringen" hebben.

Stel je AI-modellen voor als huizen.

  • Het "Gezonde" Huis: Sommige blauwdrukken (architecturen) zijn gebouwd met een speciale, stille hal in het midden van het huis. Zelfs als de voordeur (de output) zegt "Alles is prima", kun je door die hal lopen en het kraken van de vloerplanken (het foutsignaal) horen dat je vertelt dat er iets mis is.
  • Het "Ingestorte" Huis: Andere blauwdrukken zijn anders gebouwd. In deze huizen is de hal afgesloten of volgestort met beton. Zelfs als het huis instort, zijn de middenlagen stil. Je kunt het foutsignaal niet horen, hoe hard je ook luistert.

Het artikel bewijst dat of een huis deze "fluisterende hal" heeft, volledig afhangt van de blauwdruk (de architectuur) en het bouwteam (het trainingsrecept), niet van hoe groot of slim het huis is.

Het Bewijs: Het "Pythia"-Experiment

De onderzoekers testten dit met een gecontroleerde set modellen genaamd Pythia. Ze bouwden verschillende huizen met exact dezelfde materialen en bouwregels, maar veranderden de blauwdrukken lichtjes.

  • Het Resultaat: Ze vonden een specifieke blauwdruk (24 lagen, 16 hoofden) die altijd resulteerde in een "ingestort" huis. Hoezeer ze ook de grootte van het huis veranderden (van klein tot enorm) of het type bakstenen (verschillende datasets), die specifieke blauwdruk sloot de hal altijd af.
  • Het Contrast: Andere blauwdrukken (zoals 16 lagen of 32 hoofden) hielden de hal open en "gezond", waardoor het foutsignaal hoorbaar bleef.

Dit betekent dat je een klein model kunt hebben dat op fouten gecontroleerd kan worden, en een enorm model dat dat niet kan, puur vanwege de blauwdruk.

Het "Trainings"-Mysterie: Wanneer werd de Hal Afgesloten?

De onderzoekers keken naar het bouwproces in real-time (door te kijken naar checkpoints tijdens de training).

  • Aan het begin: Zowel de "gezonde" als de "ingestorte" blauwdrukken begonnen met een open hal. Het signaal was aanwezig.
  • Tijdens de Bouw: Naarmate de training doorging, wisste de "ingestorte" blauwdruk het signaal actief. Het bouwteam (het trainingsproces) vulde de hal met beton.
  • Het Resultaat: Tegen de tijd dat het huis klaar was, was het signaal weg. Het model leerde nog steeds om perfect te spreken (het werd beter in zijn werk), maar het had het vermogen verloren om te "weten" wanneer het een fout maakte.

Werkt Dit in de Wereld?

De onderzoekers namen een "luisteraar" (een probe) die getraind was op algemene tekst (Wikipedia) en testten deze op specifieke taken zoals medische vragen en leesbegrip.

  • De Vangst: In modellen met de "gezonde" blauwdruk ving deze luisteraar ongeveer 10–13% van de fouten die de vertrouwensmonitor miste. Dit waren fouten waarbij de AI met zekerheid het verkeerde antwoord gaf.
  • De Beperking: In modellen met de "ingestorte" blauwdruk hoorde de luisteraar niets. Het was als proberen een fluistering te horen in een geluidsdichte kamer.

De Conclusie

Het kiezen van een AI-model is een veiligheidsbeslissing.

Als je een AI wilt kunnen monitoren op fouten met zekerheid, kun je niet zomaar het grootste of slimste model kiezen. Je moet het model kiezen met de juiste blauwdruk.

  • Als de blauwdruk "ingestort" is, helpt geen enkele hoeveelheid betere monitoringsoftware. Het signaal is er niet om gevonden te worden.
  • Als de blauwdruk "gezond" is, kun je monitoren bouwen die fouten opvangen die de AI probeert te verbergen.

Kortom: Je kunt een kapotte monitor niet repareren door een betere microfoon te kopen als de kamer zelf geluidsdicht is. Je moet de kamer vanaf het begin anders bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →