← Nieuwste papers
🤖 machine learning

When Are Two Networks the Same? Tensor Similarity for Mechanistic Interpretability

Dit artikel introduceert "tensorsimilariteit", een op gewichten gebaseerde maatstaf die invariant is voor symmetrieën in de gewichtenruimte en die op efficiënte wijze globale functionele equivalentie tussen op tensors gebaseerde neurale netwerken verifieert, waardoor mechanische interpreteerbaarheid wordt getransformeerd van een empirische benadering naar een opgelost algebraïsch probleem.

Oorspronkelijke auteurs: ML Nissen Gonzalez, Melwina Albuquerque, Laurence Wroe, Jacob Meyer Cohen, Logan Riggs Smith, Thomas Dooms

Gepubliceerd 2026-05-15
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: ML Nissen Gonzalez, Melwina Albuquerque, Laurence Wroe, Jacob Meyer Cohen, Logan Riggs Smith, Thomas Dooms

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je twee identiek ogende robots hebt. Ze lopen allebei, praten en lossen op dezelfde manier wiskundeproblemen op. Maar als je hun borstkast openmaakt, zie je dat hun interne tandwielen volledig anders zijn gerangschikt. De ene heeft tandwielen die verticaal zijn gestapeld; de andere heeft ze horizontaal uitgespreid.

Het Probleem:
In de wereld van AI willen wetenschappers begrijpen hoe deze robots (neurale netwerken) denken. Dit heet "mechanistische interpreteerbaarheid". Maar er is een groot hoofdbrekend: hoe bewijs je dat twee verschillende interne opstellingen eigenlijk precies hetzelfde doen?

Huidige methoden zijn als het vergelijken van de robots door te kijken hoe ze lopen.

  • De "Gedrag"-test: Als ze op een specifiek pad op dezelfde manier lopen, gaan we ervan uit dat ze hetzelfde zijn. Maar wat als één robot een geheim trucje heeft dat alleen werkt op een pad dat we nog niet hebben bewandeld? Dan zouden we het missen.
  • De "Blauwdruk"-test: Als we gewoon de blauwdrukken vergelijken (de getallen binnenin de robot), zouden we kunnen zeggen dat ze verschillend zijn omdat de tandwielen omgekeerd zijn, zelfs als ze exact dezelfde taak uitvoeren. Het is alsof je zegt dat twee huizen verschillend zijn omdat het ene de keuken links heeft en het andere rechts, zelfs als de kamers identiek functioneren.

De Oplossing: "Tensor Similariteit"
De auteurs van dit artikel hebben een nieuwe manier bedacht om deze robots te vergelijken. Ze noemen het Tensor Similariteit.

Stel je het zo voor: in plaats van naar de blauwdrukken te kijken of te kijken hoe de robot loopt, gebruiken ze een speciale "magische spiegel" die kijkt naar de essentie van de wiskunde van de robot.

  1. De "Magische Spiegel" (Symmetrie-invariantie):
    Stel je een beeldhouwwerk van klei voor. Je kunt het knijpen, rekken of draaien, maar als het nog steeds dezelfde vorm heeft, is het hetzelfde beeldhouwwerk. Huidige methoden raken in de war als je het beeldhouwwerk draait. De nieuwe methode van de auteurs negeert de draaiing. Het geeft alleen om de vorm van de functie. Als twee robots dezelfde wiskunde doen, geeft deze methode ze een perfecte score, zelfs als hun interne getallen er totaal anders uitzien.

  2. De "Röntgenfoto" (Geen data nodig):
    De meeste tests moeten de robot duizenden vragen stellen om te zien hoe hij antwoordt. Deze nieuwe methode heeft geen vragen nodig. Het kijkt naar het interne "brein" van de robot (de gewichten) en berekent het antwoord wiskundig. Het is als een röntgenfoto die je vertelt of een bot gebroken is, zonder de patiënt te vragen te lopen.

  3. De "Speciale Robot" (Tensor-gebaseerde modellen):
    Om deze magische spiegel te laten werken, moesten de auteurs hun robots bouwen met een iets ander soort klei genaamd "tensors" (specifiek: multilineaire modellen). Deze robots werken net als normale AI, maar hun interne wiskunde is zo gestructureerd dat deze speciale vergelijking mogelijk is. Het is een afweging: je moet de robot op een specifieke manier bouwen om deze super-nauwkeurige vergelijkingstool te krijgen.

Wat Ze Vonden (De Experimenten):
Het team testte deze nieuwe tool op vier verschillende scenario's:

  • De "Amnesie"-test: Ze leerden een robot de getallen 0–4 te herkennen, en voegden vervolgens 5–9 toe. Later probeerden ze hem 9 te laten vergeten. De oude tools konden niet vertellen welk deel van de robot het vergeten was. De nieuwe tool wees met een laser direct naar de specifieke "tandwiel" die verantwoordelijk was voor het getal 9, en toonde precies waar het geheugenverlies plaatsvond.
  • Het "Aha!"-moment (Grokking): Soms wordt AI plotseling heel goed in een taak na langdurig te worstelen. De nieuwe tool toonde aan dat dit niet zomaar een plotselinge sprong is; het is een langzame, continue herschikking van de interne tandwielen van de robot die de oude tools misten.
  • De "Geheime Handdruk" (Backdoors): Ze plantten een geheime trigger in de robot: "Als je een zwarte diamant ziet, noem het een 9." De robot werkte nog steeds perfect op normale afbeeldingen, dus standaardtests zeiden dat het in orde was. Maar de nieuwe tool, die keek naar de interne wiskunde, ontdekte direct de geheime handdruk, zelfs zonder de zwarte diamant te zien.
  • De "Taal"-test: Ze pasten dit toe op een taalmodel (een robot die tekst schrijft). De nieuwe tool toonde duidelijke, scherpe veranderingen naarmate de robot nieuwe patronen leerde, terwijl andere tools alleen een wazige warboel zagen.

De Conclusie:
Het artikel betoogt dat we, om AI echt te begrijpen, een manier nodig hebben om hun interne logica te vergelijken die niet in de war wordt door hoe de getallen zijn gerangschikt of welke data we hen voeden. Hun nieuwe "Tensor Similariteit"-maat doet precies dat, maar werkt momenteel alleen op een specifiek type AI-architectuur (tensor-gebaseerde modellen). Het verandert het rommelige probleem van "zijn deze twee hersenen hetzelfde?" in een schoon, oplosbaar wiskundig probleem.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →