← Nieuwste papers
📊 statistics

Signed-Permutation Coordinate Transport for RMSNorm Transformers

Dit artikel stelt vast dat RMSNorm-transformers over een getekende permutatie-gauge (BdB_d) beschikken in plaats van een eenvoudige permutatie-gauge (SdS_d), en introduceert een teken-gemarginaliseerde Hongaarse matching-methode om robuust coördinatentransport tussen checkpoints mogelijk te maken, waardoor de overdraagbaarheid van interpreteerbaarheidstools, sturingsvectoren en optimizer-toestanden aanzienlijk wordt verbeterd en symmetrie-geïnduceerde fouten in bestaande uitlijningsbenaderingen worden opgelost.

Oorspronkelijke auteurs: John Sweeney

Gepubliceerd 2026-07-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: John Sweeney

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je twee identieke huizen hebt die zijn gebouwd volgens hetzelfde blauwdruk. In het ene huis is elke kamer gelabeld als "Keuken", "Slaapkamer" en "Badkamer". In het andere huis staan de kamers op exact dezelfde plekken, maar heeft iemand de labels gehusseld.

Als je een specifiek meubelstuk wilt verplaatsen (zoals een "stuurvector" die ervoor zorgt dat het huis "nee" zegt tegen slechte verzoeken) van Huis A naar Huis B, moet je weten welk label in Huis B overeenkomt met de "Keuken" in Huis A. Als je het fout raadt, plaats je misschien de "Nee"-knop in de "Badkamer", en dan werkt het huis niet goed.

Dit artikel gaat over het oplossen van een zeer specifieke, lastige versie van dit "gehusselde labels"-probleem voor moderne AI-modellen.

Het Kernprobleel: Het "Teken"-mysterie

Lama tijd dachten onderzoekers dat de enige manier waarop deze AI-huizen gehusseld konden worden, het permuteren (omwisselen) van de kamers was. Als Kamer 1 Kamer 5 werd, wisselde je gewoon de labels om.

Echter, de auteur ontdekte dat voor de meest populaire moderne AI-modellen (RMSNorm-modellen, gebruikt door reuzen zoals Llama en Qwen), er een tweede, verborgen manier is waarop de kamers door elkaar kunnen worden gehusseld: het omdraaien van de tekens (sign flipping).

Beschouw het label van een kamer niet alleen als een naam, maar als een pijl die een richting aanwijst.

  • Permutatie: Een pijl van Noord naar Oost laten wijzen door te draaien.
  • Tekenomdraaiing (Sign Flip): De pijl die naar het Noorden wijst, laten blijven wijzen, maar hem zo omdraaien dat hij nu naar het Zuiden wijst.

In deze moderne modellen kan elke enkele kamer onafhankelijk van de andere zijn pijl omdraaien (Noord \to Zuid) zonder dat het huis kapot gaat. Dit creëert een enorme hoeveelheid verwarring. Als je probeert tools te verplaatsen (zoals een "Nee"-knop) tussen modellen met alleen de oude "omwisselregels", draai je per ongeluk de helft van de pijlen om.

De "Defecte Kompas"-analogie

De auteur stelt dat huidige hulpmiddelen voor het afstemmen van AI-modellen lijken op een kompas dat alleen "Noord" en "Oost" kent, maar blind is voor "Zuid".

  • De Oude Manier (Alleen Permutatie): Je probeert de kamers te matchen door te kijken naar hoe ze zich gedragen. Als Kamer A in Model 1 erg lijkt op Kamer B in Model 2, koppel je ze aan elkaar. Maar als Kamer A eigenlijk het tegendeel van Kamer B gedraagt (vanwege een tekenomdraaiing), denkt de oude kompas dat ze totaal verschillend zijn en weigert ze te matchen.
  • Het Resultaat: Toen onderzoekers probeerden "stuurhulpmiddelen" (zoals een knop om een AI te laten weigeren schadelijke verzoeken) te verplaatsen met de oude methode, gingen de hulpmiddelen vaak volledig kapot. De "Weiger"-knop werd omgedraaid naar "Accepteren", of het hulpmiddel stopte simpelweg met werken.

De Oplossing: De "Teken-gemarginaliseerde" Kaart

De auteur introduceert een nieuwe methode genaamd Signed-Permutation Transport.

Stel je voor dat je de kamers weer probeert te matchen, maar dit keer heb je een speciale loep. In plaats van alleen te vragen: "Is Kamer A zoals Kamer B?", vraag je: "Is Kamer A zoals Kamer B, of is het precies het tegenovergestelde van Kamer B?"

  1. Kijk naar de Grootte (Magnitude): Eerst controleer je de sterkte van de verbinding, waarbij je de positieve of negatieve waarde negeert. Dit vindt de juiste kamer, zelfs als de pijl is omgedraaid.
  2. Controleer het Teken: Zodra je de bijbehorende kamer hebt gevonden, controleer je de richting van de pijl. Als deze is omgedraaid, draai je hem eerst terug voordat je je hulpmiddel verplaatst.

De auteur bewijst wiskundig dat als je de tekenomdraaiingen negeert, je ongeveer 50% van de tijd zult falen (omdat de helft van de pijlen misschien is omgedraaid). Door rekening te houden met de omdraaiingen, kun je de juiste uitlijning bijna 100% van de tijd herstellen.

Praktijktests in het artikel

De auteur deed niet alleen wiskunde; hij testte dit op echte AI-modellen:

  • De "Weiger"-test: Ze namen een hulpmiddel dat een AI laat weigeren om schadelijke vragen te beantwoorden.
    • Oude Methode: Het hulpmiddel faalde. De AI begon in plaats daarvan schadelijke verzoeken te accepteren (omdat het teken was omgedraaid).
    • Nieuwe Methode: Het hulpmiddel werkte perfect en behield 95,8% van zijn oorspronkelijke kracht.
  • De "Woordenboek"-test: Ze probeerden een woordenboek van kenmerken (SAE) van het ene model naar het andere te verplaatsen.
    • Oude Methode: Het woordenboek was nutteloos (de reconstructiefout was enorm).
    • Nieuwe Methode: Het woordenboek werkte bijna perfect.
  • De "Resume"-test: Ze onderbraken de training van een AI, veranderden de labels (gauge), en probeerden de training te hervatten.
    • Oude Methode: De AI vergat waar hij was en nam een compleet ander pad.
    • Nieuwe Methode: De AI ging exact verder waar hij gebleven was, alsof er niets gebeurd was.

De Belangrijkste Conclusie

De conclusie van het artikel is dat je voor moderne AI-modellen niet zomaar kunt vragen: "Welke neuron is dit?", zonder eerst de "gauge" (het regelboek voor hoe de labels en tekens zijn gerangschikt) te specificeren.

Als je tools, woordenboeken of trainingsstatussen tussen deze modellen wilt verplaatsen, moet je de nieuwe "Signed-Permutation"-regels gebruiken. Als je dat niet doet, probeer je in feite een auto te besturen met een stuur dat 180 graden is omgedraaid: je denkt dat je rechtuit gaat, maar je gaat eigenlijk achteruit.

Kortom: Moderne AI-modellen hebben een verborgen "tekenomdraai"-symmetrie. Om dingen tussen deze modellen te verplaatsen, moet je de tekens corrigeren, niet alleen de namen. Het artikel biedt de kaart en het kompas om precies dat te doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →