← Neueste Arbeiten
📊 statistics

Signed-Permutation Coordinate Transport for RMSNorm Transformers

Diese Arbeit identifiziert, dass RMSNorm-Transformer eine Vorzeichen-Permutations-Gauß-Eigenschaft (BdB_d) anstelle einer einfachen Permutations-Gauß-Eigenschaft (SdS_d) besitzen, und führt eine vorzeichen-marginalisierte Hungarian-Matching-Methode ein, um einen robusten Koordinatentransport über Checkpoints hinweg zu ermöglichen, wodurch die Übertragbarkeit von Interpretierbarkeitswerkzeugen, Steering-Vektoren und Optimierungszuständen signifikant verbessert und Symmetrie-induzierte Fehler in bestehenden Alignment-Ansätzen behoben werden.

Ursprüngliche Autoren: John Sweeney

Veröffentlicht 2026-07-01
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: John Sweeney

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben zwei identische Häuser, die nach demselben Bauplan errichtet wurden. In einem Haus ist jedes Zimmer mit „Küche“, „Schlafzimmer“ und „Badezimmer“ beschriftet. In dem anderen Haus befinden sich die Zimmer an genau denselben Stellen, aber jemand hat die Beschriftungen vertauscht.

Wenn Sie ein bestimmtes Möbelstück (wie einen „Steuerungsvektor“, der das Haus dazu bringt, „Nein“ zu schlechten Anfragen zu sagen) von Haus A zu Haus B bewegen wollen, müssen Sie wissen, welches Etikett in Haus B dem „Küche“-Etikett in Haus A entspricht. Wenn Sie falsch raten, platzieren Sie den „Nein“-Knopf vielleicht im „Badezimmer“, und das Haus wird nicht richtig funktionieren.

In dieser Arbeit geht es darum, eine sehr spezifische, knifflige Version dieses „vertauschten Etiketten“-Problems für moderne KI-Modelle zu lösen.

Das Kernproblem: Das „Vorzeichen“-Rätsel

Lange Zeit glaubten Forscher, dass die einzige Art und Weise, wie diese KI-Häuser vertauscht sein könnten, eine Permutation (das Vertauschen) der Zimmer sei. Wenn Zimmer 1 zu Zimmer 5 wurde, wurden einfach die Etiketten getauscht.

Die Autorin entdeckte jedoch, dass es für die populärsten modernen KI-Modelle (die sogenannten RMSNorm-Modelle, die von Giganten wie Llama und Qwen verwendet werden) eine zweite, versteckte Art gibt, wie die Zimmer durcheinandergebracht werden können: das Vorzeichenumkehren (Sign Flip).

Stellen Sie sich das Etikett eines Zimmers nicht nur als einen Namen vor, sondern als einen Pfeil, der in eine Richtung zeigt.

  • Permutation: Den Pfeil von Nord nach Ost drehen.
  • Vorzeichenumkehr: Den Pfeil weiterhin nach Norden zeigen lassen, aber ihn so umkehren, dass er nach Süden zeigt.

In diesen modernen Modellen kann jedes einzelne Zimmer seinen Pfeil unabhängig von den anderen von Nord nach Süd drehen, ohne das Haus zu beschädigen. Dies erzeugt ein massives Chaos. Wenn Sie versuchen, Werkzeuge (Steering Tools) mithilfe der alten „Vertauschungsregeln“ von einem Modell auf ein anderes zu übertragen, könnten Sie versehentlich die Hälfte der Pfeile umgedreht haben.

Die Analogie vom „Defekten Kompass“

Die Arbeit argumentet, dass aktuelle Werkzeuge zur Ausrichtung von KI-Modellen wie einem Kompass sind, der nur „Nord“ und „Ost“ kennt, aber blind für „Süd“ ist.

  • Der alte Weg (Nur Permutation): Sie versuchen, die Zimmer zu matchen, indem Sie beobachten, wie sie sich verhalten. Wenn Zimmer A in Modell 1 sehr ähnlich ist wie Zimmer B in Modell 2, ordnen Sie sie einander zu. Aber wenn Zimmer A sich tatsächlich wie das Gegenteil von Zimmer B verhält (wegen einer Vorzeichenumkehr), denkt der alte Kompass, sie seien völlig verschieden, und weigert sich, sie zusammenzuführen.
  • Das Ergebnis: Als Forscher versuchten, „Steuerungswerkzeuge“ (wie einen Knopf, der die KI dazu bringt, schädliche Anfragen abzulehnen) mit der alten Methode zu verschieben, funktionierten die Werkzeuge oft gar nicht mehr. Der „Ablehnungs“-Knopf wurde zu „Akzeptieren“ umgedreht oder das Werkzeug hörte einfach auf zu funktionieren.

Die Lösung: Die „Vorzeichen-marginalisierte“ Karte

Die Autorin führt eine neue Methode namens Signed-Permutation Transport ein.

Stellen Sie sich vor, Sie versuchen erneut, die Zimmer zuzuordnen, aber diesmal besitzen Sie eine spezielle Lupe. Anstatt nur zu fragen: „Ist Zimmer A wie Zimmer B?“, fragen Sie: „Ist Zimmer A wie Zimmer B oder ist es das exakte Gegenteil von Zimmer B?“

  1. Betrachten Sie die Magnitude: Zuerst prüfen Sie die Stärke der Verbindung, ohne darauf zu achten, ob sie positiv oder negativ ist. Dies findet das richtige Zimmer, selbst wenn der Pfeil umgedreht ist.
  2. Prüfen Sie das Vorzeichen: Sobald Sie das passende Zimmer gefunden haben, prüfen Sie die Richtung des Pfeils. Wenn er umgedreht ist, drehen Sie ihn zurück, bevor Sie Ihr Werkzeug bewegen.

Die Autorin beweist mathematisch, dass man scheitern wird, wenn man die Vorzeichenumkehrungen ignoriert – man würde etwa 50 % der Zeit danebenliegen (da die Hälfte der Pfeile umgedreht sein könnte). Wenn man die Umkehrungen berücksichtigt, kann man die korrekte Ausrichtung fast zu 100 % wiederherstellen.

Reale Tests in der Arbeit

Die Autorin hat nicht nur Mathematik betrieben; sie hat dies an echten KI-Modellen getestet:

  • Der „Ablehnungs“-Test: Sie nahm ein Werkzeug, das eine KI dazu bringt, schädlichen Fragen die Antwort zu verweigern.
    • Alter Weg: Das Werkzeug versagte. Die KI begann, schädliche Anfragen zu akzeptieren, anstatt sie abzulehnen (weil das Vorzeichen umgedreht war).
    • Neuer Weg: Das Werkzeug funktionierte perfekt und bewahrte 95,8 % seiner ursprünglichen Leistung.
  • Der „Wörterbuch“-Test: Sie versuchten, ein Wörterbuch von Merkmalen (SAE) von einem Modell auf ein anderes zu übertragen.
    • Alter Weg: Das Wörterbuch war unbrauchbar (der Rekonstruktionsfehler war riesig).
    • Neuer Weg: Das Wörterbuch funktionierte fast perfekt.
  • Der „Lebenslauf“-Test: Sie unterbrachen das Training einer KI, änderten die Etiketten (Gauge) und versuchten, das Training fortzusetzen.
    • Alter Weg: Die KI vergaß, wo sie war, und nahm einen völlig anderen Pfad ein.
    • Neuer Weg: Die KI setzte genau dort fort, wo sie aufgehört hatte, als wäre nichts geschehen.

Die wichtigste Erkenntnis

Die Arbeit kommt zu dem Schluss, dass man bei modernen KI-Modellen nicht einfach fragen kann: „Welches Neuron ist das?“, ohne zuvor das „Gauge“ (das Regelwerk für die Anordnung der Etiketten und Vorzeichen) festzulegen.

Wenn Sie Werkzeuge, Wörterbücher oder Trainingszustände zwischen diesen Modellen bewegen wollen, müssen Sie die neuen „Signed-Permutation“-Regeln verwenden. Wenn Sie das nicht tun, versuchen Sie im Grunde, ein Auto zu fahren, bei dem das Lenkrad um 180 Grad gedreht ist: Sie denken, Sie fahren geradeaus, aber Sie fahren eigentlich rückwärts.

Kurz gesagt: Moderne KI-Modelle besitzen eine versteckte Vorzeichenumkehr-Symmetrie. Um Dinge zwischen ihnen zu bewegen, muss man die Vorzeichen korrigieren, nicht nur die Namen. Die Arbeit liefert die Karte und den Kompass, um genau das zu tun.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →