Polymorphism Is Rotation: Operational Mechanistic Interpretability from a Two-Layer Transformer to Pythia-70m
Diese Arbeit zeigt, dass unabhängig trainierte Transformer identische Funktionen unter Verwendung wechselseitig unverständlicher interner Koordinaten berechnen, die durch eine gleichmäßige zufällige Rotation miteinander verknüpft sind, ein als „Polymorphismus" bezeichneter Phänomen, das durch eine einzige orthogonale Procrustes-Anpassung aufgelöst werden kann, um die direkte Übertragung von Merkmalswörterbüchern und Steuervektoren ohne Nachtraining zu ermöglichen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie und ein Freund bauen beide identische, komplexe Lego-Burgen nach demselben Bauanleitungsheft. Am Ende haben Sie beide Burgen, die von außen exakt gleich aussehen und exakt dieselben Funktionen erfüllen (sie haben dieselben Türen, Fenster und Türme).
Doch innerhalb Ihrer Burgen sind die „Baupläne" dafür, wie die Steine angeordnet sind, völlig unterschiedlich. Tatsächlich sind sie so unterschiedlich, dass Sie verwirrt wären, wenn Sie versuchen würden, den internen Bauplan Ihres Freundes zu verwenden, um Ihre eigene Burg zu verstehen. Es ist nicht so, dass Ihre Burgen unterschiedlich sind; es ist vielmehr so, dass Sie zwei verschiedene „interne Sprachen" verwenden, um dasselbe Ding zu beschreiben.
Dieser Artikel nennt dieses Phänomen „Polymorphismus". Es bedeutet „gleiche Funktion, unterschiedliche interne Koordinaten".
Hier ist die Aufschlüsselung dessen, was die Forscher unter Verwendung einfacher Analogien herausfanden:
1. Der „Decoder" vs. der „Encoder" (Das Wörterbuch-Problem)
In der KI-Forschung versuchen Wissenschaftler oft zu verstehen, was ein Modell denkt, indem sie dessen „Merkmale" betrachten (wie ein Wörterbuch von Konzepten). Sie stellten fest, dass, wenn sie das Ende des Prozesses betrachteten (den „Decoder"), die Wörterbücher zwischen zwei verschiedenen Modellen fast identisch aussahen. Es war, als würden zwei Personen dasselbe Wörterbuch verwenden, um eine Geschichte zu schreiben.
Die Wendung: Die Forscher erkannten, dass zwar das Wörterbuch (der Decoder) dasselbe war, aber die Art und Weise, wie sie das Wörterbuch lasen (der Encoder), völlig durcheinandergebracht war.
- Die Analogie: Stellen Sie sich vor, zwei Personen lesen ein Buch. Person A liest es normal. Person B hat das Buch um 90 Grad gedreht und liest es auf dem Kopf stehend. Wenn Sie nur auf die Wörter schauen, auf die sie zeigen (den Decoder), stimmen sie perfekt überein. Aber wenn Sie versuchen, Person Bs Notizen aus der Perspektive von Person A zu lesen, ergeben die Notizen keinen Sinn. Die „Notizen" (Aktivierungen) befinden sich in einem gedrehten Bezugssystem.
2. Der katastrophale Ausfall
Als die Forscher versuchten, das „Merkmalswörterbuch" von Modell A direkt auf Modell B anzuwenden, schlug dies völlig fehl. Die Rekonstruktion der internen Gedanken des Modells war schlechter als das bloße Raten der durchschnittlichen Antwort.
- Die Analogie: Es ist, als würde man versuchen, eine Karte von New York City zu verwenden, um sich in London zurechtzufinden. Die Sehenswürdigkeiten (Decoder-Spalten) mögen in einer Liste ähnlich aussehen, aber die Straßen (interne Koordinaten) sind unterschiedlich orientiert. Wenn Sie die New Yorker Karte in London befolgen, werden Sie sofort verloren gehen.
3. Die magische Lösung: Eine Matrixmultiplikation
Die größte Entdeckung des Artikels ist, wie man dies beheben kann. Sie müssen die Modelle nicht neu trainieren oder ihre „Gehirne" verändern. Sie müssen lediglich eine einzelne mathematische „Drehung" (eine bestimmte Art von mathematischer Operation, die als Procrustes-Anpassung bezeichnet wird) anwenden, um die beiden Modelle auszurichten.
- Die Analogie: Stellen Sie sich vor, Sie und Ihr Freund betrachten beide eine Skulptur, aber Sie stehen auf gegenüberliegenden Seiten einer rotierenden Plattform. Sie sehen dasselbe Objekt, aber aus verschiedenen Winkeln. Wenn Sie Ihre Plattform einfach so drehen, dass sie mit der Ihres Freundes übereinstimmt, richten sich Ihre Ansichten plötzlich perfekt aus.
- Das Ergebnis: Sobald sie diese einzelne „Drehung" auf die internen Daten von Modell B angewendet hatten, funktionierte das Wörterbuch von Modell A perfekt auf Modell B. Die „interne Sprache" wurde sofort übersetzt.
4. Handelt es sich um eine spezifische Drehung oder um Zufall?
Die Forscher wollten wissen: Ist diese Drehung eine spezifische, bedeutungsvolle Verschiebung oder ist es bloß zufälliges Chaos?
- Die Erkenntnis: Sie ist im Wesentlichen zufällig. Die Drehung zwischen zwei unabhängig trainierten Modellen ist wie eine zufällige Drehung an einem Glücksrad. Es ist kein „spezieller" Winkel; es ist einfach eine gleichmäßige zufällige Drehung.
- Die Analogie: Wenn Sie einen Globus zufällig drehen und ihn stoppen, ist die Ausrichtung zufällig. Der Artikel zeigt, dass jedes Mal, wenn zwei KI-Modelle von Grund auf neu trainiert werden, sie mit einem „Globus" enden, der in einem zufälligen Winkel zueinander stehen bleibt.
5. Was dies für das „Lenken" (Verhaltensänderung) bedeutet
Der Artikel testete auch „Lenkvektoren" – Werkzeuge, die verwendet werden, um ein Modell zu einem anderen Verhalten zu bewegen (z. B. es höflicher oder kreativer zu machen).
- Die Erkenntnis: Wenn Sie versuchen, einen „Lenk-Anstoß" von Modell A auf Modell B anzuwenden, ohne die Drehung zuvor zu korrigieren, schlägt dies oft fehl oder bewirkt sogar das Gegenteil von dem, was Sie wollen.
- Die Analogie: Stellen Sie sich vor, Sie haben eine Fernbedienung für ein Spielzeugauto (Modell A). Wenn Sie versuchen, diese Fernbedienung auf ein anderes Spielzeugauto (Modell B) zu verwenden, das in eine andere Richtung zeigt, könnte das Drücken von „Vorwärts" dazu führen, dass das zweite Auto „Links" oder „Rückwärts" fährt. Sie müssen zuerst herausfinden, in welche Richtung das zweite Auto zeigt (die Drehung), und Ihre Fernbedienungssignale entsprechend anpassen.
Zusammenfassung der „Regeln"
Der Artikel legt drei Hauptregeln fest, wie diese Modelle zueinander stehen:
- Gleiche Funktion, unterschiedliche Koordinaten: Zwei unabhängig trainierte Modelle erledigen denselben Job, verwenden aber unterschiedliche interne „Karten".
- Der Decoder lügt: Nur weil die Merkmale am „Ende der Leitung" ähnlich aussehen, bedeutet das nicht, dass die Modelle Dinge auf dieselbe Weise verstehen.
- Die Lösung ist günstig: Sie können zwei völlig unterschiedliche Modelle mit einer einzigen, einfachen mathematischen Berechnung (einer Matrixmultiplikation) ausrichten, ohne sie neu trainieren zu müssen.
Das Ausmaß der Entdeckung
Die Forscher bewiesen dies auf zwei Ebenen:
- Das „Spielzeug"-Modell: Ein winziges, einfaches Modell (104.000 Parameter), bei dem sie jeden einzelnen Stein überprüfen konnten, um sicherzustellen, dass die Theorie wahr ist.
- Das „echte" Modell: Ein viel größeres, reales Sprachmodell (Pythia-70m) mit 70 Millionen Parametern. Auch hier galt dieselbe Regel der „zufälligen Drehung".
Das Fazit: KI-Modelle sind wie Zwillinge, die dieselbe Sprache sprechen, aber mit unterschiedlichen Akzenten und Ausrichtungen. Sie tun dasselbe, aber um einander zu verstehen, müssen Sie nur Ihre Perspektive drehen. Sobald Sie das getan haben, werden ihre internen Geheimnisse lesbar.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.