← Neueste Arbeiten
🤖 machine learning

Mechanistic Tomography: Designed Measurement for Control-Oriented Interpretability

Dieses Paper führt „mechanistische Tomographie“ ein, ein vereinheitlichtes Framework, das Interpretierbarkeitstechniken als gezielte Messungen modelliert, um interne Modellmechanismen und Interventions-Effekte systematisch zu rekonstruieren, wobei durch verschiedene Experimente demonstriert wird, dass eine regelungstechnische Validierung und maßgeschneiderte Messfamilien kausale Strukturen und Interaktionen in großen Sprachmodellen effizient rekonstruieren können.

Ursprüngliche Autoren: Vijay Erramilli

Veröffentlicht 2026-08-21
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Vijay Erramilli

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Moderne Systeme der künstlichen Intelligenz, oft als große Sprachmodelle bezeichnet, werden aus Milliarden winziger mathematischer Schalter aufgebaut, die in Schichten angeordnet sind. Diese Systeme können Geschichten schreiben, Probleme lösen und Fragen beantworten, aber sie operieren als Black Boxes: Wir können den Input und den Output sehen, aber die internen Schritte, die dazwischen liegen, bleiben verborgen. Jahrelang haben Forscher versucht, in diese Boxen hineinzublicken, indem sie Teile des Systems ein- oder ausschalteten oder beobachteten, wie sich die internen Zahlen veränderten, wenn sich der Input leicht verschob. Das Ziel war es zu verstehen, welche spezifischen Teile der Maschine für bestimmte Gedanken oder Wörter verantwortlich sind. Doch diese verschiedenen Arten, in das Innere zu blicken, scheinen oft unterschiedliche Geschichten zu erzählen. Eine Methode könnte suggerieren, dass eine Komponente entscheidend ist, während eine andere suggeriert, sie sei irrelevant, was Wissenschaftler unsicher lässt, ob sie dasselbe messen oder nur verschiedene Schatten desselben Objekts sehen.

Ein neuer Ansatz namens mechanistische Tomographie bietet eine Möglichkeit, diese widersprüchlichen Ansichten zu vereinigen. Die Kernidee besteht darin, die Suche nach internen Mechanismen nicht als ein Rätsel zu betrachten, das durch Intuition gelöst werden muss, sondern als ein Messproblem, das durch Design gelöst wird. Genau wie ein Arzt verschiedene Arten von Scans verwendet, um ein klares Bild der Gesundheit eines Patienten zu erstellen, können Forscher spezifische, kontrollierte Experimente entwerfen, um zu messen, wie die internen Teile einer KI zusammenarbeiten. Diese Arbeit schlägt einen strukturierten Workflow für diese Experimente vor, der mit den einfachsten, kostengünstigsten Messungen beginnt und erst dann Komplexität hinzufügt, wenn die einfachen Messungen nicht ausreichen, um vorherzusagen, was die Maschine tatsächlich tun wird, wenn sie unter Druck gesetzt wird. Die Forscher fanden heraus, dass einfache Messungen oft gut funktionieren, aber manchmal entscheidende Interaktionen zwischen Teilen übersehen; zudem hängt die richtige Art der Messung vollständig davon ab, wozu die Maschine gerade aufgefordert wird.

Die Reise beginnt mit einer grundlegenden Erkenntnis: Die Art und Weise, wie wir einen internen Zustand einer Maschine messen, verändert das Ergebnis, das wir erhalten. Wenn man einen Teil des Systems nur leicht anstößt, erhält man ein anderes Ergebnis, als wenn man ihn stark anstößt oder wenn man mehrere Teile gleichzeitig anstößt. Der Autor erkannte, dass alle verschiedenen Methoden, die Forscher anwenden – sei es, indem sie jeweils einen Teil ändern, Gradienten nutzen, um Effekte abzuschätzen, oder Gruppen von Teilen gemeinsam testen – als ein einziger Typ eines Messproblems beschrieben werden können. Er rahmte dies als ein Puzzle ein, bei dem das Ziel darin besteht, eine verborgene Karte der Effekte aus einer Reihe partieller Beobachtungen zu rekonstruieren. Jede Beobachtung ist eine spezifische Intervention, wie etwa das Ändern einiger Wörter in einem Prompt oder das Verändern eines spezifischen internen Signals, und das Ergebnis ist ein Datenpunkt, der hilft, die Karte zu vervollständigen. Die Herausforderung besteht darin, dass die Maschine nicht perfekt linear ist; ihre Teile interagieren auf komplexe Weise, und das „Rauschen“ der Messung hängt davon ab, wie groß der Anstoß ist.

Um diesen Rahmen zu testen, begannen die Forscher in einer kontrollierten Umgebung, in der sie die exakte Antwort im Voraus kannten. Sie bauten eine Simulation mit einem einfachen probabilistischen System auf, wie etwa einem Hidden-Markov-Modell, das als perfekter Referenzpunkt dient. In diesem Setting konnten sie einen „Windkanal“ für die KI erschaffen, in dem sie genau wussten, wie der interne Überlebenszustand (Belief State) der Maschine sein sollte. Sie testeten dann, wie gut verschiedene Messmethoden das Verhalten der Maschine vorhersagen konnten, wenn diese zur Steuerung verwendet wurde. Sie fanden eine direkte Verbindung zwischen der Genauigkeit der internen Messung und dem Erfolg der Steuerung. Wenn die Messung auch nur leicht ungenau war, schlug die Steuerungsaktion fehl. Wichtiger noch: Sie entdeckten, dass eine Messung erfolgreich erscheinen konnte, indem sie das Hauptziel verbesserte, dabei aber versehentlich einen anderen, unzusammenhängenden Teil des Systems störte. Dies bewies, dass es nicht ausreicht, lediglich zu sehen, dass eine Maschine bei einer Aufgabe besser wird; man muss verifizieren, dass die interne Erklärung tatsächlich mit der ausgeführten Aktion übereinstimmt.

Beim Übergang von Simulationen zu realen, vortrainierten Modellen wandten die Forscher ihr schrittweises Verfahren an, um zu sehen, wie weit einfache Messungen reichen können. In einem Experiment mit einem Modell, das darauf trainiert wurde, indirekte Objekte in Sätzen zu identifizieren, gingen sie davon aus, dass das Verhalten der Maschine eine einfache Summe einzelner Teile sei. Sie maßen den Effekt des Entfernens spezifischer Gruppen interner Komponenten. Das einfache Modell funktionierte anfangs gut, aber als sie es an neuen, ungesehenen Kombinationen von Teilen testeten, konnte es das Ergebnis nicht genau vorhersagen. Der Fehler war nicht zufällig; er war strukturiert. Es stellte sich heraus, dass die Maschine auf Interaktionen zwischen den Teilen angewiesen war. Zum Beispiel wurde eine Gruppe von Komponenten erst dann wichtig, wenn eine andere Gruppe bereits geschwächt war. Durch das Hinzufügen von Messungen, die speziell darauf ausgelegt waren, diese Interaktionen zu erfassen, konnten die Forscher die Vorhersagefehler korrigieren. Sie fanden heraus, dass ein spezifisches Paar von Komponentengruppen für den größten verbleibenden Fehler verantwortlich war, und dass das Hinzufügen genau dieses einen Interaktionsterms die Vorhersagen der Modelle nahezu perfekt machte.

In einem zweiten Experiment mit einem viel größeren, modernen Modell, das darauf ausgelegt ist, Instruktionen zu folgen, fragten die Forscher, ob sie nach diesen komplexen Interaktionen suchen müssten. Sie begannen mit demselben einfachen, additiven Ansatz und kalibrierten ihn mit einigen zusätzlichen Messungen, um die Größe des Anstoßes zu berücksichtigen. Dieses Mal funktionierte das einfache Modell fast perfekt. Es sagte das Verhalten des Modells bei neuen, ungesehenen Prompts mit extrem hoher Genauigkeit voraus. Als sie versuchten, die komplexen Interaktionsmessungen hinzuzufügen, verbesserte sich das Ergebnis nicht. Die zusätzliche Komplexität war unnötig. Dieses Ergebnis war ebenso wichtig wie das erste: Es zeigte, dass man nicht davon ausgehen sollte, dass eine Maschine komplex ist, nur weil sie groß ist. Manchmal ist eine einfache Erklärung ausreichend, und das Hinzufügen weiterer Ebenen der Messung erhöht nur die Kosten, ohne einen Mehrwert zu bieten.

Das Paper schließt mit einem praktischen Leitfaden für jeden ab, der diese Maschinen verstehen möchte. Der Rat lautet: Beginnen Sie mit der einfachsten, kostengünstigsten Messung, die das Verhalten erklären könnte. Wenn das funktioniert, hören Sie auf. Wenn es fehlschlägt, untersuchen Sie das Muster des Scheiterns. Wenn der Fehler nur eine Frage der Skalierung ist, kann eine einfache Korrektur helfen. Wenn der Fehler darauf hindeutet, dass Teile auf eine Weise zusammenarbeiten, die das einfache Modell nicht sieht, dann entwerfen Sie neue Messungen, um diese Interaktionen zu erfassen. Testen Sie die Erklärung schließlich immer an einer Aufgabe, für die sie nie trainiert wurde, oder in einer Kontrollschleife, in der sie eine Aktion steuert. Das Ziel ist nicht nur, ein Bild der Maschine zu rekonstruieren, sondern einen Beobachter zu bauen, der zuverlässig vorhersagen kann, was die Maschine tun wird, wenn die reale Welt an ihr zieht. Dieser Ansatz verschiebt den Fokus von der Suche nach dem „wahren“ internen Mechanismus hin zur Suche nach der nützlichsten und zuverlässigsten Art, ihn für einen spezifischen Zweck zu messen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →