← Neueste Arbeiten
💬 NLP

A Unifying Perspective on Language Model Representations: From Filler-Role Structure to Mechanistic Interpretability

Dieses Paper schlägt Tensor-Produkt-Repräsentationen (TPRs) als ein vereinendes Framework vor, das mathematisch und empirisch demonstriert, wie diverse Interpretierbarkeit-Methoden für Sprachmodelle, wie etwa lineares Probing und Sparse Autoencoder, aus einer einzigen zugrunde liegenden Struktur von Filler-Role-Bindings abgeleitet werden können.

Ursprüngliche Autoren: Zhang Enyan, R. Thomas McCoy

Veröffentlicht 2026-09-01
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Zhang Enyan, R. Thomas McCoy

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der stillen, summenden Welt der künstlichen Intelligenz versuchen Forscher zu verstehen, wie massive Computerprogramme, bekannt als Sprachmodelle, tatsächlich denken. Diese Systeme können Poesie schreiben, mathematische Probleme lösen und Gespräche führen, aber in ihren digitalen Gehirnen sind Informationen als lange Listen von Zahlen gespeichert. Jahrelang haben Wissenschaftler verschiedene Werkzeuge verwendet, um in diese Black Boxes hineinzublicken, wobei sie feststellten, dass die Modelle Informationen auf überraschend geordnete Weise zu organisieren scheinen. Einige Werkzeuge zeigen, dass die Modelle Rätsel lösen können, indem sie diese Zahlenlisten addieren und subtrahieren, während andere offenbaren, dass bestimmte Teile des Modells aufleuchten, wenn sie auf ein bestimmtes Wort oder eine bestimmte Idee stoßen. Doch diese Entdeckungen blieben isoliert, wie separate Hinweise, die in verschiedenen Zimmern eines dunklen Hauses gefunden wurden. Die große Frage war, ob es eine einzige, zugrunde liegende Struktur gibt, die all diese unterschiedlichen Verhaltensweisen erklärt, oder ob die Modelle nur ein chaotisches Durcheinander unzusammenhängender Tricks sind.

Ein Team von Forschern der Yale University hat eine vereinende Antwort auf dieses Rätsel vorgeschlagen. Sie legen nahe, dass diese komplexen Sprachmodelle auf einem spezifischen architektonischen Prinzip aufgebaut sind, das Tensor Product Representation genannt wird. Vereinfacht ausgedrückt bedeutet dies, dass die Modelle Informationen speichern, indem sie zwei Dinge eng miteinander verknüpfen: den Inhalt einer Idee (wie ein bestimmtes Wort) und deren Rolle in einem Satz (wie etwa, ob es das Subjekt oder das Objekt ist). Stellen Sie sich ein Ablagesystem vor, in dem jede Information nicht nur dadurch gespeichert wird, was sie ist, sondern auch dadurch, wo genau sie hingehört. Die Forscher fanden heraus, dass diese einfache, strukturierte Art der Datenorganisation eine breite Palette zuvor unzusammenhängender Entdeckungen erklären kann. Sie erklärt, warum die Modelle mathematische Analogien durchführen können, warum einfache Tests verborgene Konzepte offenlegen können und warum die Änderung eines einzigen Teils des internen Zustands eines Modells dessen Verhalten auf vorhersehbare Weise verändern kann.

Um diese Idee zu testen, verließ sich das Team nicht nur auf die Theorie; sie bauten ein neues Werkzeug, das als Übersetzer fungiert. Sie entwickelten ein System, das die bekannte Struktur eines Satzes – die Identifizierung von Subjekt, Verb und Objekt – nimmt und sie in die spezifischen Zahlenmuster umwandelt, die die Modelle verwenden. Sie verglichen diese übersetzte Version dann mit den tatsächlichen internen Abläufen mehrerer verschiedener Computermodelle, die von kleinen, einfachen Netzwerken bis hin zu massiven, hochmodernen Sprachsystemen reichten. Die Ergebnisse waren bemerkenswert konsistent. In Tests mit Zahlensequenzen und strukturierten englischen Sätzen entsprach die strukturelle Übersetzung der Forscher den internen Zuständen der Modelle mit extrem hoher Präzision. Bei den einfacheren Modellen war die Übereinstimmung nahezu perfekt und erfasste fast die gesamte Variation in der Art und Weise, wie die Modelle Informationen verarbeiteten. Selbst bei den größten, komplexesten Sprachmodellen erfasste die Übersetzung den Großteil der Informationen, was darauf hindeutet, dass diese riesigen Systeme trotz ihrer Größe auf derselben grundlegenden Methode der Bindung von Inhalt an Position beruhen.

Die Stärke dieses Befundes liegt darin, wie er verschiedene Untersuchungsmethoden miteinander verbindet. Die Forscher zeigten, dass die mathematische Logik hinter ihrer strukturellen Übersetzung genutzt werden kann, um die Ergebnisse von vier bedeutenden Interpretierbarkeitstechniken, die Wissenschaftler heute verwenden, zu rekonstruieren. Erstens erklärten sie, warum Sprachmodelle „additive Analogien“ durchführen können, ein Phänomen, bei dem das Subtrahieren eines Konzepts von einem anderen und das Addieren eines dritten ein viertes verwandtes Konzept ergibt. Ihre Arbeit demonstrierte, dass dies geschieht, weil die Modelle im Wesentlichen die Differenz zwischen spezifischen Inhalts-und-Rollen-Paarungen berechnen. Zweitens zeigten sie, dass „lineare Sonden“ (linear probes), einfache Tests, die dazu dienen zu erkennen, ob ein Modell ein bestimmtes Faktum kennt, eigentlich nur eine Art sind, die Rolle vom Inhalt zu entbinden, um die ursprüngliche Idee abzurufen. Drittens erklärten sie, dass „Sparse Autoencoder“, die komplexe Signale in einfachere Teile zerlegen, effektiv dieselben Inhalts-und-Rollen-Bindungen identifizieren. Schließlich demonstrierten sie, dass „Activation Patching“, eine Technik, bei der Forscher Teile des Gehirns eines Modells austauschen, um zu sehen, wie sich das Verhalten ändert, deshalb funktioniert, weil sie direkt diese spezifischen strukturellen Bindungen austauschen.

In einer Reihe von Experimenten bewies das Team, dass sie in der Lage sind, diese vier verschiedenen Testwerkzeuge von Grund auf neu zu bauen, ohne sie zuvor auf den Modellen trainieren zu müssen. Wenn sie diese konstruierten Werkzeuge zur Analyse der Modelle verwendeten, schnitten sie genauso gut ab wie die im Fachbereich üblichen, intensiv trainierten Werkzeuge. Wenn sie beispielsweise ihre Methode nutzten, um vorherzusagen, welches Wort als Nächstes in einem Satz erscheinen würde, oder um das Subjekt eines Satzes zu identifizieren, war die Genauigkeit nahezu identisch mit den besten existierenden Methoden. In einem spezifischen Test mit einem großen Sprachmodell war der Unterschied zwischen der strukturellen Vorhersage der Forscher und der Standardmethode so gering, dass er fast unsichtbar war, mit einem Korrelationswert von nahezu eins. Dies deutet darauf hin, dass die komplexen, gelernten Verhaltensweisen dieser Modelle nicht mysteriös oder zufällig sind, sondern direkte Folgen dieser zugrunde liegenden strukturellen Regel.

Die Forscher untersuchten auch, wie gut diese Struktur standhält, wenn die Modelle mit neuen Situationen konfrontiert werden. Sie trainierten ihren strukturellen Übersetzer auf einem Satz von Sätzen und testeten ihn dann an Sätzen, die Wörter und Rollen enthielten, die er noch nie gesehen hatte. Der Übersetzer generalisierte erfolgreich und rekonstruierte den internen Zustand des Modells für diese neuartigen Kombinationen präzise. Dies deutet darauf hin, dass die Modelle nicht einfach spezifische Beispiele auswendig lernen, sondern ein flexibles System verwenden, um neue Inhalte mit bekannten Rollen zu kombinieren. Die Studie behauptete nicht, jedes Geheimnis der künstlichen Intelligenz gelöst zu haben, noch deutete sie darauf hin, dass alle Modelle identisch seien. Sie lieferte jedoch starke Beweise dafür, dass ein einziger, kohärenter Rahmen erklären kann, wie diese Systeme die Welt repräsentieren. Indem sie zeigten, dass diverse Interpretierbarkeitsmethoden alle auf dieselbe strukturelle Realität hindeuten, führt die Arbeit das Feld näher zu einem einheitlichen Verständnis darüber, wie neuronale Netze funktionieren, und verwandelt eine Sammlung isolierter Beobachtungen in ein einziges, kohärentes Bild des maschinellen Geistes.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →