How Much Do Circuits Tell Us? Measuring the Consistency and Specificity of Language Model Circuits
Dieser Artikel zeigt, dass zwar identifizierte Schaltkreise in Sprachmodellen für die Aufgabenerfüllung hochkonsistent und notwendig sind, ihnen jedoch die Aufgabenspezifität aufgrund erheblicher Überschneidungen zwischen verschiedenen Aufgaben fehlt, wodurch die Nützlichkeit des Rahmens für gezielte Eingriffe und das Verständnis infrage gestellt wird.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich eine riesige, komplexe Fabrik (ein Large Language Model) vor, die alle möglichen Probleme lösen kann, von mathematischen Berechnungen bis zum Erzählen von Witzen. Seit langem versuchen Wissenschaftler herauszufinden, welche Maschinen innerhalb dieser Fabrik genau für welche Aufgaben verantwortlich sind. Sie bezeichnen diese spezifischen Gruppen von Maschinen als „Schaltkreise".
Diese Arbeit stellt zwei einfache Fragen zu diesen Schaltkreisen:
- Konsistenz: Wenn die Fabrik dieselbe Aufgabe (wie das Addieren von Zahlen) zehnmal ausführt, nutzt sie dann jedes Mal exakt dieselben Maschinen?
- Spezifität: Nutzt die Fabrik bei einer mathematischen Aufgabe andere Maschinen als bei einer historischen Aufgabe?
Hier ist das, was die Forscher unter Verwendung einfacher Analogien herausfanden:
1. Der „Konsistenz"-Test: Ja, sie sind zuverlässig.
Die Forscher überprüften, ob die Fabrik für dieselbe Aufgabe dieselben Werkzeuge verwendet.
- Das Ergebnis: Ja! Wenn die Fabrik aufgefordert wird, Zahlen zu addieren, nutzt sie zuverlässig einen bestimmten Satz von Maschinen (hauptsächlich die „MLP-Schichten", die wie die robusten Werkbänke der Fabrik sind) für fast jedes einzelne mathematische Problem.
- Die Analogie: Es ist wie ein Koch, der einen bestimmten Kuchen backt. Jedes Mal, wenn er diesen Kuchen backt, verwendet er denselben Mixer und denselben Ofen. Er wechselt nicht auf einen Mixer oder einen Toaster mitten im Prozess. Die Forscher stellten fest, dass, wenn sie diese spezifischen Maschinen „aussteckten", die Fabrik diese Aufgabe fast vollständig einstellte. Dies beweist, dass diese Maschinen die Arbeit tatsächlich verrichten und nicht nur herumstehen, um beschäftigt zu wirken.
2. Der „Spezifität"-Test: Nein, sie sind nicht einzigartig.
Dies ist der überraschende Teil. Die Forscher erwarteten, dass die für „Mathematik" verwendeten Maschinen völlig anders sein würden als die für „Geschichte" oder „Logik" verwendeten Maschinen.
- Das Ergebnis: Sie lagen falsch. Die für Mathematik verwendeten Maschinen sind fast genau dieselben Maschinen, die auch für Geschichte, Logik und sogar Textverständnis verwendet werden.
- Die Analogie: Stellen Sie sich vor, Sie haben eine Werkzeugkiste. Sie dachten, die „Mathematik-Box" enthalte nur mathematische Werkzeuge (Lineale, Rechner) und die „Geschichts-Box" nur geschichtliche Werkzeuge (Karten, Bücher). Doch als Sie sie öffneten, stellten Sie fest, dass beide Boxen zu 90 % dieselben Werkzeuge enthielten.
- Wenn Sie die „Mathematik-Werkzeuge" aus der Werkzeugkiste entfernten, könnte die Fabrik keine Mathematik mehr betreiben.
- Aber wenn Sie diese gleichen Werkzeuge entfernten, könnte die Fabrik auch keine Geschichte oder Logik mehr betreiben.
- Es stellt sich heraus, dass die Fabrik für alles auf eine massive, gemeinsame „Infrastruktur" (die Werkbänke/MLP-Schichten) angewiesen ist. Diese Werkzeuge sind das Fundament für alle Aufgaben, nicht nur für eine.
3. Die „versteckten Juwelen": Ein winziger Hauch von Einzigartigkeit.
Gibt es irgendeinen Unterschied zwischen den Aufgaben?
- Das Ergebnis: Ja, aber er ist sehr klein. Innerhalb des großen Haufens gemeinsamer Werkzeuge gibt es eine winzige, spezialisierte Menge an Werkzeugen (etwa 10–30 % des Gesamtvolumens), die für die spezifische Aufgabe einzigartig sind.
- Die Analogie: Zurück zur Werkzeugkiste: Während 90 % der Werkzeuge gemeinsam genutzt werden, enthält die „Mathematik-Box" einen winzigen, speziellen Rechner, den die „Geschichts-Box" nicht hat. Wenn Sie nur diesen Rechner entfernen, versagt die Mathematik, aber die Geschichte funktioniert weiterhin. Da jedoch die gemeinsamen 90 % so riesig und wichtig sind, bricht beim Entfernen der gesamten „Mathematik-Box" alles zusammen, was den Anschein erweckt, als wären die Mathematik-Werkzeuge das Einzige, das zählte.
Das große Ganze
Die Arbeit kommt zu dem Schluss, dass wir, wenn wir Sprachmodelle auf der Ebene der „Attention-Heads" und „MLP-Schichten" (die großen, sichtbaren Teile der Fabrik) betrachten, hauptsächlich die allgemeine Infrastruktur des Gebäudes sehen und nicht die spezifischen Baupläne für jede einzelne Aufgabe.
- Was dies für das Verständnis bedeutet: Wir können leicht die „Werkbänke" finden, die das Modell nutzt, aber wir können nicht leicht unterscheiden, welche Werkbank nur für Mathematik und welche nur für Geschichte ist, da sie alle für beides genutzt werden.
- Die Einschränkung: Die Forscher schlagen vor, dass wir, um die wirklich einzigartigen „spezialisierten Werkzeuge" (die winzigen 10 %) zu finden, möglicherweise genauer hinsehen müssen, vielleicht auf die einzelnen Schrauben oder Drähte (Neuronen oder Merkmale) statt auf die gesamte Werkbank.
Kurz gesagt: Das Modell ist konsistent (es nutzt dieselben Werkzeuge für dieselbe Aufgabe), aber es ist nicht spezifisch (es nutzt dieselben Werkzeuge für jede Aufgabe). Die „Schaltkreise", die wir finden, sind größtenteils das gemeinsame Fundament des Modells und nicht die einzigartigen Anweisungen für eine einzelne Aufgabe.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.