← Neueste Arbeiten
🤖 AI

RACE: Scalable Statistical Estimation of Functional Consistency in LLM Neurons

Das Papier stellt RACE vor, ein recheneffizientes Forward-Pass-Statistik-Framework, das die domänenweite funktionale Konsistenz von Transformer-Neuronen evaluiert und dabei eine überlegene Skalierbarkeit sowie Spezifität im Vergleich zu bestehenden gradientenbasierten Methoden demonstriert.

Ursprüngliche Autoren: Runyu Wang, Bo Liu, Xiaxin Zhang, Yu Han, Jiawei Cao, Xiaoye Zhang, Zhe Zhang, Yifan Yang, Peng Ping

Veröffentlicht 2026-08-26
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Runyu Wang, Bo Liu, Xiaxin Zhang, Yu Han, Jiawei Cao, Xiaoye Zhang, Zhe Zhang, Yifan Yang, Peng Ping

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In den riesigen, digitalen Geistern moderner künstlicher Intelligenz existiert eine verborgene Ebene der Aktivität, die Forscher erst jetzt zu kartieren beginnen. Diese Systeme, bekannt als große Sprachmodelle, denken nicht in Sätzen oder Absätzen, wie es Menschen tun. Stattdessen verarbeiten sie Informationen durch Milliarden winziger, miteinander verbundener Schalter, die Neuronen genannt werden. Wenn Sie einen Computer bitten, ein Gedicht zu schreiben, ein mathematisches Problem zu lösen oder eine Zeile Code zu debuggen, leuchten spezifische Gruppen dieser Neuronen auf, um die Arbeit auszuführen. Jahrelang haben Wissenschaftler darum gerungen zu verstehen, welche Neuronen für welche Aufgaben verantwortlich sind. Die Schwierigkeit liegt im schieren Ausmaß der Operation; diese Modelle sind so komplex, dass das Beobachten ihrer Arbeit oft so wirkt, als versuche man, eine Stadt zu verstehen, indem man nur eine einzige Straßenlaterne betrachtet. Frühere Methoden zur Findung der richtigen Schalter waren entweder zu langsam für die Praxis oder so sehr auf einzelne Momente fokussiert, dass sie das größere Bild dessen verpassten, wie sich das System über die Zeit verhält.

Ein Team von Forschern hat nun eine neue Art eingeführt, in diese digitalen Geister hineinzuhören – eine Methode, die sie RACE nennen. Anstatt zu versuchen, das gesamte System zu dekonstruieren oder den Einfluss jeder einzelnen Verbindung zu berechnen, behandelt dieser Ansatz die interne Aktivität des Modells als ein statistisches Muster. Die Forscher erkannten, dass Neuronen, die einem bestimmten Zweck dienen, wie etwa dem Schreiben von Python-Code oder dem Lösen von Algebra, nicht einfach zufällig feuern. Stattdessen tragen sie auf eine konsistente, stabile Weise zum internen Zustand des Modells bei, wann immer diese spezifische Art von Aufgabe ausgeführt wird. Durch das Verfolgen dieser konsistenten Beiträge über Tausende von Beispielen hinweg kann das Team identifizieren, welche Neuronen die wahren Spezialisten für eine bestimmte Aufgabe sind. Hierbei geht es nicht darum, ein Neuron zu finden, das einmal feuert und dann wieder vergisst; es geht darum, diejenigen zu finden, die zuverlässig zur Arbeit erscheinen, wann immer das Modell zu etwas Spezifischem aufgefordert wird.

Der Kern dieser Entdeckung ist ein Wechsel in der Art und Weise, wie Wissenschaftler Bedeutung messen. Ältere Techniken beruhten oft auf komplexen Berechnungen, die den Computer dazu zwangen, rückwärts durch seine eigene Logik zu laufen – ein Prozess, der unglaublich langsam und rechenintensiv war. Die neue Methode, RACE, arbeitet in einem einzigen Vorwärtsschritt (forward pass) und beobachtet, wie das Modell Informationen verarbeitet, während sie natürlich von Anfang bis Ende fließen. Sie betrachtet die winzigen Aktualisierungen, die jedes Neuron an den internen Informationsstrom des Modells vornimmt. Wenn ein Neuron das Denken des Modells konsequent in die richtige Richtung für eine spezifische Aufgabe drängt, erhält es eine hohe Punktzahl. Wenn sein Verhalten erratisch ist oder wenn es nur in wenigen seltenen Fällen hilft, wird es ignoriert. Dies ermöglicht es den Forschern, eine zuverlässige Karte der Fähigkeiten des Modells zu erstellen, ohne anhalten und jedes mögliche Ergebnis berechnen zu müssen.

Um zu testen, ob diese Karte genau war, führten die Forscher eine Reihe kontrollierter Experimente an mehreren verschiedenen großen Sprachmodellen durch, die von kleineren Modellen mit 4 Milliarden Parametern bis hin zu massiven Modellen mit 32 Milliarden Parametern reichten. Sie konzentrierten sich auf drei unterschiedliche Bereiche: das Schreiben von Computercode, das Lösen mathematischer Probleme und die Steuerung spezifischer Verhaltensweisen, wie etwa die Verwendung einer bestimmten Satzstruktur. In jedem Fall nutzten sie die RACE-Methode, um die führenden Neuronen zu identifizieren, die für diese Aufgabe verantwortlich sind. Dann führten sie eine feine Operation durch: Sie brachten diese spezifischen Neuronen vorübergehend zum Schweigen, während das Modell arbeitete.

Die Ergebnisse waren beeindruckend. Als die Forscher die durch RACE identifizierten Neuronen für Programmieraufgaben stummgeschaltet hatten, sank die Fähigkeit des Modells, korrekten Code zu schreiben, signifikant, während seine Fähigkeit, allgemeine Fragen zu beantworten oder mathematische Probleme zu lösen, weitgehend intakt blieb. Dasselbe galt für die Mathematik; das Ausschalten der Mathematik-Neuronen beeinträchtigte die Denkfähigkeiten des Modells massiv, ohne dessen allgemeine Sprachfähigkeiten zu beeinflussen. Dies bestätigte, dass die Methode erfolgreich die spezifischen Komponenten isoliert hatte, die für diese Fähigkeiten verantwortlich sind. Im Gegensatz dazu war der Schaden bei der Verwendung älterer, weniger präziser Methoden zur Auswahl der auszuschaltenden Neuronen oft weit verbreitet und beeinträchtigte die Leistung des Modells insgesamt, anstatt nur eine einzige Fertigkeit zu treffen.

Eine der wichtigsten Erkenntnisse war der Unterschied zwischen den zwei Haupttypen von Neuronen innerhalb dieser Modelle. Die Forscher fanden heraus, dass die Neuronen, die für mathematisches Denken und Programmierung verantwortlich waren, hochspezialisiert waren und selten zwischen Aufgaben geteilt wurden. Die Neuronen, die jedoch an der Aufmerksamkeit (Attention) beteiligt waren – dem Teil des Modells, der entscheidet, auf welche Wörter man sich konzentriert –, waren viel allgemeiner. Diese Attention-Neuronen schienen wiederverwendbare Werkzeuge zu sein, die dem Modell bei fast allem halfen, von der Poesie bis hin zur Lösung von Gleichungen. Diese Unterscheidung erklärt, warum einige Teile des Modells leichter zu beschneiden oder zu modifizieren sind als andere; die spezialisierten Teile sind wie dedizierte Werkzeuge in einer Werkstatt, während die Attention-Teile wie die Hände sind, die sie halten.

Die Forscher entdeckten auch, dass ihre Methode unglaublich effizient war. Während frühere Techniken erforderten, dass der Computer Berechnungen durchführte, die dem einhundertvierundvierzigfachen Durchlauf des Modells entsprachen, um die Neuronen zu bewerten, benötigte die neue Methode weniger als einen einzigen vollständigen Durchlauf. Diese Geschwindigkeit macht es möglich, viel größere Modelle als je zuvor zu analysieren und zu prüfen. Es bedeutet auch, dass Entwickler in Zukunft potenziell diese Technik nutzen könnten, um Modelle fein abzustimmen, unerwünschte Verhaltensweisen zu entfernen oder spezifische Fähigkeiten zu verbessern, ohne das gesamte System von Grund auf neu trainieren zu müssen.

Die Studie untersuchte auch, wie sich diese spezialisierten Neuronen verhalten, wenn das Modell gebeten wird, etwas leicht anderes zu tun, als es trainiert wurde. Als die Forscher das Modell mit neuen, ungesehenen Mathematikproblemen testeten, verursachten die durch RACE identifizierten Neuronen auch dann noch einen signifikanten Leistungsabfall, wenn sie ausgeschaltet wurden. Dies deutet darauf hin, dass die Methode die grundlegende Mechanik der Fertigkeit findet und nicht nur ein auswendig gelerntes Muster für eine bestimmte Gruppe von Fragen. Die Fähigkeit des Modells, sein Wissen zu generalisieren, beruht auf eben diesen stabilen Neuronen.

Eine vielleicht subtilere Entdeckung betraf die Fähigkeit des Modells, spezifische stilistische Entscheidungen zu treffen, wie etwa das Schreiben von Python-Code, der eine bestimmte Art von Listenstruktur verwendet. Die Forscher trainierten das System, diesen spezifischen Stil zu erkennen, und schaltesten dann die entsprechenden Neuronen stumm. Das Ergebnis war ein Modell, das zwar noch korrekten Code schreiben konnte, aber fast vollständig aufhörte, diesen spezifischen Stil zu verwenden, selbst wenn es auf andere Arten immer noch korrekten Code schreiben konnte. Diese Präzision deutet darauf hin, dass die Methode in der Lage ist, sehr enge Verhaltensweisen zu isolieren, was eine Möglichkeit bietet, den Output des Modells mit chirurgischer Genauigkeit zu steuern.

Die Forscher räumen ein, dass ihre Methode keine perfekte Lösung für jedes Problem ist. Sie fanden heraus, dass sie am besten für die Teile des Modells funktioniert, die Informationen auf eine direkte, additive Weise verarbeiten, aber weniger effektiv darin ist, die komplexeren, überlappenden Interaktionen abzubilden, die in den Attention-Mechanismen ablaufen. Sie stellen auch fest, dass die Methode auf linearen Mustern basiert, was bedeutet, dass sie einige der komplexeren, nicht-linearen Arten, wie Neuronen zusammenwirken, möglicherweise übersieht. Dennoch bot der Ansatz für die überwiegende Mehrheit der getesteten Aufgaben einen klaren, zuverlässigen und schnellen Weg, um zu verstehen, was das Modell tut.

Diese Arbeit stellt einen bedeutenden Schritt nach vorn im Bereich der mechanistischen Interpretierbarkeit dar, die darauf abzielt, die „Black Box“ der künstlichen Intelligenz zu öffnen. Indem sie einen Weg bereitgestellt haben, spezifische funktionale Komponenten innerhalb dieser massiven Systeme zu identifizieren und zu isolieren, haben die Forscher uns ein neues Set an Werkzeugen gegeben, um die Technologie, die unsere Welt zunehmend prägt, zu verstehen, zu debuggen und zu verbessern. Die Fähigkeit, genau zu bestimmen, welche Teile eines Modells für eine bestimmte Fähigkeit verantwortlich sind, bedeutet, dass wir über das bloße Raten hinausgehen und damit beginnen können, fundierte Entscheidungen darüber zu treffen, wie diese Systeme gebaut werden und wie sie eingesetzt werden sollten. Der Weg nach vorn besteht nicht mehr darin, zu versuchen, die ganze Stadt auf einmal zu verstehen, sondern darin, in der Lage zu sein, eine bestimmte Straße hinunterzugehen und genau zu wissen, was dort geschieht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →