← Neueste Arbeiten
💬 NLP

WhiteMatter: All-to-All Cross-Layer Connections via KV Mixing

WhiteMatter ist eine neuartige Transformer-Architektur, die durch den Einsatz eines Routers zur Mischung aller Schicht-Token-Zustände in einen komprimierten Satz von KV-Kanälen die Leistung steigert und den Speicherbedarf reduziert, wodurch dynamische, token-adaptive All-zu-All-Verbindungen über alle Schichten hinweg während der autoregressiven Dekodierung ermöglicht werden.

Ursprüngliche Autoren: Wenbo Zhang, Xiang Ren

Veröffentlicht 2026-08-20
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Wenbo Zhang, Xiang Ren

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Moderne künstliche Intelligenz, die Texte generiert, stützt sich auf eine Struktur namens Transformer, die Informationen in einer Serie von gestapelten Schichten verarbeitet. Stellen Sie sich eine Fabrik-Montageband vor, bei dem ein Rohmaterial Station eins durchläuft, dann Station zwei und so weiter, wobei jede Station das Produkt verfeinert. In einem Standardaufbau kann das System, wenn es zum nächsten Textstück übergeht, nur auf die Arbeit der Station direkt darüber im vorherigen Schritt zurückblicken. Das bedeutet, dass die tieferen, komplexeren Erkenntnisse, die an der Spitze des Stapels gebildet werden, für die unteren, früheren Stationen oft unzugänglich sind, wenn diese neue Informationen verarbeiten. Obwohl das System eine reiche Historie des Verständnisses geschaffen hat, hat es Schwierigkeiten, diese volle Tiefe effizient zu nutzen, was die Fähigkeit einschränkt, langfristigen Kontext zu verfolgen oder komplexe Probleme zu lösen.

Forscher der University of Southern California haben eine neue Architektur namens WhiteMatter vorgeschlagen, um diesen Engpass zu lösen. Anstatt jede Schicht auf ihre eigene Tiefe zu beschränken, erlaubt WhiteMatter jedem Teil des Systems, auf eine gemischte Zusammenfassung von Informationen aus jeder einzelnen Schicht der Vergangenheit zuzugreifen. Das Team entwickelte einen Mechanismus, der wie ein dynamischer Router fungiert, der die verborgenen Zustände aller Schichten eines vorherigen Wortes nimmt und sie zu einem kleineren Satz gemeinsamer Kanäle vermischt. Jede Schicht des aktuellen Wortes wählt dann einen dieser Kanäle aus, um daraus zu lesen. Dieses Design ahmt die Art und Weise nach, wie das menschliche Gehirn durch weiße Substanzfasern entfernte Regionen verbindet, wodurch flache Teile des Netzwerks tiefe, verarbeitete Informationen aus der Vergangenheit erhalten können, während tiefe Teile immer noch auf den rohen, unmittelbaren Kontext zugreifen können.

Die Forscher testeten dieses System, indem sie Modelle von Grund auf mit einem massiven Datensatz von acht Milliarden Text-Token trainierten. Sie verglichen ihre neuen WhiteMatter-Modelle mit Standardmodellen derselben Größe und mit wesentlich größeren Standardmodellen. Die Ergebnisse zeigten, dass ein WhiteMatter-Modell mit sechzehn Schichten besser abschnitt als ein Standardmodell mit vierundzwanzig Schichten und eine signifikant niedrigere Fehlerrate bei der Vorhersage des nächsten Wortes erreichte. Diese Verbesserung wurde erzielt, selbst als die Forscher den für das System erforderlichen Speicherplatz um die Hälfte komprimierten, was bewies, dass das Modell seine hohe Leistungsfähigkeit beibehalten konnte, während es weniger Speicher verwendete. Die Studie zeigte auch, dass das System effizient mit einer spezifischen iterativen Methode trainiert werden konnte, die es dem Computer ermöglicht, viele Wörter gleichzeitig zu verarbeiten, anstatt gezwungen zu sein, sie nacheinander abzuarbeiten, was für solch tiefe Verbindungen normalerweise erforderlich ist.

Die Kerninnovation liegt darin, wie das System das Gedächtnis vergangener Wörter handhabt. In einem typischen Aufbau wird das Gedächtnis für ein Wort Schicht für Schicht gespeichert, und das nächste Wort kann nur auf das Gedächtnis in derselben Tiefe zugreifen. WhiteMatter bricht diese Regel, indem es einen Pool von Gedächtniskanälen erstellt, die basierend auf dem Inhalt des Wortes selbst aktualisiert werden. Ein Router analysiert die verborgenen Zustände aller Schichten eines vergangenen Wortes und vermischt sie in einige wenige Kanäle. Die Anzahl dieser Kanäle kann angepasst werden; die Forscher fanden heraus, dass die Verwendung weniger Kanäle als die Gesamtzahl der Schichten den Speicherbedarf reduzierte, ohne die Fähigkeit des Modells zu beeinträchtigen, komplexe Texte zu verstehen. Diese Flexibilität ermöglicht es dem System, effizienter zu sein, da es nicht die Historie jeder einzelnen Schicht in voller Detailtiefe speichern muss, sondern nur die relevantesten Mischungen.

Um dies während der Trainingsphase umzusetzen, mussten die Forscher eine kreisförmige Abhängigkeit überwinden. Da das Gedächtnis für ein Wort von der Verarbeitung dieses Wortes abhängt und die Verarbeitung wiederum vom Gedächtnis abhängt, kann das System nicht einfach alles in einem einzigen Durchgang berechnen. Das Team entwickelte eine Methode namens zyklische Gauss–Seidel-Iteration, die den Text in Gruppen verarbeitet. Dies ermöglicht es dem System, sein Verständnis in Stufen zu aktualisieren, wobei spätere Gruppen in einer Sequenz unmittelbar die aktualisierten Informationen aus früheren Gruppen innerhalb desselben Durchgangs nutzen können. Dieser Ansatz erwies sich als signifikant schneller als bisherige Methoden, die viele mehr Durchgänge erforderten, um dieselbe Genauigkeit zu erreichen, was das Training solcher tiefen, miteinander vernetzten Modelle auf Standard-Hardware praktikabel machte.

Experimente bestätigten, dass diese Architektur nicht nur die Qualität des generierten Textes verbessert, sondern auch die Leistung des Modells bei verschiedenen Denkaufgaben steigert. Bei Tests auf Standard-Benchmarks für Sprachverständnis schnitten die WhiteMatter-Modelle konsistent besser ab als ihre Standard-Gegenstücke gleicher Tiefe und übertrafen sogar größere Standardmodelle. Die Halb-Speicher-Konfiguration, die nur acht Kanäle für ein sechzehnschichtiges Modell verwendete, behielt den Großteil der Leistungsgewinne bei und verbrauchte gleichzeitig signifikant weniger Speicher als ein voller Cache. Dies deutet darauf hin, dass die Fähigkeit, das Gedächtnis aus allen Tiefen dynamisch zu mischen, wertvoller ist als einfach nur die Größe des Speicherplatzes zu erhöhen.

Die Studie untersuchte auch, wie das System unter verschiedenen Trainingsbedingungen reagiert. Die Forscher fanden heraus, dass die spezifische Art und Weise, wie das System während des Trainings durch die Daten iteriert, einen großen Einfluss auf seine endgültige Leistung hat. Modelle, die mit einem Zeitplan trainiert wurden, der den endgültigen, schrittweisen Dekodierungsprozess eng nachahmt, schnitten besser ab und waren stabiler. Dennoch schnitten die WhiteMatter-Modelle selbst mit einem einfacheren Trainingszeitplan besser ab als Standardmodelle, was darauf hindeutet, dass die Änderung der Architektur selbst der primäre Treiber der Verbesserung ist. Die Forscher merkten an, dass der Trainingsprozess zwar mehr Rechenleistung als ein Standardmodell erfordert, der Dekodierungsprozess – die eigentliche Generierung von Text – jedoch nahezu genauso schnell ist, was das System für reale Anwendungen praktikabel macht.

Im breiteren Kontext der künstlichen Intelligenz adressiert diese Arbeit eine fundamentale Einschränkung in der Art und Weise, wie Deep-Learning-Modelle Informationen über die Zeit verarbeiten. Indem WhiteMatter jedem Layer ermöglicht, eine synthetisierte Sicht auf die gesamte Historie des Netzwerks zu erhalten, überwindet es die Isolation, die für tiefe Architekturen typisch ist. Die Ergebnisse legen nahe, dass die Effizienz dieser Systeme nicht allein daraus resultiert, sie größer oder tiefer zu machen, sondern daraus, wie sie Informationen über ihre internen Strukturen hinweg verbinden und teilen. Die Fähigkeit, das Gedächtnis vergangener Interaktionen zu komprimieren, ohne den Reichtum der Daten zu verlieren, bietet einen vielversprechenden Weg für den Bau leistungsfähigerer und effizienterer Sprachmodelle.

Die Forscher kamen zu dem Schluss, dass ihr Ansatz erfolgreich eine Deep-to-Shallow-Feedback integriert, wodurch das System die volle Tiefe seiner Repräsentationen nutzen kann. Sie demonstrierten, dass dies mit einem reduzierten Speicherbedarf möglich ist, was die Annahme infrage stellt, dass bessere Leistung zwingend mehr Speicher erfordert. Während der Trainingsprozess eine gewisse zusätzliche Komplexität mit sich bringt, sind die Gewinne an Genauigkeit und Effizienz während der tatsächlichen Nutzung des Modells erheblich. Die Arbeit liefert ein konkretes Beispiel dafür, wie das Überdenken der Verbindungen zwischen verschiedenen Teilen eines neuronalen Netzwerks zu signifikanten Leistungssteigerungen führen kann, und eröffnet eine neue Richtung für die Entwicklung zukünftiger Systeme der künstlichen Intelligenz.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →