← Neueste Arbeiten
💬 NLP

Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models

Dieses Paper führt Hidden Decoding ein, eine neuartige Skalierungsmethode, die Large Language Models durch die Erweiterung der Token-Berechnung entlang der Sequenzlängen-Dimension mittels Stream-Faktorisierung verbessert und dadurch signifikante Leistungssteigerungen auf Frontier-Skalen ermöglicht, ohne das feste Transformer-Backbone zu modifizieren oder prohibitive Trainingskosten zu verursachen.

Ursprüngliche Autoren: Aiwei Liu, Cheng Shi, Chuhan Wu, Ci Lei, Di Lu, Donald He, Fan Zhang, Fanhao Kong, Feifei Zhang, Guan Wang, Haicheng Wang, Haoyu Liu, Houjin Yu, Jiachen Ding, Jiayi Feng, Jie Zhou, Jijun Chi, Jindi Sh
Veröffentlicht 2026-07-10
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Aiwei Liu, Cheng Shi, Chuhan Wu, Ci Lei, Di Lu, Donald He, Fan Zhang, Fanhao Kong, Feifei Zhang, Guan Wang, Haicheng Wang, Haoyu Liu, Houjin Yu, Jiachen Ding, Jiayi Feng, Jie Zhou, Jijun Chi, Jindi Shi, Jing Lei, Junjie Zhang, Laiyi Li, Le Tian, Linhao Zhang, Miao Fan, Sijun Zhang, Wei Jia, Weiwei Shi, Wenhan Li, Wentao Zhao, Wenteng Liang, Xiao Zhou, Xiaojin Zhou, Xihuai Wang, Xinyu Gao, Xuanliang Wang, Xuyang Ao, Yang Yu, Yangxiu You, Yinuo Zhao, Yufei Kuang, Yufei Wang, Yuan Liu, Yuan Liu, Yuwen Chen, Zhencong Tian, Zhongyin Zhao, Zilin Yu, Zitao Wang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie hätten ein superintelligentes Robotergehirn (ein Large Language Model), das bereits ziemlich erstaunlich ist. Normalerweise versuchen Wissenschaftler, dieses Gehirn noch intelligenter zu machen, indem sie es größer machen – mehr Schichten, mehr Neuronen, einfach mehr von allem hinzufügen. Aber das ist so, als würde man versuchen, einen Wolkenkratzer auf einem Wolkenkratzer zu bauen: Es kostet ein Vermögen, dauert ewig und manchmal kann die Baucrew (die Trainingscomputer) mit der Größe einfach nicht umgehen.

Das WeChat AI-Team stellte eine andere Frage: Was wäre, wenn wir das Gehirn exakt gleich groß lassen, ihm aber mehr Zeit geben, über jedes Wort nachzudenken?

Das Problem mit dem „Looping“

Einige Forscher versuchten, dies zu lösen, indem sie das Robotergehirn dazu brachten, sein Denken zu „loopen“. Stellen Sie sich einen Studenten vor, der einen Satz liest, ihn dann noch einmal liest, dann noch einmal, und dabei dieselben Gehirnzellen immer und immer wieder benutzt, um eine bessere Antwort zu erhalten. Dies wird als „gelooptes“ oder „rekurrentes“ Modell bezeichnet.

Aber hier liegt der Haken: Wenn man versucht, die größten Roboter zu trainieren (diejenigen mit Hunderten von Milliarden Parametern), bringt diese Looping-Idee das Fließband zum Erliegen. Die Computer, die diese Modelle trainieren, arbeiten in einer Pipeline, bei der jeder Teil des Gehirns seine Aufgabe einmal erledigt und den Staffelstab weitergibt. Wenn man den Roboter dazu bringt, denselben Satz immer wieder zu lesen, stockt die gesamte Linie und die teuren Computer sitzen untätig herum. Es ist wie ein Fabrikfließband, das ständig stoppt, damit ein Arbeiter dieselbe Schraube noch einmal neu drehen kann; die Fabrik kommt zum Stillstand.

Die Lösung: „Hidden Decoding“ (Die geheime Montagelinie)

Das WeChat-Team kam auf einen cleveren Trick namens Hidden Decoding. Anstatt den Roboter dasselbe Wort immer wieder in einer Schleife lesen zu lassen, bringen sie den Roboter dazu, das Wort mehrfach gleichzeitig zu lesen, aber in geheimen Parallelspuren.

Denken Sie an ein Rennwagen-Team. Anstatt dass ein Auto drei Runden um die Strecke fährt, um die beste Rundenzeit zu erzielen, schicken sie vier identische Autos (Streams) gleichzeitig über die Strecke.

  1. Der Aufbau: Wenn der Roboter ein Wort (wie „Apfel“) sieht, wandelt er es nicht einfach in einen einzigen Code um. Er wandelt es in vier verschiedene Codes um, die jeweils in seine eigene geheime Spur fließen.
  2. Die geheime Arbeit: Diese vier Spuren laufen durch die Schichten des Gehirns. Die ersten drei Spuren sind „verborgen“. Sie leisten die ganze schwere Arbeit, das Denken und das Schlussfolgern, dürfen aber noch keine Antwort aussprechen. Sie sind wie das Brainstorming-Team im Hinterzimmer.
  3. Das letzte Wort: Nur die vierte Spur (der letzte Stream) darf das nächste Wort laut ausrufen. Das Gehirn wird nur für diese endgültliche Antwort bewertet.
  4. Das Gedächtnis: Entscheidend ist, dass sich das Gehirn merkt, was die ersten drei Spuren gedacht haben. Es bewahrt deren Notizen (genannt „Key-Value Caches“) auf, damit das nächste Wort die Brainstorming-Notizen des vorherigen Wortes lesen kann.

Auf diese Weise erhält der Roboter viermal die Denkleistung für jedes Wort, benötigt aber kein größeres Gehirn und stoppt nicht das Fließband. Er verarbeitet einfach eine längere Sequenz von Daten in einem Durchgang.

Effizient gestalten: Der „Stream-Factorized“-Trick

Sie denken vielleicht: „Warte mal, wenn ich vier Spuren habe, die miteinander kommunizieren, wird die Mathematik dann nicht wahnsinnig kompliziert?“ Wenn jede Spur bei jedem Schritt mit jeder anderen Spur kommunizieren würde, würde die Kostenbelastung explodieren (sie würde um das 16-fache steigen!).

Um dies zu beheben, nutzte das Team eine Methode namens Stream-Factorized Attention.

  • Die meiste Zeit: Die Spuren bleiben in ihren eigenen Blasen. Spur 1 spricht mit Spur 1, Spur 2 mit Spur 2. Sie stören sich nicht gegenseitig.
  • Manchmal: Nur einige wenige spezifische Schichten lassen die Spuren Notizen austauschen und ihre Ideen mischen.

Dies hält die Kosten niedrig. Anstatt dass die Kosten um das 16-fache steigen, steigen sie nur um etwa 4,4 bis 5,1 Mal (was nahe an der 4-fachen Erhöhung durch die Spuren liegt). Dies macht es möglich, diese supergroßen Modelle zu trainieren, ohne das Budget zu sprengen.

Hat es funktioniert?

Das Team testete dies an zwei massiven Modellen: einem mit 80 Milliarden Parametern und einem riesigen Modell mit 617 Milliarden Parametern. Sie haben die Gehirngröße nicht verändert; sie haben lediglich den „4-Spuren-Modus“ aktiviert.

  • Die Ergebnisse: Die Modelle wurden intelligenter. Bei schwierigen Mathe- und Wissenschaftstests verbesserte das 617-Milliarden-Modell sein Ergebnis beim „GP�A Diamond“-Test von 89,1 auf 91,2. Beim „PHYBench“-Physiktest stieg es von 75,3 auf 76,3.
  • Der Trend: Sie testeten auch mit 2 Spuren, 4 Spuren und 8 Spuren. Mit jedem zusätzlichen Paar an „Denkspuren“ stiegen die Werte weiter an. Dies deutet darauf hin, dass das Hinzufügen von mehr „Denkspuren“ ein echter Weg ist, um Modelle intelligenter zu machen, ohne sie neu zu bauen.

Was sie ausgeschlossen haben

Das Team war sorgfältig darin, zu prüfen, ob dies nur ein Zufall war. Sie probierten andere Wege aus, um die zusätzlichen Spuren zu nutzen:

  • Erzwingen, dass jede Spur rät: Wenn sie die ersten drei Spuren dazu brachten, ebenfalls die Antwort vorherzusagen (anstatt nur die letzte Spur), wurde das Modell tatsächlich schlechter.
  • Mischen der Antworten: Wenn sie einfach die Gedanken aller vier Spuren im Durchschnitt bildeten, funktionierte es auch nicht so gut wie das Zulassen der letzten Spur, die die Entscheidung trifft.
  • Teilen der Notizen: Wenn sie die Spuren dazu brachten, dieselben Gedächtnisnotizen zu teilen, anstatt ihre eigenen zu behalten, wurde das Modell etwas weniger genau.

Dies beweist, dass das Geheimrezept darin besteht, den ersten Spuren das stille, private Nachdenken zu erlauben und ihre Notizen getrennt zu halten, damit die letzte Spur diese tiefe, akkumulierte Weisheit nutzen kann, um die beste Vermutung abzugeben.

Das Fazament

Hidden Decoding zeigt, dass man nicht immer ein größeres Gehirn braucht, um klüger zu werden. Manchmal muss man dem Gehirn nur mehr Zeit geben, um parallel zu denken. Indem das Team von WeChat ein einzelnes Wort in eine geheime Montagelinie von Gedanken verwandelt hat, fand es einen Weg, die Intelligenz von Frontier-Scale-Modellen zu steigen, ohne die massiven Kosten für den Bau eines neuen, größeren Modells zu verursachen. Es ist ein praktischer, engineering-freundlicher Weg, um mehr Intelligenz aus den Modellen herauszukitzeln, die wir bereits haben.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →