YouZhi: Towards High-Concurrency Financial LLMs via Adaptive GQA-to-MLA Transition
YouZhi ist ein hochkonstante Finanz-LLM, das auf dem Huawei Ascend-Ökosystem aufgebaut ist und ein schichtadaptives GQA-zu-MLA-Übergangsframework sowie spezialisiertes Training nutzt, um den KV-Cache-Speicheroverhead signifikant zu reduzieren, wodurch im Vergleich zu Basismodellen sowohl die Genauigkeit bei Finanz-Benchmarks als auch die maximale Inferenzkonkurrenz erheblich gesteigert werden.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie haben einen brillanten Finanzexperten, nennen wir ihn „YouZhi“. Er weiß alles über Geld, Aktien und Bankwesen. Es gibt jedoch ein Problem: Wenn Sie versuchen, ihn zu nutzen, um Tausenden von Menschen gleichzeitig zu helfen (wie etwa während eines geschäftigen Mobile-Banking-Ansturms), wird er überfordert.
Warum? Weil er, um sich an das zu erinnern, was er sagt, einen massiven „Schmierblock“ (genannt KV-Cache) in seinem Gedächtnis benötigt. Je größer die Menge, desto größer ist sein Schmierblock, und schließlich geht seinem Gehirn der Platz aus. Das macht ihn langsam und teuer im Betrieb.
Das Paper stellt YouZhi-LLM vor, eine neue Version dieses Experten, die darauf ausgelegt ist, riesige Menschenmengen zu bewältigen, ohne sein Gedächtnis oder seine Intelligenz zu verlieren. So haben sie es gemacht, einfach erklärt:
1. Der „Smart Folding“-Trick (Layer-Adaptive GQA-zu-MLA)
Betrachten Sie das Gehirn des Experten als ein mehrstöckiges Gebäude mit über 30 Etagen (Layern).
- Der alte Weg: Frühere Methoden versuchten, den Schmierblock zu verkleinern, indem sie jede einzelne Etage auf exakt dieselbe Weise falteten. Es war so, als würde man versuchen, einen schweren Wintermantel und ein dünnes Seidentuch mit genau derselben Technik zu falten. Das Ergebnis? Das Seidentuch (die empfindlichen frühen Schichten des Gehirns) wurde zerknittert und beschädigt, was den Experten vergesslich machte.
- Der YouZhi-Weg: Das Team erkannte, dass verschiedene Etagen unterschiedliche Behandlungen benötigen.
- Obere Etagen (Tiefe Layer): Diese sind robust. Sie können fest gefaltet (komprimiert) werden, ohne viel Information zu verlieren.
- Untere Etagen (Flache Layer): Diese sind empfindlich. Sie müssen sehr vorsichtig oder gar nicht gefaltet werden, um die Details scharf zu halten.
- Die Innovation: YouZhi nutzt ein „Smart Folding“-System, das jede Etage individuell betrachtet und die perfekte Art der Kompression entscheidet. Dies schrumpft den Schmierblock um 72 % (macht ihn winzig klein), behält aber das Gedächtnis des Experten fast perfekt bei.
2. Das „Rehabilitations“-Training (Post-Training Pipeline)
Wenn man ändert, wie das Gehirn gefaltet wird, wird der Experte ein wenig verwirrt und verliert etwas seines Allgemeinwissens. Um dies zu beheben, hat das Team ihn durch ein zweistufiges Trainingslager geschickt:
- Schritt 1: Wiederherstellung des Allgemeinwissens: Sie nutzten den ursprünglichen, ungefalteten Experten als „Lehrer“, um die neue, gefaltete Version wieder darin zu unterrichten, normal zu sprechen und zu denken. Das ist wie ein Schüler, der mit einem Tutor lernt, um den Anschluss an verpasste Lektionen zu finden.
- Schritt 2: Finanzielle Spezialisierung: Sobald der Experte wieder normal funktionierte, gaben sie ihm eine riesige Bibliothek mit Finanzbüchern, Nachrichten und echten Bankenszenarien. Sie brachten ihm auch bei, „Ich weiß es nicht“ zu sagen, wenn eine Frage unmöglich ist (um zu verhindern, dass er falsche Fakten erfindet), und wie er strengen Formatierungsregeln folgt (wie z. B. Antworten in JSON oder Markdown zu schreiben).
3. Die Ergebnisse: Schneller, Schlauer und Günstiger
Das Team testete dieses neue System auf spezialisierten Huawei-Computerchips (Ascend NPUs). Hier ist das Ergebnis:
- Die „Superkraft“: Da der Schmierblock so viel kleiner ist, kann das System 2,69-mal mehr Menschen gleichzeitig bewältigen als die alte Version.
- Kein Verlust an Intelligenz: Trotz der starken Kompression wurde das Modell bei Finanzaufgaben sogar besser. Zum Beispiel verbesserte die 7-Milliarden-Parameter-Version ihre Finanz-Testergebnisse um 12,3 %, während sie fast das Dreifache an Traffic bewältigte.
- Praxis-Test: In einer simulierten Mobile-Banking-App verstand das Modell Nutzerabsichten (wie „Ich möchte einen Kredit“) und füllte Details (wie „für 5.000 $“) mit einer Genauigkeit von über 97 % korrekt aus – genau so gut wie die viel schwereren, nicht optimierten Modelle.
Das Fazsit
YouZhi-LLM ist wie die Verwandlung eines schweren, langsam fahrenden LKWs in ein schnelles, elegantes Sportauto, das die gleiche Menge an Fracht transportieren kann. Indem sie herausfanden, wo genau sie das Gedächtnis komprimieren müssen, und das Modell dann zu einem Finanzexperten umtrainierten, schufen sie ein System, das sowohl unglaublich intelligent als auch in der Lage ist, tausende Nutzer gleichzeitig zu bedienen, ohne ins Schwitzen zu geraten.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.