← Nieuwste papers
💬 NLP

YouZhi: Towards High-Concurrency Financial LLMs via Adaptive GQA-to-MLA Transition

YouZhi is een high-concurrency financieel LLM gebouwd op het Huawei Ascend-ecosysteem dat gebruikmaakt van een laag-adaptief GQA-naar-MLA-transitiekader en gespecialiseerde training om de KV-cache geheugenoverhead aanzienlijk te verminderen, waardoor er in vergelijking met basismodellen substantiële verbeteringen worden bereikt in zowel de nauwkeurigheid van financiële benchmarks als de maximale inferentie-concurrency.

Oorspronkelijke auteurs: PSBC LLM Team, Huawei LLM Team, Ruihan Long, Junjie Wu, Tianan Zhang, Duo Zhang, Yaozong Wu, Jinbin Fu, Chang Liu, Zhentao Tang, Wenshuang Yang, Xin Wang, Zhihao Song, Ning Huang, Wenjing Xu, Shuai Z
Gepubliceerd 2026-06-05
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: PSBC LLM Team, Huawei LLM Team, Ruihan Long, Junjie Wu, Tianan Zhang, Duo Zhang, Yaozong Wu, Jinbin Fu, Chang Liu, Zhentao Tang, Wenshuang Yang, Xin Wang, Zhihao Song, Ning Huang, Wenjing Xu, Shuai Zong, Shupei Sun, Sen Wang, Jing Hu, Bin Wang, Xinyu Wang, Junkui Ju, Zequn Ding, Jie Ran, Man Luo, Shixiong Kai, Linkai Hou, Kaichao Liang, Hu Zhao, Yang Zhao, Shucheng Lin, Wei Yu, Chenghan Jiang, Jingjing Ding, Jiahui Zhang, Tian Jin, Yuhang Zhang, Dong Guo, Wei Sun, Jun Xie, Jianwei Li, Lei Cao, Pei Li, Jiabin Li, Jia Yuan, Rui Yuan, Jing Zhu, Mingxuan Yuan, Zhangcheng Lv, Xin Jiang, Xiuhong Fei, Xiaozhe Ren, Yulong Li, Zhipeng Zhang, Hang Wang, Zhaohui Xu, Rui Zhao, Yibo He, Xinzhuang Niu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante financiële expert hebt, laten we hem "YouZhi" noemen. Hij weet alles over geld, aandelen en bankieren. Echter, er is een probleem: wanneer je hem probeert te gebruiken om duizenden mensen tegelijkertijd te helpen (zoals tijdens een drukke mobiele bankspits), raakt hij overweldigd.

Waarom? Omdat hij, om te onthouden wat hij zegt, een enorme "bloknoot" (genaamd een KV Cache) in zijn geheugen nodig heeft. Hoe groter de menigte, hoe groter zijn bloknoot, en uiteindelijk raakt zijn brein de ruimte kwijt. Dit maakt hem traag en duur in gebruik.

Het paper introduceert YouZhi-LLM, een nieuwe versie van deze expert die is ontworig om enorme menigten aan te kunnen zonder zijn geheugen of intelligentie te verliezen. Zo hebben ze het gedaan, eenvoudig uitgelegd:

1. De "Slimme Vouw" Truc (Layer-Adaptive GQA-to-MLA)

Beschouw het brein van de expert als een gebouw met meerdere verdiepingen (lagen) van 30+ verdiepingen.

  • De Oude Manier: Eerdere methoden probeerden de bloknoot te verkleinen door elke verdieping exact op dezelfde manier te vouwen. Het was alsoals proberen een zware winterjas en een dun zijden sjaaltje met exact dezelfde techniek op te vouwen. Het resultaat? Het zijden sjaaltje (de delicate vroeere lagen van het brein) raakte gekreukt en beschadigd, waardoor de expert vergeetachtig werd.
  • De YouZhi Manier: Het team realiseerde zich dat verschillende verdiepingen verschillende behandelingen nodig hebben.
    • Bovenste Verdiepingen (Diepe Lagen): Deze zijn robuust. Ze kunnen strak gevouwen (gecomprimeerd) worden zonder veel informatie te verliezen.
    • Onderste Verdiepingen (Ondiep Lagen): Deze zijn delicaat. Ze moeten heel voorzichtig of helemaal niet gevouwen worden om de details scherp te houden.
  • De Innovatie: YouZhi gebruikt een "slim vouwsysteem" dat elke verdieping individueel bekijkt en de perfecte manier beslist om deze te comprimeren. Dit verkleint de bloknoot met 72% (maakt het piepklein), maar houdt het geheugen van de expert bijna perfect.

2. De "Revalidatie" Training (Post-Training Pipeline)

Wanneer je de manier waarop het brein wordt gevouwen verandert, raakt de expert een beetje in de war en verliest hij wat van zijn algemene kennis. Om dit op te lossen, heeft het team hem door een tweetraps trainingskamp geleid:

  • Stap 1: Herstel van Algemene Kennis: Ze gebruikten de originele, niet-gevouwen expert als "leraar" om de nieuwe, gevouwen versie opnieuw te leren hoe hij normaal moet spreken en denken. Dit is als een student die met een tutor studeert om een achterstand in te halen.
  • Stap 2: Financiële Specialisatie: Zodra de expert weer normaal functioneerde, gaven ze hem een enorme bibliotheek aan financiële boeken, nieuws en echte bankscenario's. Ze leerden hem ook om "Ik weet het niet" te zeggen wanneer een vraag onmogelijk is (om te voorkomen dat hij nepfeiten verzint) en hoe hij strikte formatteringregels moet volgen (zoals het schrijven van antwoorden in JSON of Markdown).

3. De Resultaten: Sneller, Slimmer en Goedkoper

Het team heeft dit nieuwe systeem getest op de gespecialiseerde computerchips van Huawei (Ascend NPUs). Dit is wat er gebeurde:

  • De "Superkracht": Omdat de bloknoot veel kleiner is, kan het systeem 2,69 keer meer mensen tegelijkertijd aan dan de oude versie.
  • Geen Verlies aan Intelligentie: Ondanks de zware compressie werd het model zelfs beter in financiële taken. Bijvoorbeeld, de 7-miljard-parameter versie verbeterde zijn scores op financiële tests met 12,3%, terwijl het bijna drie keer zoveel verkeer afhandelde.
  • Real-World Test: In een gesimuleerde mobiele bankapplicatie begreep het model gebruikersintenties (zoals "Ik wil een lening") en vulde details in (zoals "voor $5.000") met meer dan 97% nauwkeurigheid, net zo goed als de veel zwaardere, niet-geoptimaliseerde modellen.

De Kernboodschap

YouZhi-LLM is als het nemen van een zware, langzame vrachtwagen en het veranderen in een gestroomlijnde, snelle sportauto die evenveel lading kan vervoeren. Door precies uit te zoeken waar de geheugencompressie moet plaatsvinden en het model vervolgens te hertrainen tot een financieel expert, hebben ze een systeem gecreëerd dat zowel ongelooflijk slim is als in staat is om duizenden gebruikers tegelijkertijd te bedienen zonder moeite te doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →