← 最新の論文
💬 NLP

YouZhi: Towards High-Concurrency Financial LLMs via Adaptive GQA-to-MLA Transition

YouZhiは、Huawei Ascendエコシステム上に構築された高並列金融特化型LLMであり、レイヤー適応型のGQAからMLAへの遷移フレームワークと専門的な学習を活用することで、KVキャッシュのメモリオーバーヘッドを大幅に削減し、それによってベースモデルと比較して金融ベンチマークの精度と最大推論並列度の両方において大幅な向上を実現しています。

原著者: PSBC LLM Team, Huawei LLM Team, Ruihan Long, Junjie Wu, Tianan Zhang, Duo Zhang, Yaozong Wu, Jinbin Fu, Chang Liu, Zhentao Tang, Wenshuang Yang, Xin Wang, Zhihao Song, Ning Huang, Wenjing Xu, Shuai Z
公開日 2026-06-05
📖 1 分で読めます☕ さくっと読める

原著者: PSBC LLM Team, Huawei LLM Team, Ruihan Long, Junjie Wu, Tianan Zhang, Duo Zhang, Yaozong Wu, Jinbin Fu, Chang Liu, Zhentao Tang, Wenshuang Yang, Xin Wang, Zhihao Song, Ning Huang, Wenjing Xu, Shuai Zong, Shupei Sun, Sen Wang, Jing Hu, Bin Wang, Xinyu Wang, Junkui Ju, Zequn Ding, Jie Ran, Man Luo, Shixiong Kai, Linkai Hou, Kaichao Liang, Hu Zhao, Yang Zhao, Shucheng Lin, Wei Yu, Chenghan Jiang, Jingjing Ding, Jiahui Zhang, Tian Jin, Yuhang Zhang, Dong Guo, Wei Sun, Jun Xie, Jianwei Li, Lei Cao, Pei Li, Jiabin Li, Jia Yuan, Rui Yuan, Jing Zhu, Mingxuan Yuan, Zhangcheng Lv, Xin Jiang, Xiuhong Fei, Xiaozhe Ren, Yulong Li, Zhipeng Zhang, Hang Wang, Zhaohui Xu, Rui Zhao, Yibo He, Xinzhuang Niu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたには「YouZhi」という名の、極めて優秀な金融エキスパートがいます。彼は、お金、株式、銀行業務に関するあらゆる知識を網羅しています。しかし、問題があります。何千人もの人々を同時に相手にしようとすると(例えば、モバイルバンキングが混雑している時など)、彼は圧倒されてしまうのです。

なぜでしょうか? それは、彼が話している内容を記憶しておくために、メモリ内に巨大な「メモ帳」(KVキャッシュと呼ばれます)を必要とするからです。群衆が大きくなればなるほど、メモ帳も大きくなり、最終的に彼の脳の容量が足りなくなってしまいます。これにより、動作が遅くなり、運用コストも高くなってしまいます。

この論文では、この記憶力や知能を損なうことなく、膨大な群衆を処理できるように設計された、新しいバージョンのエキスパートである「YouZhi-LLM」を紹介しています。その仕組みを、分かりやすく説明します。

1. 「賢い折り畳み」のトリック (Layer-Adaptive GQA-to-MLA)

エキスパートの脳を、30層以上のフロア(レイヤー)を持つ多層ビルだと考えてください。

  • 従来の方法: 以前の手法では、すべてのフロアを全く同じ方法で折り畳んで、メモ帳を小さくしようとしていました。それは、重い冬用のコートと薄いシルクのスカーフを、全く同じテクニックで畳もうとするようなものです。その結果はどうだったでしょうか? シルクのスカーフ(脳の繊細な初期レイヤー)はシワになり、傷ついてしまい、エキスパートは物忘れが激しくなってしまいました。
  • YouZhiの方法: チームは、フロアごとに異なる扱いが必要であることに気づきました。
    • 上層階(深いレイヤー): これらは頑丈です。情報をほとんど失うことなく、きつく折り畳む(圧縮する)ことができます。
    • 下層階(浅いレイヤー): これらは繊細です。細部を鮮明に保つために、非常に優しく折り畳むか、あるいは全く折り畳んではなりません。
  • イノベーション: YouZhiは、各フロアを個別に観察し、最適な圧縮方法を決定する「賢い折り畳み」システムを採用しています。これにより、メモ帳を**72%**も縮小(極小化)しながら、エキスパートの記憶力をほぼ完璧に維持することに成功しました。

2. 「リハビリテーション」トレーニング (Post-Training Pipeline)

脳の折り畳み方を変えると、エキスパートは少し混乱し、一般的な知識を失ってしまうことがあります。これを修正するために、チームは2段階のトレーニングキャンプを実施しました。

  • ステップ1:一般知識の回復: 折り畳んでいない元のエキスパートを「教師」として使い、新しく折り畳まれたバージョンのモデルに、再び普通に話し、考える方法を再学習させました。これは、生徒が取りこぼしたレッスンを取り戻すために家庭教師と一緒に勉強するようなものです。
  • ステップ2:金融の専門特化: エキスパートが正常に戻った後、膨大な量の金融書籍、ニュース、そして実際の銀行業務のシナリオを与えました。また、「答えが出せない質問」に対しては「分かりません」と言うように教え(デタラメな事実を捏造するのを防ぐため)、JSONやMarkdown形式で回答を書くといった厳格なフォーマット規則に従うようにも教え込みました。

3. 結果:より速く、より賢く、より安価に

チームは、Huaweiの専用コンピューターチップ(Ascend NPU)を用いて、この新しいシステムをテストしました。その結果は以下の通りです。

  • 「スーパーパワー」: メモ帳が非常に小さくなったため、システムは旧バージョンと比較して、同時に2.69倍多くの人々を処理できるようになりました。
  • 知能の損失なし: 大幅な圧縮を行ったにもかかわらず、モデルは金融タスクにおいてむしろ性能が向上しました。例えば、70億パラメータのバージョンは、トラフィックがほぼ3倍になった一方で、金融テストのスコアが**12.3%**向上しました。
  • 実世界でのテスト: シミュレーションされたモバイルバンキングアプリにおいて、モデルはユーザーの意図(例:「ローンを希望」)を理解し、詳細(例:「5,000ドルで」)を記入する能力において、最適化されていない重いモデルと同等の97%以上の正確性を発揮しました。

まとめ

YouZhi-LLMは、重くて動きの遅いトラックを、同じ量の荷物を運びながらも、洗練された高速のスポーツカーに変えるようなものです。記憶を圧縮すべき場所を正確に見極め、その上でモデルを金融のエキスパートとして再学習させることで、彼らは驚異的な知能を持ちながら、何千人ものユーザーを同時に、かつ余裕を持ってサポートできるシステムを作り上げたのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →