← नवीनतम पेपर
💬 NLP

YouZhi: Towards High-Concurrency Financial LLMs via Adaptive GQA-to-MLA Transition

YouZhi एक हाई-कन्करेंसी फाइनेंशियल LLM है जो हुआवेई एस्केंड (Huawei Ascend) इकोसिस्टम पर निर्मित है, जो लेयर-एडेप्टिव GQA-टू-MLA ट्रांज़िशन फ्रेमवर्क और विशेष प्रशिक्षण का उपयोग करता है ताकि KV-कैशे मेमोरी ओवरहेड को महत्वपूर्ण रूप से कम किया जा सके, जिससे बेस मॉडल्स की तुलना में वित्तीय बेंचमार्क सटीकता और अधिकतम इन्फरेंस कन्करेंसी दोनों में पर्याप्त सुधार प्राप्त होता है।

मूल लेखक: PSBC LLM Team, Huawei LLM Team, Ruihan Long, Junjie Wu, Tianan Zhang, Duo Zhang, Yaozong Wu, Jinbin Fu, Chang Liu, Zhentao Tang, Wenshuang Yang, Xin Wang, Zhihao Song, Ning Huang, Wenjing Xu, Shuai Z
प्रकाशित 2026-06-05
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: PSBC LLM Team, Huawei LLM Team, Ruihan Long, Junjie Wu, Tianan Zhang, Duo Zhang, Yaozong Wu, Jinbin Fu, Chang Liu, Zhentao Tang, Wenshuang Yang, Xin Wang, Zhihao Song, Ning Huang, Wenjing Xu, Shuai Zong, Shupei Sun, Sen Wang, Jing Hu, Bin Wang, Xinyu Wang, Junkui Ju, Zequn Ding, Jie Ran, Man Luo, Shixiong Kai, Linkai Hou, Kaichao Liang, Hu Zhao, Yang Zhao, Shucheng Lin, Wei Yu, Chenghan Jiang, Jingjing Ding, Jiahui Zhang, Tian Jin, Yuhang Zhang, Dong Guo, Wei Sun, Jun Xie, Jianwei Li, Lei Cao, Pei Li, Jiabin Li, Jia Yuan, Rui Yuan, Jing Zhu, Mingxuan Yuan, Zhangcheng Lv, Xin Jiang, Xiuhong Fei, Xiaozhe Ren, Yulong Li, Zhipeng Zhang, Hang Wang, Zhaohui Xu, Rui Zhao, Yibo He, Xinzhuang Niu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार वित्तीय विशेषज्ञ है, जिसे हम "YouZhi" कह सकते हैं। वह पैसे, स्टॉक और बैंकिंग के बारे में सब कुछ जानता है। हालाँकि, एक समस्या है: जब आप उसे एक ही समय में हजारों लोगों की मदद करने के लिए उपयोग करने की कोशिश करते हैं (जैसे कि मोबाइल बैंकिंग की व्यस्तता के दौरान), तो वह घबरा जाता है।

ऐसा क्यों है? क्योंकि जो कुछ भी वह कह रहा है उसे याद रखने के लिए, उसे अपनी मेमोरी में एक बहुत बड़े "स्क्रैचपैड" (जिसे KV Cache कहा जाता है) की आवश्यकता होती है। भीड़ जितनी बड़ी होगी, स्क्रैचपैड उतना ही बड़ा होगा, और अंततः, उसके मस्तिष्क में जगह खत्म हो जाएगी। इससे वह धीमा और चलाने में महंगा हो जाता है।

यह पेपर YouZhi-LLM पेश करता है, जो इस विशेषज्ञ का एक नया संस्करण है जिसे बिना अपनी याददाश्त या अपनी बुद्धिमत्ता खोए, भारी भीड़ को संभालने के लिए डिज़ाइन किया गया है। इसे सरल भाषा में यहाँ समझाया गया है:

1. "स्मार्ट फोल्डिंग" का तरीका (Layer-Adaptive GQA-to-MLA)

विशेषज्ञ के मस्तिष्क को 30+ मंजिलों (परतों) वाली एक बहुमंजिला इमारत के रूप में सोचें।

  • पुराना तरीका: पिछले तरीकों ने हर एक मंजिल को बिल्कुल एक ही तरह से मोड़कर (fold करके) स्क्रैचपैड को छोटा करने की कोशिश की। यह एक भारी सर्दियों के कोट और एक पतले रेशमी स्कार्फ को एक ही तकनीक का उपयोग करके मोड़ने की कोशिश करने जैसा था। परिणाम? रेशमी स्कार्फ (मस्तिष्क की नाजुक शुरुआती परतें) सिकुड़ गया और खराब हो गया, जिससे विशेषज्ञ भूलने लगा।
  • YouZhi का तरीका: टीम ने महसूस किया कि अलग-अलग मंजिलों को अलग-अलग उपचार की आवश्यकता होती है।
    • ऊपरी मंजिलें (गहरी परतें): ये मजबूत होती हैं। इन्हें बिना ज्यादा जानकारी खोए कसकर मोड़ा (कंप्रेस किया) जा सकता है।
    • निचली मंजिलें (उथली परतें): ये नाजुक होती हैं। विवरणों को स्पष्ट रखने के लिए इन्हें बहुत धीरे से मोड़ना पड़ता है या बिल्कुल नहीं मोड़ना चाहिए।
  • नवाचार: YouZhi एक "स्मार्ट फोल्डिंग" प्रणाली का उपयोग करता है जो प्रत्येक मंजिल को व्यक्तिगत रूप से देखता है और उसे कंप्रेस करने का सही तरीका तय करता है। यह स्क्रैचपैड को 72% तक कम कर देता है (इसे बहुत छोटा बना देता है) लेकिन विशेषज्ञ की याददाश्त को लगभग पूर्ण बनाए रखता है।

2. "पुनर्वास" प्रशिक्षण (Post-Training Pipeline)

जब आप मस्तिष्क को मोड़ने का तरीका बदलते हैं, तो विशेषज्ञ थोड़ा भ्रमित हो जाता है और अपने कुछ सामान्य ज्ञान को खो देता है। इसे ठीक करने के लिए, टीम ने उसे दो-चरणीय प्रशिक्षण शिविर में डाला:

  • चरण 1: सामान्य ज्ञान की रिकवरी: उन्होंने मूल, बिना-मुड़े हुए विशेषज्ञ को एक "शिक्षक" के रूप में इस्तेमाल किया ताकि नए, मुड़े हुए संस्करण को फिर से सामान्य रूप से बोलना और सोचना सिखाया जा सके। यह एक छात्र के ट्यूटर के साथ अध्ययन करने जैसा है ताकि छूटे हुए पाठों की भरपाई की जा सके।
  • चरण 2: वित्तीय विशेषज्ञता: एक बार जब विशेषज्ञ वापस सामान्य हो गया, तो उन्होंने उसे वित्तीय पुस्तकों, समाचारों और वास्तविक बैंकिंग परिदृश्यों का एक विशाल पुस्तकालय दिया। उन्होंने उसे यह भी सिखाया कि जब कोई प्रश्न असंभव हो तो "मुझे नहीं पता" कहना (ताकि गलत तथ्य न बनाए जाएं) और सख्त फॉर्मेटिंग नियमों का पालन करना (जैसे JSON या Markdown में उत्तर लिखना)।

3. परिणाम: तेज़, स्मार्ट और सस्ता

टीम ने हुवावे (Huawei) के विशेष कंप्यूटर चिप्स (Ascend NPUs) पर इस नए सिस्टम का परीक्षण किया। यहाँ हुआ:

  • "सुपरपावर": क्योंकि स्क्रैचपैड बहुत छोटा है, इसलिए यह सिस्टम पुराने संस्करण की तुलना में एक ही समय में 2.69 गुना अधिक लोगों को संभाल सकता है।
  • बुद्धिमत्ता में कोई कमी नहीं: भारी संपीड़न (compression) के बावजूद, मॉडल वास्तव में वित्तीय कार्यों में बेहतर हुआ। उदाहरण के लिए, 7-बिलियन-पैरामीटर वाले संस्करण ने लगभग तीन गुना ट्रैफिक संभालते हुए भी अपने वित्तीय परीक्षण स्कोर में 12.3% का सुधार किया।
  • वास्तविक दुनिया का परीक्षण: एक सिम्युलेटेड मोबाइल बैंकिंग ऐप में, मॉडल ने उपयोगकर्ता के इरादों (जैसे "मुझे ऋण चाहिए") को सही ढंग से समझा और विवरणों (जैसे "5,000 डॉलर के लिए") को भरा, जो बहुत भारी, अन-ऑप्टिमाइज्ड मॉडलों के समान ही 97% से अधिक सटीकता के साथ किया।

निचोड़

YouZhi-LLM एक भारी, धीमी गति से चलने वाले ट्रक को एक चिकनी, उच्च-गति वाली स्पोर्ट्स कार में बदलने जैसा है जो समान मात्रा में कार्गो ले जा सकती है। यह समझने के बाद कि मेमोरी को कहाँ कंप्रेस करना है और फिर मॉडल को वित्तीय विशेषज्ञ के रूप में पुन: प्रशिक्षित करके, उन्होंने एक ऐसा सिस्टम बनाया है जो अविश्वसनीय रूप से स्मार्ट है और बिना थके हजारों उपयोगकर्ताओं को एक साथ सेवा देने में सक्षम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →