YouZhi: Towards High-Concurrency Financial LLMs via Adaptive GQA-to-MLA Transition
YouZhi एक हाई-कन्करेंसी फाइनेंशियल LLM है जो हुआवेई एस्केंड (Huawei Ascend) इकोसिस्टम पर निर्मित है, जो लेयर-एडेप्टिव GQA-टू-MLA ट्रांज़िशन फ्रेमवर्क और विशेष प्रशिक्षण का उपयोग करता है ताकि KV-कैशे मेमोरी ओवरहेड को महत्वपूर्ण रूप से कम किया जा सके, जिससे बेस मॉडल्स की तुलना में वित्तीय बेंचमार्क सटीकता और अधिकतम इन्फरेंस कन्करेंसी दोनों में पर्याप्त सुधार प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक शानदार वित्तीय विशेषज्ञ है, जिसे हम "YouZhi" कह सकते हैं। वह पैसे, स्टॉक और बैंकिंग के बारे में सब कुछ जानता है। हालाँकि, एक समस्या है: जब आप उसे एक ही समय में हजारों लोगों की मदद करने के लिए उपयोग करने की कोशिश करते हैं (जैसे कि मोबाइल बैंकिंग की व्यस्तता के दौरान), तो वह घबरा जाता है।
ऐसा क्यों है? क्योंकि जो कुछ भी वह कह रहा है उसे याद रखने के लिए, उसे अपनी मेमोरी में एक बहुत बड़े "स्क्रैचपैड" (जिसे KV Cache कहा जाता है) की आवश्यकता होती है। भीड़ जितनी बड़ी होगी, स्क्रैचपैड उतना ही बड़ा होगा, और अंततः, उसके मस्तिष्क में जगह खत्म हो जाएगी। इससे वह धीमा और चलाने में महंगा हो जाता है।
यह पेपर YouZhi-LLM पेश करता है, जो इस विशेषज्ञ का एक नया संस्करण है जिसे बिना अपनी याददाश्त या अपनी बुद्धिमत्ता खोए, भारी भीड़ को संभालने के लिए डिज़ाइन किया गया है। इसे सरल भाषा में यहाँ समझाया गया है:
1. "स्मार्ट फोल्डिंग" का तरीका (Layer-Adaptive GQA-to-MLA)
विशेषज्ञ के मस्तिष्क को 30+ मंजिलों (परतों) वाली एक बहुमंजिला इमारत के रूप में सोचें।
- पुराना तरीका: पिछले तरीकों ने हर एक मंजिल को बिल्कुल एक ही तरह से मोड़कर (fold करके) स्क्रैचपैड को छोटा करने की कोशिश की। यह एक भारी सर्दियों के कोट और एक पतले रेशमी स्कार्फ को एक ही तकनीक का उपयोग करके मोड़ने की कोशिश करने जैसा था। परिणाम? रेशमी स्कार्फ (मस्तिष्क की नाजुक शुरुआती परतें) सिकुड़ गया और खराब हो गया, जिससे विशेषज्ञ भूलने लगा।
- YouZhi का तरीका: टीम ने महसूस किया कि अलग-अलग मंजिलों को अलग-अलग उपचार की आवश्यकता होती है।
- ऊपरी मंजिलें (गहरी परतें): ये मजबूत होती हैं। इन्हें बिना ज्यादा जानकारी खोए कसकर मोड़ा (कंप्रेस किया) जा सकता है।
- निचली मंजिलें (उथली परतें): ये नाजुक होती हैं। विवरणों को स्पष्ट रखने के लिए इन्हें बहुत धीरे से मोड़ना पड़ता है या बिल्कुल नहीं मोड़ना चाहिए।
- नवाचार: YouZhi एक "स्मार्ट फोल्डिंग" प्रणाली का उपयोग करता है जो प्रत्येक मंजिल को व्यक्तिगत रूप से देखता है और उसे कंप्रेस करने का सही तरीका तय करता है। यह स्क्रैचपैड को 72% तक कम कर देता है (इसे बहुत छोटा बना देता है) लेकिन विशेषज्ञ की याददाश्त को लगभग पूर्ण बनाए रखता है।
2. "पुनर्वास" प्रशिक्षण (Post-Training Pipeline)
जब आप मस्तिष्क को मोड़ने का तरीका बदलते हैं, तो विशेषज्ञ थोड़ा भ्रमित हो जाता है और अपने कुछ सामान्य ज्ञान को खो देता है। इसे ठीक करने के लिए, टीम ने उसे दो-चरणीय प्रशिक्षण शिविर में डाला:
- चरण 1: सामान्य ज्ञान की रिकवरी: उन्होंने मूल, बिना-मुड़े हुए विशेषज्ञ को एक "शिक्षक" के रूप में इस्तेमाल किया ताकि नए, मुड़े हुए संस्करण को फिर से सामान्य रूप से बोलना और सोचना सिखाया जा सके। यह एक छात्र के ट्यूटर के साथ अध्ययन करने जैसा है ताकि छूटे हुए पाठों की भरपाई की जा सके।
- चरण 2: वित्तीय विशेषज्ञता: एक बार जब विशेषज्ञ वापस सामान्य हो गया, तो उन्होंने उसे वित्तीय पुस्तकों, समाचारों और वास्तविक बैंकिंग परिदृश्यों का एक विशाल पुस्तकालय दिया। उन्होंने उसे यह भी सिखाया कि जब कोई प्रश्न असंभव हो तो "मुझे नहीं पता" कहना (ताकि गलत तथ्य न बनाए जाएं) और सख्त फॉर्मेटिंग नियमों का पालन करना (जैसे JSON या Markdown में उत्तर लिखना)।
3. परिणाम: तेज़, स्मार्ट और सस्ता
टीम ने हुवावे (Huawei) के विशेष कंप्यूटर चिप्स (Ascend NPUs) पर इस नए सिस्टम का परीक्षण किया। यहाँ हुआ:
- "सुपरपावर": क्योंकि स्क्रैचपैड बहुत छोटा है, इसलिए यह सिस्टम पुराने संस्करण की तुलना में एक ही समय में 2.69 गुना अधिक लोगों को संभाल सकता है।
- बुद्धिमत्ता में कोई कमी नहीं: भारी संपीड़न (compression) के बावजूद, मॉडल वास्तव में वित्तीय कार्यों में बेहतर हुआ। उदाहरण के लिए, 7-बिलियन-पैरामीटर वाले संस्करण ने लगभग तीन गुना ट्रैफिक संभालते हुए भी अपने वित्तीय परीक्षण स्कोर में 12.3% का सुधार किया।
- वास्तविक दुनिया का परीक्षण: एक सिम्युलेटेड मोबाइल बैंकिंग ऐप में, मॉडल ने उपयोगकर्ता के इरादों (जैसे "मुझे ऋण चाहिए") को सही ढंग से समझा और विवरणों (जैसे "5,000 डॉलर के लिए") को भरा, जो बहुत भारी, अन-ऑप्टिमाइज्ड मॉडलों के समान ही 97% से अधिक सटीकता के साथ किया।
निचोड़
YouZhi-LLM एक भारी, धीमी गति से चलने वाले ट्रक को एक चिकनी, उच्च-गति वाली स्पोर्ट्स कार में बदलने जैसा है जो समान मात्रा में कार्गो ले जा सकती है। यह समझने के बाद कि मेमोरी को कहाँ कंप्रेस करना है और फिर मॉडल को वित्तीय विशेषज्ञ के रूप में पुन: प्रशिक्षित करके, उन्होंने एक ऐसा सिस्टम बनाया है जो अविश्वसनीय रूप से स्मार्ट है और बिना थके हजारों उपयोगकर्ताओं को एक साथ सेवा देने में सक्षम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।