← नवीनतम पेपर
💻 computer science

Yuan3.0 Ultra: A Trillion-Parameter Enterprise-Oriented MoE LLM

यह शोध पत्र Yuan3.0 Ultra को प्रस्तुत करता है, जो एक ओपन-सोर्स, ट्रिलियन-पैरामीटर मिक्स्चर-ऑफ-एक्सपर्ट्स लार्ज लैंग्वेज मॉडल है जो प्री-ट्रेनिंग दक्षता में उल्लेखनीय सुधार करने और एंटरप्राइज-ओरिएंटेड बेंचमार्क पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करते हुए मॉडल के आकार को कम करने के लिए एक नवीन लेयर-एडेप्टिव एक्सपर्ट प्रूनिंग एल्गोरिदम का उपयोग करता है।

मूल लेखक: YuanLab. ai, :, Shawn Wu, Jiangang Luo, Darcy Chen, Sean Wang, Louie Li, Allen Wang, Xudong Zhao, Tong Yu, Bach Li, Joseph Shen, Gawain Ma, Jasper Jia, Marcus Mao, Claire Wang, Hunter He, Carol Wang
प्रकाशित 2026-03-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: YuanLab. ai, :, Shawn Wu, Jiangang Luo, Darcy Chen, Sean Wang, Louie Li, Allen Wang, Xudong Zhao, Tong Yu, Bach Li, Joseph Shen, Gawain Ma, Jasper Jia, Marcus Mao, Claire Wang, Hunter He, Carol Wang, Zera Zhang, Jason Wang, Chonly Shen, Leo Zhang, Logan Chen, Qasim Meng, James Gong, Daniel Zhao, Penn Zheng, Owen Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हाई-टेक किचन चला रहे हैं जिसे लाखों अलग-अलग भोजन (प्रश्नों के उत्तर) बनाने के लिए डिज़ाइन किया गया है, जो एक बहुत बड़ी रेस्टोरेंट चेन (एंटरप्राइज वर्ल्ड) के लिए काम करता है।

अतीत में, इन किचनों के साथ एक समस्या थी: उन्होंने किचन में काम करने के लिए 1,000 शेफ (विशेषज्ञों) को काम पर रखा, लेकिन हर ऑर्डर के लिए केवल 2 शेफ ही खाना बनाते थे। समस्या यह थी कि किचन मैनेजर (AI का राउटर) ऑर्डर्स को लगातार उन्हीं 50 लोकप्रिय शेफ्स के पास भेजता रहता था, जबकि बाकी 950 शेफ खाली खड़े होकर दीवार को घूरते रहते थे। इस वजह से पैसा बर्बाद हो रहा था (कंप्यूटिंग पावर पर वेतन खर्च हो रहा था) और पूरा किचन धीमा हो जा रहा था क्योंकि व्यस्त शेफ्स काम के बोझ से दबे हुए थे, जबकि खाली बैठे शेफ्स केवल जगह घेर रहे थे।

Yuan3.0 Ultra एक नया, स्मार्ट किचन डिज़ाइन है जो लेयर-एडेप्टिव एक्सपर्ट प्रूनिंग (LAEP) नामक तकनीक का उपयोग करके इस समस्या को हल करता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. "व्यस्त बनाम खाली" शेफ की समस्या

AI बनाने के पुराने तरीके (Mixture-of-Experts) में, सिस्टम विशेषज्ञों की एक विशाल टीम की तरह होता है।

  • समस्या: ट्रेनिंग के दौरान, AI स्वाभाविक रूप से आलसी हो जाता है। यह कुछ "सुपर शेफ्स" पर निर्भर रहना सीख जाता है जो हर चीज़ में माहिर हैं, जबकि सैकड़ों अन्य शेफ्स को अनदेखा कर दिया जाता है जिन्हें कभी खाना बनाने का मौका ही नहीं मिलता।
  • परिणाम: किचन बहुत बड़ा, महंगा और अक्षम हो जाता है। आप 1,000 शेफ के लिए भुगतान कर रहे हैं लेकिन प्रभावी रूप से केवल 50 का ही उपयोग कर रहे हैं।

2. समाधान: LAEP (स्मार्ट मैनेजर)

शोधकर्ताओं ने LAEP नामक एक नया मैनेजर पेश किया है। किचन पूरी तरह से बनने के बाद लोगों को निकालने के बजाय (जैसा कि अन्य कंपनियाँ करती हैं), LAEP किचन के बनते समय ही उस पर नज़र रखता है।

  • चरण 1: अवलोकन (Observation)। पहले कुछ दिनों के लिए, किचन बहुत अस्त-व्यस्त होता है। शेफ बेतरतीब ढंग से इधर-उधर भाग रहे होते हैं।
  • चरण 2: पैटर्न (Pattern)। कुछ समय के बाद, एक पैटर्न उभरता है। मैनेजर देखता है कि शेफ #42 हमेशा व्यस्त रहता है, लेकिन शेफ #800 से #900 तक हफ्तों से हाथ में कोई बर्तन भी नहीं लिया है।
  • चरण 3: कटौती (The Cut)। LAEP कहता है, "हमें इन 100 खाली शेफ्स की ज़रूरत नहीं है।" यह उन्हें निकाल देता है (प्रून करता है) और शेष शेफ्स को इस तरह व्यवस्थित करता है कि कार्यभार पूरी तरह संतुलित हो जाए।
  • जादू: इन बेकार शेफ्स को ट्रेनिंग के दौरान ही निकालने से, किचन 33% छोटा हो जाता है (भारी मात्रा में पैसा और जगह बचाना) लेकिन वास्तव में 49% तेज़ काम करता है क्योंकि बचे हुए शेफ्स अब जगह के लिए लड़ नहीं रहे हैं या ऑर्डर का इंतज़ार नहीं कर रहे हैं।

3. "फास्ट-थिंकिंग" अपग्रेड (RIRM)

एक बार जब किचन बन जाता है, तो टीम यह सुनिश्चित करना चाहती थी कि शेफ अपनी रेसिपी पर बहुत अधिक विचार न करें।

  • समस्या: कभी-कभी, गणित के कठिन सवाल पूछे जाने पर, AI 20 मिनट तक "ज़ोर से सोचने" लगता है, उत्तर देने से पहले 50 पन्नों के नोट्स लिखता है। इसे "ओवरथिंकिंग" (ज़रूरत से ज़्यादा सोचना) कहा जाता है।
  • समाधान: उन्होंने रिफ्लेक्शन इनहिबिशन (RIRM) नामक एक नया नियम जोड़ा। इसे एक सख्त हेड शेफ की तरह समझें जो शेफ के कंधे पर थपथपाकर कहता है, "लिखना बंद करो! तुमने इसके बारे में पर्याप्त सोच लिया है। अब मुझे जवाब दो।"
  • परिणाम: AI बहुत तेज़ हो गया। यह अभी भी सही उत्तर देता है, लेकिन यह बिना वजह की बातें (रैम्बलिंग) करना बंद कर देता है। इसने "सोचने के समय" को 14% कम कर दिया और सटीकता में 16% का सुधार किया।

4. व्यवसाय (एंटरप्राइज) के लिए यह क्यों महत्वपूर्ण है?

अधिकांश AI मॉडल कविता लिखने या चैट करने में अच्छे होते हैं, लेकिन वे बोरिंग और जटिल व्यावसायिक कार्यों में संघर्ष करते हैं, जैसे:

  • 50 पन्नों के PDF कॉन्ट्रैक्ट को पढ़ना और बारीक विवरण ढूंढना।
  • एक बिखरी हुई स्प्रेडशीट का विश्लेषण करना ताकि ट्रेंड पाया जा सके।
  • एक प्राकृतिक भाषा के अनुरोध ("पिछले क्वार्टर की बिक्री दिखाएं") को एक जटिल डेटाबेस क्वेरी में बदलना।

Yuan3.0 Ultra विशेष रूप से इन कार्यों के लिए ट्यून किया गया है। क्योंकि इसे "स्मार्ट मैनेजर" (LAEP) और "स्ट्रिक्ट हेड शेफ" (RIRM) के साथ प्रशिक्षित किया गया था, इसलिए यह है:

  • तेज़: यह डेटा को तेज़ी से प्रोसेस करता है।
  • स्मार्ट: यह लगभग किसी भी अन्य मॉडल की तुलना में जटिल दस्तावेज़ों और तालिकाओं (टेबल्स) को बेहतर ढंग से संभालता है।
  • सस्ता: क्योंकि यह छोटा और अधिक कुशल है, इसलिए इसे चलाना कम खर्च वाला है।

निचोड़ (The Bottom Line)

Yuan3.0 Ultra को एक लीन, मीन, बिजनेस मशीन के रूप में देखें। इसने एक विशाल, फूले हुए AI मॉडल को लिया, आलसी कर्मचारियों को निकाला, अधिकतम दक्षता के लिए टीम को पुनर्गठित किया, और उन्हें ज़रूरत से ज़्यादा सोचने से रोका। परिणाम स्वरूप, यह एक ऐसा मॉडल है जो छोटा है, तेज़ है, और वास्तविक दुनिया के व्यवसाय में आवश्यक भारी काम करने में अविश्वसनीय रूप से अच्छा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →