UMoE:Unlocking Every Expert in Domain-Specific Training
UMoE एक बजट-संरक्षण पाइपलाइन है जो लो-सैलियंसी (low-saliency) विशेषज्ञों को हटाने और फाइन-ट्यूनिंग से पहले परटर्बेशन (perturbation) के माध्यम से पूल को पुनर्जीवित करने द्वारा मिक्सचर-ऑफ-एक्सपर्ट्स मॉडल्स के डोमेन-विशिष्ट प्रशिक्षण को उन्नत करती है, जिससे यह बिना इन्फरेंस लागत बढ़ाए विभिन्न आर्किटेक्चर और डोमेन में मानक सुपरवाइज्ड फाइन-ट्यूनिंग से लगातार बेहतर प्रदर्शन करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विशाल, सुपर-स्मार्ट रोबोटिक मस्तिष्क है जिसे "मिक्सचर-ऑफ-एक्सपर्ट्स" (Mixture-of-Experts - MoE) कहा जाता है। इस मस्तिष्क को एक एकल विशाल मांसपेशी के रूप में नहीं, बल्कि 128 या 256 नन्हे विशेषज्ञों की एक टीम के रूप में सोचें, जिनमें से प्रत्येक किसी अलग चीज़ का विशेषज्ञ है। जब रोबोट को कोई सवाल मिलता है, तो एक स्मार्ट "राउटर" तय करता है कि समस्या को हल करने में मदद करने के लिए कितने विशेषज्ञों (मान लीजिए 8) को आगे आना चाहिए।
यहाँ समस्या यह है कि इस टीम को सब कुछ सिखाया गया था—गणित, कोडिंग, विज्ञान, खाना बनाना, इत्यादि। लेकिन अब, आप इस रोबट को एक गणित का जादूगर (math wizard) बनाना चाहते हैं। यह शोध पत्र तर्क देता है कि यदि आप पूरी टीम को बस गणित सिखाना शुरू कर देते हैं (जिसे "डायरेक्ट SFT" कहा जाता है), तो आप समय बर्बाद कर रहे हैं। क्यों? क्योंकि उन 256 विशेषज्ञों में से कुछ गणित में बहुत खराब हैं। वे कविता या इतिहास में बेहतरीन हो सकते हैं, लेकिन वे गणित की कक्षा में केवल "शोर" (noise) के समान हैं। फिर भी, राउटर गलती से उन्हें ही बुलाता रहता है, और रोबोट उन्हें गणित सीखने के लिए मजबूर करने की कोशिश करता है, जो कि अक्षम है।
बड़ा विचार: UMoE (MoE क्षमता को अनलॉक करना)
लेखक, ज़ेफ़ेंग ली और पेंगफेई लियू, एक चतुर तकनीक प्रस्तावित करते हैं जिसे UMoE कहा जाता है। पूरी टीम को पढ़ाने के बजाय, वे पहले एक त्वरित "ऑडिशन" करते हैं।
- द प्रून (कटौती): वे गणित की समस्याओं का एक छोटा नमूना लेते हैं और पूछते हैं, "वास्तव में इस काम के लिए कौन अच्छा है?" वे उन निचले 50% विशेषज्ञों को ढूंढते हैं जो गणित के लिए सबसे कम मददगार हैं और उन्हें कमरे से बाहर निकाल देते हैं।
- द रीग्रो (क्लोन बनाना): अब टीम बहुत छोटी हो गई है! रोबोट को अपनी गति और लागत को समान बनाए रखने के लिए अपने पूरे बजट के 256 विशेषज्ञों की आवश्यकता है। इसलिए, वे शेष गणित-कुशल विशेषज्ञों को लेते हैं और उनके क्लोन बनाते हैं। लेकिन यहाँ ट्विस्ट यह है कि वे केवल कॉपी-पेस्ट नहीं करते हैं। वे मूल और क्लोन दोनों को एक सूक्ष्म, यादृच्छिक "झटका" (गणितीय विक्षोभ/perturbation) देते हैं। यह क्लोन को मूल से थोड़ा अलग बनाता है, ताकि वे दोनों सीख सकें और विशेषज्ञता हासिल कर सकें बिना एक-दूसरे के काम में बाधा डाले।
- द SFT (प्रशिक्षण): अब, गणित-तैयार (या गणित-तैयार होने की क्षमता रखने वाले) विशेषज्ञों की एक भरी हुई टीम के साथ, वे पूरे दल को गणित सिखाते हैं।
परिणाम: क्या यह काम करता है?
शोध पत्र दिखाता है कि यह "ऑडिशन और रीग्रो" विधि आश्चर्यजनक रूप से अच्छी तरह काम करती है, और लेखक इस बारे में आश्वस्त हैं क्योंकि उन्होंने केवल सिमुलेशन पर नहीं, बल्कि वास्तविक बेंचमार्क पर इसका परीक्षण किया है।
- गणित: कठिन गणित प्रतियोगिताओं के एक सेट पर, UMoE ने एक मॉडल के औसत स्कोर में 3.4 अंक और एक नए, बड़े मॉडल में 1.67 अंक का सुधार किया। यहाँ तक कि जब उन्होंने एक सुपर-स्ट्रॉन्ग, उच्च-गुणवत्ता वाले गणित डेटासेट का उपयोग किया जहाँ मानक विधि पहले से ही अन्य प्रसिद्ध मॉडलों को पछाड़ रही थी, तब भी UMoE ने अतिरिक्त 1.36 अंक निचोड़ लिए।
- कोडिंग और विज्ञान: यह केवल गणित तक सीमित नहीं था। जब उन्होंने कोडिंग, विज्ञान और यहाँ तक कि "एजेंटिक" कार्यों (जहाँ AI उपकरणों का उपयोग करता है) पर इसे आज़माया, तो इसने लगातार जीत हासिल की। उदाहरण के लिए, SWE-bench Verified नामक एक कठिन कोडिंग बेंचमार्क पर, स्कोर 6.0 अंक (16.2% से 22.2% तक) बढ़ गया।
- डेटा का आकार: शोध पत्र ने जांचा कि क्या यह केवल थोड़े डेटा के साथ काम करता है। उन्होंने 0.5 बिलियन से 4.1 बिलियन टोकन तक के डेटा आकार के साथ इसका परीक्षण किया। हर मामले में, UMoE बेहतर रहा।
शोध पत्र क्या कहता है कि क्या उत्तर नहीं है
लेखक स्पष्ट रूप से बताते हैं कि क्या काम नहीं करता या मुख्य बिंदु क्या नहीं है:
- सिर्फ अधिक डेटा जोड़ना पर्याप्त नहीं है: उन्होंने दिखाया कि भारी मात्रा में डेटा के साथ भी, मानक विधि (Direct SFT) अभी भी मिश्रण में बहुत सारे "बेकार" विशेषज्ञों को छोड़ देती है।
- एकतरफा झटका (shaking) काम नहीं करता: जब उन्होंने केवल नए क्लोन को "झटका" दिया और मूल विशेषज्ञों को अछूता छोड़ दिया, तो प्रदर्शन मानक विधि की तुलना में वास्तव में खराब हो गया। पेपर सुझाव देता है कि संतुलन बनाए रखने के लिए आपको मूल और क्लोन दोनों को "झटका" देना चाहिए।
- साधारण गिनती सबसे अच्छी नहीं है: उन्होंने विशेषज्ञों को बाहर निकालने के विभिन्न तरीकों का परीक्षण किया। विशेषज्ञों के उपयोग की आवृत्ति (frequency) को गिनना ठीक था, लेकिन एक अधिक जटिल स्कोर जिसे REAP कहा जाता है (जो यह देखता है कि विशेषज्ञ का उत्तर कितना मजबूत है और उसका उपयोग कितनी बार किया गया), सबसे अच्छा था।
यह क्यों काम करता है (वह "अहा!" क्षण)
पेपर ने गहराई से जांच की कि यह क्यों काम करता है। उन्होंने पाया कि मानक विधि में, रोबोट अपनी कंप्यूटिंग शक्ति का लगभग 42% उन विशेषज्ञों पर बर्बाद करता है जो वास्तव में बेकार हैं। यदि आप एक मानक प्रशिक्षित मॉडल को लेते और प्रशिक्षण के बाद मैन्युअल रूप से निचले आधे विशेषज्ञों को हटा देते, तो स्कोर मुश्किल से गिरता (केवल 0.12 अंक)। यह साबित करता है कि मानक विधि अनावश्यक भार ढो रही थी।
लेकिन UMoE के साथ? यदि आप उनके प्रशिक्षित दल के निचले आधे हिस्से को काट देते, तो स्कोर 5.0 अंक गिर जाता। यह सुझाव देता है कि UMoE ने उस "बेकार भार" को उपयोगी, गणित-समाधान शक्ति में सफलतापूर्वक बदल दिया है।
एक छोटा उदाहरण
पेपर एक विशिष्ट गणित की समस्या (AIME 2026, Problem 25) देता है ताकि अंतर दिखाया जा सके।
- मानक मॉडल: इसने एक भिन्न (fraction) को सरल बनाने की कोशिश की (225/200) और गलत हुआ (4/5 कहा), जिससे गलत अंतिम उत्तर मिला (405)।
- UMoE: इसने भिन्न को सही ढंग से सरल बनाया (8/9 तक) और सही उत्तर प्राप्त किया (850)।
निष्कर्ष (The Bottom Line)
यह शोध पत्र सुझाव देता है कि भारी प्रशिक्षण शुरू करने से पहले टीम को पुनर्गठित करके—गलत विशेषज्ञों को बाहर निकालकर और सही विशेषज्ञों का क्लोन बनाकर—आप बिना अधिक पैसा या समय खर्च किए मॉडल को और स्मार्ट बना सकते हैं। यह ऐसा ही है जैसे यह महसूस करना कि आपको अपनी पूरी फुटबॉल टीम को शतरंज कैसे खेलना है यह सिखाने की ज़रूरत नहीं है; आपको बस शतरंज के खिलाड़ियों को शामिल करने और उन्हें एक साथ अभ्यास करने देने की ज़रूरत है। लेखकों ने इसे 12 अलग-अलग बेंचमार्क पर मापा और पाया कि यह लगातार मददगार रहा, जो बताता है कि यह AI विशेषज्ञों को उनके विशिष्ट कार्यों के लिए और भी बेहतर बनाने का एक ठोस तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।