← नवीनतम पेपर
🤖 machine learning

Temporally Extended Mixture-of-Experts Models

यह शोध पत्र सुदृढीकरण शिक्षण (reinforcement learning) के ऑप्शंस फ्रेमवर्क पर आधारित एक टेम्पोरली एक्सटेंडेड मिक्सचर-ऑफ-एक्सपर्ट्स फ्रेमवर्क का प्रस्ताव करता है, जो मॉडल की सटीकता को बनाए रखते हुए विशेषज्ञ स्विचिंग दरों को (50% से अधिक से घटाकर 5% से कम) महत्वपूर्ण रूप से कम करने के लिए एक लेयर-वाइज कंट्रोलर का उपयोग करता है, जिससे बड़े पैमाने के मॉडलों के लिए अधिक मेमोरी-कुशल सर्विंग और निरंतर शिक्षण (continual learning) सक्षम होता है।

मूल लेखक: Zeyu Shen, Peter Henderson

प्रकाशित 2026-04-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zeyu Shen, Peter Henderson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Temporally Extended Mixture-of-Experts Models" के पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "चंचल शेफ" (The Fidgety Chef)

एक विशाल, हाई-एंड किचन की कल्पना करें (जो एक AI मॉडल है) जिसे दुनिया का कोई भी व्यंजन बनाने के लिए डिज़ाइन किया गया है। इसे संभालने के लिए, किचन में एक विशाल शेफ नहीं है; बल्कि इसमें 32 अलग-अलग विशेषज्ञ शेफ (जिन्हें "experts" कहा जाता है) हैं।

  • पुराना तरीका (Standard MoE): AI द्वारा बोले जाने वाले हर एक शब्द के लिए, किचन मैनेजर वर्तमान वाक्य को देखता है, उस विशिष्ट शब्द के लिए सबसे अच्छे 4 शेफ चुनता है, बाकी 28 को काम से निकाल देता है, और फिर अगले शब्द के लिए तुरंत 4 अलग शेफ को काम पर रख लेता है।
    • परिणाम: किचन निरंतर अराजकता की स्थिति में रहता है। शेफ हर सेकंड रसोई में आते-जाते रहते हैं। यदि किचन इतना छोटा है कि वह एक साथ सभी 32 शेफों को नहीं रख सकता (जो बड़े मॉडल्स के मामले में होता है), तो मैनेजर को नए शेफों को लाने के लिए बेसमेंट में दौड़ना पड़ता है और दूसरों को वापस भेजना पड़ता है। यह "लाना-ले जाना" समय लेता है, जिससे सब कुछ धीमा हो जाता है और किचन अक्षम हो जाता है।

नया विचार: "स्थिर बदलाव" (The Stable Shift)

प्रिंसटन के शोधकर्ताओं ने पूछा: हर एक शब्द के लिए टीम बदलने की क्या ज़रूरत है? क्या विशेषज्ञों की एक टीम एक पूरे पैराग्राफ या एक पूरे विचार के लिए मिलकर काम नहीं कर सकती?

उन्होंने एक नई प्रणाली पेश की जिसे Temporally Extended Mixture-of-Experts कहा जाता है।

इसे एक टीवी शो प्रोडक्शन की तरह समझें:

  • पुराना तरीका: निर्देशक संवाद की हर एक लाइन के लिए कलाकारों की पूरी कास्ट बदल देता है।
  • नया तरीका: निर्देशक एक विशिष्ट "सीन" (एक Option) असाइन करता है। उस सीन की अवधि के लिए, वही 4 कलाकार मंच पर बने रहते हैं। वे केवल तभी बदलते हैं जब सीन बदल जाता है (जैसे, किचन सीन से कोर्टरूम सीन में जाना)।

यह कैसे काम करता है: "स्मार्ट मैनेजर" (The Smart Manager)

यह पेपर एक हल्के वजन वाले Controller (एक छोटा AI दिमाग) का परिचय देता है जो मुख्य मॉडल के ऊपर स्थित होता है। यह कंट्रोलर एक स्मार्ट स्टेज मैनेजर की तरह काम करता है।

  1. निर्णय: हर शब्द के लिए नई टीम चुनने के बजाय, मैनेजर बातचीत के प्रवाह को देखता है।
  2. लागत: मैनेजर जानता है कि टीमों को बदलना महंगा है (नई टीमों को लोड करने में समय और ऊर्जा लगती है)। इसे "Deliberation Cost" कहा जाता है।
  3. रणनीति: मैनेजर एक सरल नियम सीखता है: "टीम को केवल तभी बदलें जब नया विषय इतना अलग हो कि वर्तमान टीम उसे संभाल न सके, और बदलने का लाभ, देरी की लागत (cost) से अधिक हो।"

यदि AI बिल्ली के बारे में कहानी लिख रहा है, तो "कैट टीम" पूरी कहानी के दौरान मंच पर बनी रहती है। यदि कहानी अचानक रॉकेट शिप की ओर मुड़ जाती है, तो मैनेजर "स्पेस टीम" को अंदर ले आता है।

परिणाम: कम अराजकता, वही गुणवत्ता

शोधकर्ताओं ने एक बड़े AI मॉडल (gpt-oss-20b) पर इसका परीक्षण किया। यहाँ क्या हुआ:

  • बदलाव की दर (Switching Rate): पुराने सिस्टम में, टीम हर दूसरे शब्द में बदल जाती थी (50% समय)। नए सिस्टम में, टीम 5% से भी कम समय में बदली।
  • गुणवत्ता: एक ही टीम को लंबे समय तक रखने के बावजूद, AI ने कठिन गणित और तर्क परीक्षणों पर मूल सटीकता का 90% प्राप्त किया।
  • लाभ: क्योंकि टीम लंबे समय तक टिकी रहती है, इसलिए किचन को शेफों को लाने के लिए बार-बार बेसमेंट में नहीं दौड़ना पड़ता। इसका मतलब है:
    • तेज़ गति: शेफों के आने का इंतज़ार करने में कम समय लगता है।
    • सस्ता मेमोरी: आपको सभी 32 शेफों को मुख्य कमरे में रखने की ज़रूरत नहीं है; आप केवल 4 सक्रिय शेफों को रख सकते हैं और बाकी को बेसमेंट में स्टोर कर सकते हैं, यह जानते हुए कि आपको उनकी ज़रूरत कुछ समय बाद ही होगी।
    • भविष्य के लिए तैयार: जैसे-जैसे AI मॉडल्स बड़े होते जा रहे हैं (हजारों विशेषज्ञों के साथ), यह तरीका उन्हें बिना क्रैश हुए मानक कंप्यूटरों पर चलाने की अनुमति देता है।

"Deliberation Cost" वाला कमाल

इस पेपर का सबसे दिलचस्प हिस्सा वह 'नॉब' (knob) है जिसे वे घुमा सकते हैं, जिसे Deliberation Cost कहा जाता है।

  • कम लागत (Low Cost): मैनेजर आलसी है और शायद ही कभी टीमें बदलता है। AI बहुत तेज़ और मेमोरी-कुशल है, लेकिन अगर विषय अचानक बदल जाए तो यह थोड़ा "अटक" सकता है।
  • उच्च लागत (High Cost): मैनेजर बदलने के लिए बहुत उत्सुक है। AI बहुत लचीला है लेकिन धीमा है।

यह इंजीनियरों को उनकी ज़रूरतों के आधार पर AI को ट्यून करने की अनुमति देता है: "क्या हमें यह सुपर फास्ट और सस्ता चाहिए, या सुपर फ्लेक्सिबल और सटीक?"

सारांश

संक्षेप में, यह पेपर AI मॉडल्स को हर एक शब्द का सूक्ष्म-प्रबंधन (micro-managing) करना बंद करना सिखाता है। इसके बजाय, यह उन्हें बातचीत के एक पूरे हिस्से के लिए "विशेषज्ञों की एक टीम" के प्रति प्रतिबद्ध होना सिखाता है। यह डेटा को लोड करने और अनलोड करने की भागदौड़ को कम करता है, जिससे विशाल AI मॉडल अपनी बुद्धिमत्ता खोए बिना तेज़, सस्ते और प्रबंधित करने में आसान हो जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →