← नवीनतम पेपर
🤖 machine learning

ProbMoE: Differentiable Probabilistic Routing for Mixture-of-Experts

यह शोध पत्र ProbMoE को प्रस्तुत करता है, जो Mixture-of-Experts मॉडलों के लिए एक अवकलनीय (differentiable) संभाव्य रूटिंग ढांचा है, जो कार्डिनैलिटी-प्रतिबंधित उपसमुच्चयों (cardinality-constrained subsets) पर संभाव्य अनुमान (probabilistic inference) के रूप में विशेषज्ञ रूटिंग को व्यवस्थित करके top-kk चयन की गैर-अवकलनीयता (non-differentiability) को दूर करता है, जिससे बेहतर विशेषज्ञ उपयोग और प्रदर्शन के साथ सटीक-kk और गतिशील-kk रूटिंग सक्षम होती है।

मूल लेखक: Heng Zhao, Zilei Shao, Guy Van den Broeck, Zhe Zeng

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Heng Zhao, Zilei Shao, Guy Van den Broeck, Zhe Zeng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हाई-टेक किचन चला रहे हैं जहाँ सैकड़ों विशेषज्ञ शेफ (विशेषज्ञ) हैं। कुछ बेकिंग में माहिर हैं, कुछ ग्रिलिंग में, तो कुछ सब्जियां काटने के जादूगर हैं। जब कोई ग्राहक एक व्यंजन (टेक्स्ट का एक "टोकन") ऑर्डर करता है, तो आप हर शेफ को जगाकर पूछने की गलती नहीं कर सकते कि क्या वे खाना बनाना चाहते हैं। ऐसा करना बहुत धीमा और महंगा होगा।

इसके बजाय, एक हेड शेफ (रौटर) होता है जो ऑर्डर को देखता है और काम करने के लिए शीर्ष 3 शेफ को चुनता है। इसी तरह वर्तमान AI मॉडल जिन्हें Mixture-of-Experts (MoE) कहा जाता है, काम करते हैं। वे बहुत कुशल हैं क्योंकि वे प्रत्येक कार्य के लिए केवल एक छोटी टीम का उपयोग करते हैं।

समस्या: "कठिन" चुनाव

वर्तमान हेड शेफ के साथ समस्या यह है कि वह एक कठोर, बाइनरी निर्णय लेता है। वह स्कोर देखता है, शीर्ष 3 को चुनता है, और बस हो गया। अन्य शेफों को शून्य क्रेडिट मिलता है, भले ही वे चयन से बहुत मामूली अंतर से बाहर रह गए हों।

क्योंकि यह निर्णय इतना "कठोर" और अचानक है, हेड शेफ अच्छी तरह से सीख नहीं पाता है। यदि वह गलती करता है, तो वह आसानी से यह नहीं समझ सकता कि क्यों या कैसे सुधार किया जाए, क्योंकि "शीर्ष 3 चुनने" का गणित सीखने के लिए टूटा हुआ है। यह वैसा ही है जैसे कार चलाने की कोशिश करना जहाँ आपको केवल पहिये को पूरी तरह से बाएं या पूरी तरह से दाएं घुमाने की अनुमति हो, बीच में कुछ भी नहीं। इसके कारण वही कुछ शेफ सारा काम करते हैं जबकि अन्य खाली बैठे रहते हैं, और पूरा किचन अस्थिर हो जाता है।

समाधान: ProbMoE (एक "संभाव्यता आधारित" किचन)

लेखक ProbMoE पेश करते हैं, जो हेड शेफ के निर्णय लेने का एक नया तरीका है। यह कहने के बजाय कि, "मैं निश्चित रूप से शेफ A, B और C को चुनता हूँ," ProbMoE कहता है, "इसकी एक संभावना (probability) है कि मैं शेफ A, B और C को चुनूँगा, लेकिन शायद शेफ D का भी एक मौका हो सकता है।"

इसे इस तरह सोचें:

  • पुराना तरीका (Top-k): आप एक सिक्का उछालते हैं। यदि चित (heads) आता है, तो आप शेफ A को चुनते हैं। यदि पतल (tails) आता है, तो आप शेफ B को चुनते हैं। आप बीच में अपना मन नहीं बदल सकते।
  • ProbMoE: आप मौसम, समय और ग्राहक के मूड को देखते हैं। आप गणना करते हैं कि शेफ A को चुनने की 70% संभावना है, शेफ B के लिए 20% और शेफ C के लिए 10% संभावना है।

भले ही, अंत में, आप ठीक 3 शेफ को ही चूल्हे पर काम करने के लिए भेजते हैं (चीजों को तेज़ रखने के लिए), लेकिन निर्णय लेने की प्रक्रिया अब तरल और गणितीय है। यह हेड शेफ को उन शेफों से भी सीखने की अनुमति देता है जिन्हें "लगभग चुना जाने वाला था", न कि केवल उन्हें जिन्होंने काम पाया।

यह कैसे काम करता है (जादुगर का कमाल)

पेपर इस काम को करने के लिए एक चतुर गणितीय ट्रिक (जिसे SIMPLE कहा जाता है का उपयोग करता है):

  1. फॉरवर्ड पास (खाना बनाना): सिस्टम उन संभावनाओं के आधार पर 3 शेफ की एक टीम को रैंडमली चुनता है। यह थोड़ा वैसा ही है जैसे डाइस (पासा) फेंककर टीम तय करना, लेकिन डाइस इस तरह से भारित (weighted) होते हैं कि बेहतर शेफ के चुने जाने की संभावना अधिक होती है।
  2. बैकवर्ड पास (सीखना): व्यंजन परोसे जाने के बाद, सिस्टम को हेड शेफ को बेहतर करने के लिए सिखाने की आवश्यकता होती है। भले ही डाइस का रोल रैंडम था, गणित सिस्टम को यह कहने की अनुमति देता है कि, "हे, शेफ D लगभग चुना जाने वाला था। यदि हमने उन्हें चुना होता, तो व्यंजन बेहतर हो सकता था। आइए हेड शेफ के दिमाग को इस तरह एडजस्ट करें कि अगली बार शेफ D के चुने जाने की संभावना थोड़ी बढ़ जाए।"

यह हेड शेफ को सुधार करने के लिए एक स्पष्ट मानचित्र देता है, जिससे एक ऐसा किचन बनता है जहाँ अधिक शेफ काम पाते हैं, और टीम मिलकर बेहतर काम करती है।

"डायनामिक" अपग्रेड

पेपर एक Dynamic-k संस्करण भी पेश करता है।

  • मानक ProbMoE: हमेशा ठीक 3 शेफ चुनता है।
  • Dynamic ProbMoE: कभी-कभी ऑर्डर सरल होता है (जैसे "नमक"), इसलिए यह केवल 1 शेफ चुनता है। अन्य समय में, ऑर्डर जटिल होता है (जैसे "7-परत वाला केक"), इसलिए यह 5 शेफ चुनता है।

सिस्टम खुद से पूछना सीख जाता है: "इस विशिष्ट ऑर्डर को कितनी मेहनत की आवश्यकता है?" और टीम के आकार को तदनुसार समायोजित करता है। यह सरल कार्यों के लिए ऊर्जा बचाता है जबकि कठिन कार्यों के लिए अतिरिक्त मदद देता है।

परिणाम क्या दिखाते हैं

लेखकों ने विभिन्न AI मॉडलों पर परीक्षण किया और पाया:

  • बेहतर टीम वर्क: शेफ (विशेषज्ञों) का उपयोग अधिक समान रूप से किया जाता है। कोई एक शेफ ओवरवर्क नहीं होता है, और कोई भी बेंच पर बैठा नहीं रहता।
  • स्मार्ट निर्णय: हेड शेफ काम के लिए कौन सी टीम सबसे अच्छी है, यह जानने में बेहतर हो जाता है।
  • दक्षता (Efficiency): डायनामिक संस्करण स्थिर (fixed) संस्करण के समान ही शानदार परिणाम प्राप्त कर सकता है, लेकिन अक्सर औसतन कम शेफ का उपयोग करता है, जिससे कंप्यूटिंग पावर की बचत होती है।

संक्षेप में, ProbMoE चयन की एक कठोर, "सब-या-कुछ-नहीं" वाली प्रक्रिया को एक लचीले, सीखने के अनुकूल संभाव्यता खेल में बदल देता है, जिससे बड़े AI मॉडल स्मार्ट, अधिक स्थिर और अधिक कुशल बनते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →