← नवीनतम पेपर
🤖 machine learning

Hierarchical Copula-Gumbel-Top-\texorpdfstring{KK}{K} Routing: Two-Sided Dependence Control for Frozen Mixture-of-Experts at Fixed Per-Token Routing Laws

यह शोध पत्र 'Hierarchical Copula-Gumbel-Top-KK Routing' प्रस्तुत करता है, जो फ्रोजन 'Mixture-of-Experts' मॉडल्स के लिए एक ऐसी विधि है जो व्यक्तिगत टोकन रूटिंग नियमों को सुरक्षित रखते हुए, एक प्रशिक्षित नियंत्रक (trainable controller) के माध्यम से विशेषज्ञ भार भिन्नता (expert load variance) और सुसंगतता (coherence) को प्रबंधित करने के लिए द्वि-पक्षीय निर्भरता नियंत्रण तंत्र (सकारात्मक समूह-भीतर सहसंबंध और नकारात्मक क्रॉस-ग्रुप विरोध) का उपयोग करती है।

मूल लेखक: Richard Yi Da Xu

प्रकाशित 2026-08-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Richard Yi Da Xu

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हलचल भरी लाइब्रेरी चला रहे हैं जहाँ हर सेकंड हज़ारों किताबों (टोकन) को प्रोसेस करने की ज़रूरत है। इस भार को संभालने के लिए, आपके पास एक विशाल लाइब्रेरियन नहीं है; इसके बजाय, आपके पास विभिन्न विषयों जैसे इतिहास, कोडिंग या कविता के विशेषज्ञ विशेषज्ञों की एक टीम है। आधुनिक AI मॉडल जिन्हें "Mixture-of-Experts" (MoE) कहा जाता है, वे इसी तरह काम करते हैं। वे कुशल होने के लिए डिज़ाइन किए गए हैं क्योंकि वे प्रत्येक पुस्तक को केवल उन कुछ विशेषज्ञों के पास भेजते हैं जो उसे समझने में सबसे अच्छे हैं, बजाय इसके कि पूरी टीम से हर एक पन्ना पढ़वाया जाए।

कठिन हिस्सा यह तय करना है कि किन विशेषज्ञों को कौन सी किताबें मिलेंगी। आमतौर पर, यह निर्णय एक "रूटर" द्वारा लिया जाता है, जो एक स्मार्ट ट्रैफिक पुलिस की तरह है जो एक किताब को देखता है और मदद के लिए शीर्ष कुछ विशेषज्ञों को बेतरतीब ढंग से चुन लेता है। यह यादृच्छिकता (randomness) महत्वपूर्ण है; यह सिस्टम को लचीला बनाए रखती है और AI को एक ही ढर्रे में फंसने से रोकती है। हालाँकि, एक छिपा हुआ मुद्दा है: यदि रूटर हर एक किताब के लिए अपने चुनाव पूरी तरह से स्वतंत्र रूप से करता है, तो ट्रैफ़िक अराजक हो सकता है। कभी-कभी, संबंधित किताबों का एक पूरा समूह गलती से एक ही समय में एक ही विशेषज्ञ के पास भेजा जा सकता है, जिससे ट्रैफ़िक जाम (एक "बर्स्ट" लोड) हो जाता है, जबकि अन्य विशेषज्ञ खाली बैठे रहते हैं। बड़ा सवाल यह है: क्या हम किसी भी पुस्तक को रूट करने के मौलिक नियमों को बदले बिना, ट्रैफ़िक जाम को सुचारू करने के लिए इन विकल्पों में समन्वय कर सकते हैं?

यह शोध पत्र ठीक इसी को हल करने के लिए एक चतुर नया सिस्टम पेश करता है जिसे Hierarchical Copula-Gumbel-Top-K (H-CGA) कहा जाता है। इस रूटर के निर्णय लेने की प्रक्रिया को 'म्यूजिकल चेयर्स' के खेल के रूप में समझें जहाँ संगीत यादृच्छिक शोर (random noise) है। लेखक ने महसूस किया कि हालांकि आप किसी भी एकल खिलाड़ी के लिए खेल के नियम नहीं बदल सकते (AI के ज्ञान को बरकरार रखने के लिए "रूटिंग लॉ" बिल्कुल वैसा ही रहना चाहिए), लेकिन आप समूहों के लिए संगीत कैसे बजता है, इसे बदल सकते हैं।

उन्होंने एक "कोपुला" (copula) नामक गणितीय उपकरण का उपयोग करके एक दो-तरफा नियंत्रण प्रणाली बनाई है, जो एक मास्टर कंडक्टर की तरह है।

  1. "बडी" डायल (पॉजिटिव कपलिंग): संबंधित टोकन के एक छोटे समूह के भीतर (जैसे एक ही वाक्य में शब्द), सिस्टम उनके यादृच्छिक विकल्पों को "बडी" (दोस्त) बनाता है। यदि एक टोकन को किसी विशिष्ट विशेषज्ञ की ओर धकेला जाता है, तो उसके पड़ोसियों को भी समान धक्का मिलता है। यह संबंधित टोकनों को एक साथ चिपके रहने में मदद करता है, जिससे वे अक्सर एक ही विशेषज्ञों का उपयोग करते हैं। यह दोस्तों के एक समूह के एक ही कॉफी शॉप पर जाने के निर्णय जैसा है; यह स्थानीय सामंजस्य और सुसंगतता पैदा करता है।
  2. "राइवल" डायल (नेगेटिव कपलिंग): लेकिन क्या होगा यदि उन सभी दोस्तों के एक ही दुकान पर जाने से वहां लाइन लग जाए? सिस्टम के पास एक दूसरा डायल है जो टोकन के विभिन्न समूहों को जोड़ता है और उन्हें "राइवल" (प्रतिद्वंद्वी) बनाता है। यदि समूह A को विशेषज्ञ X की ओर धकेला जाता है, तो समूह B को विशेषज्ञ X से दूर धकेला जाता है। यह एंटिटिक (antithetic) हिस्सा है: यह विभिन्न समूहों को एक-दूसरे को संतुलित करने के लिए मजबूर करता है, जिससे एक ही समय में पूरे सिस्टम पर एक ही विशेषज्ञ का भार नहीं पड़ता।

सबसे प्रभावशाली बात यह है कि यह शोध इस बात का प्रमाण देता है कि हम इन डायल को घुमाकर इन्हें कम या ज्यादा कर सकते हैं बिना कुछ भी बिगाड़े। लेखक ने गणितीय रूप से सिद्ध किया कि हम समूहों को कितना भी समन्वित करें, किसी भी एकल टोकन के किसी विशिष्ट विशेषज्ञ को भेजे जाने की संभावना बिल्कुल वैसी ही रहती है जैसी कि सिस्टम पूरी तरह से यादृच्छिक होता। यह ऐसा ही है जैसे कि आपने किसी शहर के ट्रैफ़िक पैटर्न को पुनर्गठित किया हो, बिना किसी भी कार के गंतव्य को बदले।

लेखक ने इस विचार का परीक्षण एक छोटे, फ्रीज्ड (frozen) AI मॉडल पर किया (एक ऐसा मॉडल जिसका मुख्य मस्तिष्क लॉक है और नई चीजें नहीं सीख सकता)। उन्होंने एक छोटा, प्रशिक्षित "कंट्रोलर" जोड़ा जो इन डायल को इनपुट के आधार पर समायोजित कर सकता है। परिणाम दर्शाते हैं कि यह सिस्टम बिल्कुल वैसे ही काम करता है जैसा कि इसकी भविष्यवाणी की गई थी: इसने सफलतापूर्वक बदला कि टोकन एक साथ कैसे समूह बनाते हैं और वे एक-दूसरे का विरोध कैसे करते हैं, जबकि व्यक्तिगत रूटिंग नियमों को पूरी तरह से बरकरार रखा। हालाँकि, लेखक सावधानीपूर्वक नोट करते हैं कि यह एक तंत्र परीक्षण (mechanism test) है, कोई जादुई समाधान नहीं। जबकि सिस्टम ने सफलतापूर्वक टोकन के समूह बनाने और एक-दूसरे का विरोध करने के पैटर्न को नियंत्रित किया, इस छोटे पायलट अध्ययन ने AI के अंतिम प्रदर्शन या कार्य सटीकता में कोई बड़ा सुधार नहीं दिखाया। यह इस बात की संभावना को सिद्ध करता है कि इंजन को तोड़े बिना ट्रैफ़िक को नियंत्रित किया जा सकता है, लेकिन बड़े, जटिल कार्यों पर इसके वास्तविक दुनिया के लाभ अभी भी एक खुला प्रश्न हैं।

संक्षेप में, यह शोध पत्र AI ट्रैफ़िक की अराजकता को प्रबंधित करने का एक नया तरीका प्रदान करता है। यह हमें यह बनाने का तरीका देता है कि कैसे संबंधित विचारों को एक साथ चिपकाया जाए और असंबंधित विचारों को फैलाया जाए, जबकि AI के मूल नियमों को अछूता रखा जाए। यह इन विशाल मॉडलों को अधिक सुचारू रूप से चलाने के लिए एक आशाजनक उपकरण है, भले ही हम अभी भी यह समझने की कोशिश कर रहे हैं कि वे वास्तव में कितने सुचारू हो सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →