← नवीनतम पेपर
💬 NLP

DLLG: Dynamic Logit-Level Gating of LLM Experts

यह शोध पत्र DLLG को प्रस्तुत करता है, जो एक डायनेमिक लॉजिट-लेवल गेटिंग फ्रेमवर्क है जो स्पार्स रिस्पॉन्स-लेवल सुपरविजन से टोकन-लेवल एक्सपर्ट फ्यूजन को सीखता है ताकि टोकन-लेवल लेबल या एक्सपर्ट रिट्रेनिंग की आवश्यकता के बिना विशिष्ट LLMs को प्रभावी ढंग से संयोजित किया जा सके, और विविध बेंचमार्क पर मौजूदा रूटिंग, एनसेम्बलिंग और मर्जिंग दृष्टिकोणों से लगातार बेहतर प्रदर्शन करता है।

मूल लेखक: Bingnan Li, Zhaoyang Zhang, Xiaoze Liu, Yantao Shen, Shuli Jiang, Shuo Yang, Wei Xia, Zhuowen Tu, Stefano Soatto

प्रकाशित 2026-06-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bingnan Li, Zhaoyang Zhang, Xiaoze Liu, Yantao Shen, Shuli Jiang, Shuo Yang, Wei Xia, Zhuowen Tu, Stefano Soatto

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक ही प्रोजेक्ट पर काम करने वाली तीन प्रतिभाशाली विशेषज्ञों की एक टीम है: एक मैथ विजार्ड (गणित का जादूगर), एक कोड निंजा, और एक लॉजिक डिटेक्टिव (तर्क का जासूस)। आपका लक्ष्य उन्हें मिलकर एक जटिल समस्या को हल करने के लिए काम पर लगाना है जिसके लिए इन तीनों कौशलों की आवश्यकता है।

यह पेपर इस टीम को प्रबंधित करने का एक नया तरीका पेश करता है जिसे DLLG (डायनेमिक लॉजिट-लेवल गेटिंग) कहा जाता है। यह समझने के लिए कि यह क्यों विशेष है, आइए देखते हैं कि अन्य तरीके इन विशेषज्ञों को प्रबंधित करने की कोशिश कैसे करते हैं और वे अक्सर क्यों विफल हो जाते हैं।

पुराने तरीके (और उनकी विफलता के कारण)

  1. "एक को चुनो और प्रार्थना करो" विधि (रूटिंग - Routing):
    कल्पना कीजिए कि एक मैनेजर आपकी समस्या के पहले वाक्य को देखता है और तुरंत चिल्लाता है, "ठीक है, अब कोड निंजा प्रभारी है!" समस्या यह है कि क्या होगा यदि अगला वाक्य गणित के बारे में हो? मैनेजर ने एक "असमय प्रतिबद्धता" (premature commitment) कर दी। एक बार जब कोड निंजा गणित की समस्या के लिए कोड लिखना शुरू कर देता है, तो पूरा उत्तर खराब हो जाता है, और उसे ठीक करने का कोई तरीका नहीं बचता। यह एक प्लंबर को आपकी कार का इंजन ठीक करने के लिए काम पर रखने जैसा है क्योंकि कार से शोर आ रहा था; जब तक आपको गलती का एहसास होता है, तब तक इंजन जल चुका होता है।

  2. "अनुमान लगाने वाला खेल" विधि (ह्यूरिस्टिक एनसेम्बलिंग - Heuristic Ensembling):
    यह दृष्टिकोण विशेषज्ञों को मिश्रित करने की कोशिश करता है और पूछता है, "अभी कौन सबसे अधिक आत्मविश्वासी लग रहा है?" या "कौन सबसे तेज़ बोल रहा है?" यह एक डीजे (DJ) की तरह है जो गानों को इस आधार पर मिक्स करता है कि कौन सा गाना सबसे तेज़ सुनाई दे रहा है। हालांकि यह केवल एक को चुनने से बेहतर है, लेकिन यह अस्थिर संकेतों (proxies) पर निर्भर करता है जो हमेशा यह नहीं बताते कि उत्तर वास्तव में सही है या नहीं। यह एक शेफ के भोजन का स्वाद चखने के बजाय इस आधार पर निर्णय लेने जैसा है कि वह कितनी तेज़ी से सब्जियां काट रहा है।

  3. "स्मूदी" विधि (पैरामीटर मर्जिंग - Parameter Merging):
    यह मैथ विजार्ड, कोड निंजा और लॉजिक डिटेक्टिव के दिमाग को लेता है, उन्हें एक एकल "सुपर ब्रेन" में मिला देता है, और फिर उसे फ्रीज कर देता है। समस्या यह है कि उनके विचार आपस में टकरा सकते हैं। उन्हें मिलाना तेल और पानी को मिलाने जैसा है; परिणाम एक गंदा मिश्रण होता है जहाँ प्रत्येक विशेषज्ञ की विशिष्ट प्रतिभा खो जाती है या एक-दूसरे को रद्द कर देती है। आप कौशलों के बीच गतिशील रूप से स्विच करने की क्षमता खो देते हैं।

नया तरीका: DLLG (द "स्मार्ट कंडक्टर")

लेखक DLLG का प्रस्ताव करते हैं, जो एक ऑर्केस्ट्रा के लिए एक गतिशील, सुपर-स्मार्ट कंडक्टर की तरह कार्य करता है।

एक संगीतकार को पूरा गाना बजाने के लिए चुनने के बजाय, या उनके वाद्य यंत्रों को एक गंदे शोर में मिलाने के बजाय, कंडक्टर संगीत को नोट-दर-नोट (टोकन-दर-टोकन) सुनता है।

  • यह कैसे काम करता है:

    • जैसे-जैसे टीम एक उत्तर तैयार करती है, कंडक्टर देखता है कि उस सटीक क्षण में मैथ विजार्ड, कोड निंजा और लॉजिक डिटेक्टिव क्या सोच रहे हैं।
    • यदि वाक्य "क्षेत्रफल की गणना करने" के बारे में है, तो कंडक्टर मैथ विजार्ड की आवाज़ तेज़ कर देता है और दूसरों को धीमा कर देता है।
    • ठीक अगला वाक्य "इसे प्लॉट करने के लिए एक पायथन स्क्रिप्ट लिखें" हो सकता है, इसलिए कंडक्टर तुरंत आवाज़ को कोड निंजा की ओर स्थानांतरित कर देता है।
    • यह प्रति सेकंड हजारों बार होता है, जिससे विशेषज्ञों की आवाज़ों का सहज मिश्रण होता है।
  • सीक्रेट सॉस (बिना शिक्षक के सीखना):
    आमतौर पर, एक कंडक्टर को सिखाने के लिए, आपको एक शिक्षक की आवश्यकता होगी जो हर एक नोट की ओर इशारा करे और कहे, "यहाँ मैथ विजार्ड का उपयोग करें।" लेकिन पेपर कहता है कि हमारे पास इतना विवरण नहीं है। हम केवल यह जानते हैं कि अंतिम उत्तर सही था या गलत।

    DLLG बहुत चतुर है क्योंकि यह इन अंतिम परिणामों से सीखता है। यह पूरी बातचीत को देखता है, देखता है कि अंतिम उत्तर सही था, और पीछे की ओर काम करता है यह पता लगाने के लिए कि: "आह, मुझे गणना वाले हिस्से के दौरान मैथ विजार्ड को सुनना चाहिए था और कोडिंग वाले हिस्से के दौरान कोड निंजा को सुनना चाहिए था।" यह केवल इस परिणाम से सीखता है कि सफलता सफल रही, और विशेषज्ञों के बीच स्विच करने की सही लय सीख जाता है।

यह क्यों महत्वपूर्ण है

पेपर दिखाता है कि यह "स्मार्ट कंडक्टर" दृष्टिकोण कई अलग-अलग परीक्षणों (गणित की समस्याओं, कोडिंग चुनौतियों और तर्क पहेलियों) में पुराने तरीकों की तुलना में बेहतर काम करता है।

  • यह लचीला है: यह जल्दी में गलत चुनाव करने में नहीं फंसता। यदि कार्य बीच में बदल जाता है, तो कंडक्टर तुरंत मिश्रण बदल देता है।
  • यह विशेषज्ञों की शुद्धता बनाए रखता है: मैथ विजार्ड मैथ विजार्ड ही रहता है; वह कोड निंजा के साथ मिश्रित नहीं होता। वे बस बारी-बारी से बातचीत का नेतृत्व करते हैं।
  • यह कुशल है: इसके लिए विशेषज्ञों को फिर से प्रशिक्षित करने या किसी मानव शिक्षक द्वारा हर एक शब्द को लेबल करने की आवश्यकता नहीं होती है।

संक्षेप में, DLLG एक ऐसा सिस्टम है जो वास्तविक समय में विभिन्न AI विशेषज्ञों की आवाजों को गतिशील रूप से मिलाने का तरीका सीखता है, यह सुनिश्चित करता है कि सही समय पर सही विशेषज्ञ बोले, और यह सब करते हुए यह कदम-दर-कदम गाइड के बजाय उत्तर की अंतिम सफलता से सीखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →