← नवीनतम पेपर
💬 NLP

dMoE: dLLMs with Learnable Block Experts

यह शोध पत्र dMoE का प्रस्ताव करता है, जो डिफ्यूजन लार्ज लैंग्वेज मॉडल्स के लिए एक ब्लॉक-लेवल मिक्सचर-ऑफ-एक्सपर्ट्स फ्रेमवर्क है, जो प्रतिस्पर्धी प्रदर्शन को बनाए रखते हुए अद्वितीय रूप से सक्रिय विशेषज्ञों को कम करके मेमोरी उपयोग और इन्फरेंस लेटेंसी को महत्वपूर्ण रूप से कम करने के लिए टोकन-लेवल विशेषज्ञ वितरणों को एकत्रित करता है।

मूल लेखक: Sicheng Feng, Zigeng Chen, Gongfan Fang, Xinyin Ma, Xinchao Wang

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sicheng Feng, Zigeng Chen, Gongfan Fang, Xinyin Ma, Xinchao Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, सुपर-स्मार्ट लाइब्रेरी है (Diffusion Large Language Model, या dLLM) जो कहानियाँ लिख सकती है, गणित की समस्याओं को हल कर सकती है और सवालों के जवाब दे सकती है। इसे और भी स्मार्ट बनाने के लिए, बिना इसे बहुत भारी बनाए, आर्किटेक्ट्स ने इसमें एक विशेष फीचर जोड़ा जिसे Mixture-of-Experts (MoE) कहा जाता है।

"एक्सपर्ट्स" (विशेषज्ञों) को कल्पना करें कि वे 100 विशेषज्ञ पुस्तकालयाध्यक्षों (librarians) की एक टीम हैं। जब आप कोई सवाल पूछते हैं, तो लाइब्रेरी उन सभी 100 विशेषज्ञों से मदद नहीं मांगती। इसके बजाय, इसके पास एक "रूटर" (एक मैनेजर लाइब्रेरियन) होता है जो आपके विशिष्ट प्रश्न के लिए सबसे उपयुक्त 8 विशेषज्ञों को चुनता है। यह काम को तेज़ और कुशल बनाए रखता है।

समस्या: "ग्रुप हाइक" बनाम "सोलो हाइक"

यहीं से परेशानी शुरू हुई।

  • पुराना तरीका (Autoregressive Models): कल्पना कीजिए कि एक अकेला हाइकर (पर्वतारोही) एक समय में एक कदम चढ़कर पहाड़ पर जा रहा है। हर एक कदम पर, हाइकर मैनेजर से पूछता है, "मुझे अभी मदद के लिए किसे बुलाना चाहिए?" मैनेजर 8 विशेषज्ञों को चुनता है, वे मदद करते हैं, और फिर हाइकर अगला कदम उठाता है।
  • नया तरीका (dLLMs): नए dLLMs एक घने समूह में ग्रुप हाइकिंग करने जैसे हैं। वे एक-एक करके नहीं चलते; वे एक बार में 32 लोगों के बड़े ब्लॉक में चलते हैं। वे आगे के पूरे रास्ते को देख सकते हैं और एक साथ कई कदमों को ठीक कर सकते हैं। यह बहुत तेज़ है!

विसंगति (Mismatch):
समस्या यह थी कि "मैनेजर" (रूटर) अभी भी ऐसे काम कर रहा था जैसे वह एक अकेले हाइकर के साथ काम कर रहा हो। भले ही समूह 32 के एक ब्लॉक में चल रहा था, मैनेजर हर एक व्यक्ति के साथ अलग-अलग व्यवहार कर रहा था।

  • ब्लॉक में मौजूद व्यक्ति 1 मदद मांगता है: मैनेजर 8 विशेषज्ञों को चुनता है।
  • व्यक्ति 2 पूछता है: मैनेजर 8 दूसरे विशेषज्ञों को चुनता है।
  • ...
  • ब्लॉक में मौजूद 32वाँ व्यक्ति पूछता है: मैनेजर फिर से अन्य 8 विशेषज्ञों को चुनता है।

क्योंकि समूह एक साथ चल रहा है, मैनेजर एक ही ब्लॉक की गति को संभालने के लिए दर्जनों अलग-अलग विशेषज्ञों को बुलाने लगता है। यह एक बस ड्राइवर की तरह है जो 32 अलग-अलग कारों को ईंधन भरने के लिए 32 अलग-अलग गैस स्टेशनों पर रुकता है, भले ही वे सभी एक ही बस में सवार हों। बस फंस जाती है, मेमोरी (ईंधन) खत्म हो जाती है, और पूरी प्रक्रिया धीमी हो जाती है क्योंकि सिस्टम एक ही समय में बहुत सारे अलग-अलग विशेषज्ञों को लोड करने की कोशिश कर रहा है।

समाधान: dMoE (द "ब्लॉक मैनेजर")

लेखकों ने dMoE नामक एक नया सिस्टम प्रस्तावित किया है। उन्होंने महसूस किया कि चूंकि समूह एक साथ चलता है, इसलिए उन्हें विशेषज्ञों को चुनने के लिए एक एकल इकाई (single unit) के रूप में माना जाना चाहिए।

यहाँ बताया गया है कि dMoE कैसे काम करता है, एक सरल उदाहरण का उपयोग करते हुए:

  1. समूह का वोट (The Group Vote): ब्लॉक में प्रत्येक व्यक्ति से व्यक्तिगत रूप से यह पूछने के बजाय कि उन्हें किसकी आवश्यकता है, dMoE पूरे समूह से एक साथ वोट देने के लिए कहता है। "हे ब्लॉक, सामूहिक रूप से आपको किस तरह की मदद चाहिए?"
  2. एकीकृत सूची (The Unified List): मैनेजर सभी व्यक्तिगत वोटों को लेता है और उन्हें एक "ब्लॉक स्कोर" में मिला देता है। यदि ब्लॉक के 20 लोग "मैथ एक्सपर्ट E1" चाहते हैं और 10 लोग "मैथ एक्सपर्ट E2" चाहते हैं, तो मैनेजर देखता है कि पूरे ब्लॉक को वास्तव में E1 और E2 की आवश्यकता है।
  3. स्मार्ट शॉर्टलिस्ट (The Smart Shortlist): मैनेजर फिर इस संयुक्त सूची को देखता है और कहता है, "ठीक है, इस पूरे ब्लॉक के लिए, हमें वास्तव में केवल उन शीर्ष विशेषज्ञों की आवश्यकता है जो समूह की 90% जरूरतों को पूरा करते हैं।" वे पूरे ब्लॉक के लिए विशेषज्ञों की एक छोटी, निश्चित सूची ("कोर्सेट") बनाते हैं।
  4. परिणाम: अब, एक ब्लॉक के लिए 60+ अलग-अलग विशेषज्ञों को लोड करने के बजाय, सिस्टम केवल लगभग 14 विशेषज्ञों को लोड करता है। यह एक बस ड्राइवर के यह समझने जैसा है कि, "ओह, इस बस में मौजूद हर किसी को उन्हीं 3 स्टेशनों से ईंधन चाहिए," इसलिए वे केवल वहीं रुकते हैं।

यह क्यों महत्वपूर्ण है (परिणाम)

पेपर ने इस नए "ब्लॉक मैनेजर" का परीक्षण LLaDA2.0-mini नामक एक अत्याधुनिक मॉडल पर कठिन गणित और तर्क परीक्षणों (जैसे MATH500 और GSM8K) के माध्यम से किया।

  • कम मेमोरी: क्योंकि वे एक विशाल, अराजक सूची लोड नहीं कर रहे हैं, कंप्यूटर की मेमोरी का उपयोग लगभग 77% से 80% तक कम हो गया। यह 100 अलग-अलग औजारों वाला ट्रक ले जाने के बजाय केवल 14 आवश्यक चीजों वाला बैकपैक ले जाने जैसा है।
  • तेज़ गति: मॉडल 1.14x से 1.66x तेज़ चला। बस को अब उतने गैस स्टेशनों पर नहीं रुकना पड़ा।
  • बुद्धिमत्ता में कोई कमी नहीं: सबसे प्रभावशाली बात? मॉडल कम स्मार्ट नहीं हुआ। इसने अपनी मूल बुद्धिमत्ता का 99.11% बनाए रखा। इसने गणित की समस्याओं की उतनी ही संख्या सही हल की, बस अधिक कुशलता से।

संक्षेप में

पेपर कहता है: "हमने पाया कि जब ये नए, तेज़ AI मॉडल समूहों में काम करते हैं, तो उन्हें व्यक्तियों के रूप में मानना ट्रैफिक जाम का कारण बनता है। उन्हें एक साथ वोट देने के लिए सक्षम करके, हम कॉल किए जाने वाले श्रमिकों की संख्या को लगभग 5 गुना कम कर सकते हैं, बहुत सारी मेमोरी बचा सकते हैं, और AI को तेज़ बना सकते हैं—और वह भी अपनी दिमागी शक्ति खोए बिना।"

यह एक "लर्नेबल" (सीखने योग्य) रणनीति है, जिसका अर्थ है कि AI अपने प्रशिक्षण के दौरान इन वोटों को कैसे समूह में बांधना है, यह सीखता है, जिससे यह एक स्मार्ट, स्वचालित समाधान बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →