← नवीनतम पेपर
💬 NLP

Attention-Discounted Adaptive Sampler for Masked Diffusion Language Models

यह शोध पत्र ADAS को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त पुनर्रैंकिंग नियम (reranking rule) है जो अनिश्चित भविष्यवाणियों वाले पहले से चयनित स्थानों पर दृढ़ता से ध्यान केंद्रित करने वाले संभावित टोकनों को लालची रूप से कम करके (greedily discounting) मास्क्ड डिफ्यूजन लैंग्वेज मॉडल्स में अत्यधिक समानांतर डिकोडिंग की गुणवत्ता में सुधार करता है, जिससे सटीकता बनाए रखते हुए इन्फरेंस स्टेप्स को कम किया जा सके।

मूल लेखक: Yusuf Sahin, Ahmed Rockey Saikia, Volkan Cevher, Paolo Favaro

प्रकाशित 2026-06-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yusuf Sahin, Ahmed Rockey Saikia, Volkan Cevher, Paolo Favaro

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल पहेली को हल करने की कोशिश कर रहे हैं, लेकिन एक बार में एक टुकड़ा रखने के बजाय, आप काम को तेज़ी से पूरा करने के लिए एक साथ कई टुकड़े रखना चाहते हैं। यह एक नए प्रकार के AI द्वारा सामना की जाने वाली चुनौती है जिसे मास्क्ड डिफ्यूजन लैंग्वेज मॉडल (Masked Diffusion Language Model) कहा जाता है।

ये मॉडल एक ऐसे वाक्य से शुरुआत करते हैं जो छिपे हुए "मास्क" (खाली स्थानों) से भरा होता है और धीरे-धीरे उन्हें भरता जाता है। लक्ष्य एक ही चरण में अधिक से अधिक खाली स्थानों को भरना है ताकि समय बचाया जा सके। हालाँकि, इसमें एक पेच है: सिर्फ इसलिए कि आप एक विशिष्ट खाली स्थान को भरने के बारे में आश्वस्त हैं, इसका मतलब यह नहीं है कि आपको इसे इसके पड़ोसी के साथ एक ही समय में भरना चाहिए। कभी-कभी, दो खाली स्थान गहराई से जुड़े होते हैं; यदि आप एक का गलत अनुमान लगाते हैं, तो यह दूसरे के अनुमान को खराब कर देता है।

यह पेपर एक मुफ्त टूल ADAS (अटेंशन-डिस्काउंटेड एडेप्टिव सैंपलर) पेश करता है जो AI को स्मार्ट समूह निर्णय लेने में मदद करने के लिए है।

समस्या: "नाज़ुक समूह" (The Fragile Group)

AI के वर्तमान अनुमानों को एक समूह के दोस्तों की तरह समझें जो रात के खाने के मेनू पर निर्णय लेने की कोशिश कर रहे हैं।

  • पुराना तरीका (मानक सैंपलर): AI प्रत्येक मित्र को व्यक्तिगत रूप से देखता है। "एलिस 90% सुनिश्चित है कि उसे पिज्जा चाहिए। बॉब 90% सुनिश्चित है कि उसे पास्ता चाहिए।" इसलिए, AI कहता है, "बहुत बढ़िया! चलिए अभी दोनों ऑर्डर करते हैं।"
  • दोष: क्या होगा यदि एलिस और बॉब एक ऐसा जोड़ा हैं जो हमेशा बहस करते हैं? यदि AI उन्हें एक साथ निर्णय लेने के लिए मजबूर करता है, तो वे एक-दूसरे को रद्द कर सकते हैं, या AI को बहुत देर से पता चल सकता है कि उनका संयुक्त चुनाव कोई अर्थ नहीं रखता। पेपर में पाया गया कि जब AI को एक साथ दो मजबूती से जुड़े शब्दों का अनुमान लगाने के लिए मजबूर किया गया, तो इसकी सटीकता 71% से गिरकर 30% हो गई। यह एक हाथ से दो नाजुक अंडों को एक साथ संभालने (जगलिंग करने) की कोशिश करने जैसा था; व्यक्तिगत रूप से वे ठीक हैं, लेकिन एक साथ वे जोखिम भरे हैं।

समाधान: ADAS ("स्मार्ट ग्रुपिंग" टूल)

ADAS एक बुद्धिमान मध्यस्थ की तरह कार्य करता है जो टुकड़ों को रखने से पहले समूह को देखता है। यह एक विशेष "अटेंशन" सिग्नल का उपयोग करता है (जिसे AI पहले से ही गणना करता है ताकि यह समझ सके कि शब्द एक-दूसरे से कैसे संबंधित हैं) ताकि समस्याओं की जाँच की जा सके।

यहाँ बताया गया है कि ADAS एक सरल उपमा का उपयोग करके कैसे काम करता है:

  1. स्कोरकार्ड: प्रत्येक खाली स्थान का एक "कॉन्फिडेंस स्कोर" (AI उत्तर के बारे में कितना आश्वस्त है) होता है।
  2. डिस्काउंट (कटौती): ADAS उन खाली स्थानों को देखता है जिन्हें AI ने इस राउंड में भरने का निर्णय लिया है। यदि एक नया उम्मीदवार खाली स्थान उस खाली स्थान को "देख" रहा है (ध्यान दे रहा है) जिसे पहले ही चुना जा चुका है और जो अभी भी अस्थिर या अनिश्चित है, तो ADAS एक डिस्काउंट लागू करता है।
    • उपमा: कल्पना कीजिए कि आप रिले रेस के लिए एक टीम चुन रहे हैं। आपके पास एक धावक है जो तेज़ है (उच्च आत्मविश्वास)। लेकिन, आप देखते हैं कि वह धावक लगातार घबराहट में अपने एक साथी की ओर देख रहा है जो अपने जूतों के फीते में उलझकर लड़खड़ा रहा है (अनिश्चित भविष्यवाणी)। ADAS कहता है, "भले ही यह धावक तेज़ है, लेकिन वह लड़खड़ाते हुए साथी से विचलित है। आइए इस विशिष्ट समूह के लिए उनकी प्राथमिकता कम कर दें ताकि हम उन्हें अभी नहीं चुनते हैं।"
  3. परिणाम: AI अभी भी सर्वश्रेष्ठ उम्मीदवारों को चुनता है, लेकिन यह उन टुकड़ों को एक साथ जोड़ने से बचता है जो "खतरनाक रूप से जुड़े" (dangerously coupled) हैं। यह उन्हें हमेशा के लिए प्रतिबंधित नहीं करता है; यह बस समूह के अधिक स्थिर होने तक प्रतीक्षा करता है।

यह क्यों विशेष है

  • प्रशिक्षण की आवश्यकता नहीं: आपको AI को सोचने का तरीका फिर से सिखाने की आवश्यकता नहीं है। ADAS एक "प्लग-एंड-प्ले" नियम है जो मौजूदा तरीकों के ऊपर स्थित है। यह एक कैमरा लेंस में नया फ़िल्टर जोड़ने जैसा है; कैमरा (AI मॉडल) वही रहता है, लेकिन तस्वीरें (आउटपुट) अधिक स्पष्ट आती हैं।
  • किसी भी नियम के साथ काम करता है: चाहे AI 5 शब्द भरे, या तब तक रुके जब तक कि वह "बहुत अनिश्चित" न हो जाए, ADAS उन सभी नियमों के साथ काम करता है। यह केवल यह बदलता है कि किन शब्दों को पहले चुना जाता है।
  • गति बनाम गुणवत्ता: पेपर ने गणितीय समस्याओं (जैसे समीकरणों को हल करना) और कोडिंग कार्यों पर इसका परीक्षण किया। उन्होंने पाया कि जब AI बहुत तेज़ होने की कोशिश करता था (एक साथ कई शब्द भरना), तो पुराने तरीकों ने कई गलतियाँ कीं। ADAS ने इसे ठीक कर दिया, औसत रूप से सटीकता में लगभग 9 से 10 प्रतिशत अंक का सुधार किया, और इसमें लगने वाला अतिरिक्त समय लगभग नगण्य था (केवल लगभग 3% धीमा)।

निष्कर्ष

पेपर का दावा है कि शब्दों को उनके अनिश्चित पड़ोसियों से बहुत करीब से बंधे होने के कारण "डिस्काउंट" देकर, AI एक साथ अधिक खाली स्थानों को सुरक्षित रूप से भर सकता है। यह एक नाजुक, उच्च-गति वाले अनुमान के खेल को एक अधिक मजबूत प्रक्रिया में बदल देता है, जिससे ये मॉडल बिना किसी अतिरिक्त प्रशिक्षण या जटिल नए हार्डवेयर के, तेज़ और अधिक सटीक दोनों हो सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →