← नवीनतम पेपर
📊 statistics

Adaptation to Intrinsic Dependence in Diffusion Language Models

यह शोध पत्र डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक वितरण-अज्ञेय (distribution-agnostic), रैंडमाइज्ड अनमास्किंग शेड्यूल प्रस्तुत करता है जो पूर्व ज्ञान के बिना डेटा की अंतर्निहित निर्भरता संरचना के अनुकूल होता है, जिससे पूर्ववर्ती नियतात्मक (deterministic) विधियों की तुलना में समानांतर व्यवस्थाओं (parallel regimes) में बेहतर अभिसरण गारंटी और सैंपलिंग त्वरण प्राप्त होता है।

मूल लेखक: Yunxiao Zhao, Changxiao Cai

प्रकाशित 2026-02-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yunxiao Zhao, Changxiao Cai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फटे हुए, 1,000 टुकड़ों वाले पज़ल को फिर से जोड़ने की कोशिश कर रहे हैं, लेकिन आप डिब्बे पर बनी तस्वीर नहीं देख सकते। आपके पास एक बहुत ही समझदार सहायक (AI मॉडल) है जो जानता है कि उस पज़ल को वास्तव में कैसा दिखना चाहिए, लेकिन वह केवल तभी बता सकता है कि कोई टुकड़ा कैसा होगा जब वह उसके आस-पास के टुकड़ों को देख सके।

डिफ्यूजन लैंग्वेज मॉडल्स (DLMs) की दुनिया में, वे बिल्कुल इसी तरह काम करते हैं। वे एक खाली कैनवास (एक "मास्क्ड" या छिपे हुए टोकन का अनुक्रम) से शुरू होते हैं और एक सुसंगत वाक्य या कहानी बनाने के लिए खाली जगहों को भरने की कोशिश करते हैं।

पुराना तरीका: "एक-एक करके" बनाम "अंधा अनुमान"

पारंपरिक रूप से, AI मॉडल (जैसे कि वे जिनसे आप चैट करते हैं) टेक्स्ट को एक बार में एक शब्द करके, बाएं से दाएं बनाते हैं। यह पज़ल को एक-एक टुकड़े करके हल करने जैसा है। यह सटीक है, लेकिन यह धीमा है क्योंकि आपको अगला टुकड़ा उठाने से पहले प्रत्येक टुकड़े का इंतज़ार करना पड़ता है।

DLMs तेज़ होने की कोशिश करते हैं क्योंकि वे एक साथ कई टुकड़ों को भर सकते हैं (पैरेलल जनरेशन)। हालाँकि, इसमें एक पेच है:

  • समस्या: यदि आप एक साथ 10 टुकड़ों का अनुमान लगाते हैं, तो हो सकता है कि वे सभी गलत हो जाएं क्योंकि वे 10 टुकड़े एक-दूसरे पर निर्भर हैं। यदि आप उन्हें एक-एक करके चुनते हैं, तो आप सही होते हैं, लेकिन यह धीमा होता है।
  • पुराना समाधान: शोधकर्ताओं ने यह तय करने के लिए एक "परफेक्ट शेड्यूल" खोजने की कोशिश की कि प्रत्येक चरण में कितने टुकड़ों का अनुमान लगाया जाए। कुछ ने एक निश्चित संख्या चुनी (जैसे, हमेशा 10 टुकड़े)। अन्य ने यह बताने के लिए कोशिश की कि AI कितना "आत्मविश्वास" महसूस कर रहा है। लेकिन ये तरीके कठोर थे। वे उस विशिष्ट पज़ल के अनुकूल नहीं थे जिसे आप हल करने की कोशिश कर रहे थे।

नया विचार: "रैंडमाइज्ड डांस" (यादृच्छिक नृत्य)

यह पेपर एक चतुर नई रणनीति पेश करता है। यह पहले से यह तय करने के बजाय कि "मैं 10 टुकड़े, फिर 5, फिर 2 टुकड़े चुनूंगा," एक रैंडमाइज्ड शेड्यूल का प्रस्ताव देता है।

इसे एक डांस पार्टी की तरह समझें जहाँ आपको लोगों को समूहों में डांस फ्लोर पर आमंत्रित करने की आवश्यकता है।

  • पुराना तरीका: डीजे एक निश्चित प्लेलिस्ट बजाता है: "समूह 10 का, फिर समूह 5 का, फिर समूह 2 का।" यदि भीड़ ऊर्जावान है, तो यह काम करता है। यदि वे शर्मीले हैं, तो यह विफल हो जाता है।
  • नया तरीका: डीजे को भीड़ के मूड का पहले से पता नहीं होता। इसके बजाय, उनके पास एक विशेष नियम है: "प्रत्येक चरण में, मैं एक विशिष्ट प्रायिकता वक्र (प्रोबेबिलिटी कर्व) के आधार पर यादृच्छिक रूप से एक समूह का आकार चुनूंगा।"

आश्चर्यजनक रूप से, यह रैंडमनेस (यादृच्छिकता) ही असली सफलता का मंत्र है। टुकड़ों के समूहों के आकार को रैंडमाइज करके, AI अनजाने में डेटा की छिपी हुई संरचना को सीख लेता है, बिना यह जाने कि वह संरचना क्या है।

"सीक्रेट सॉस": टोटल कोरिलेशन (TC) और डुअल टोटल कोरिलेशन (DTC)

यह समझने के लिए कि यह क्यों काम करता है, कल्पना कीजिए कि पज़ल के टुकड़ों के बीच छिपे हुए संबंध हैं:

  1. टोटल कोरिलेशन (TC): यह मापता है कि टुकड़े पूरे समूह पर कितने निर्भर हैं। यदि पज़ल एक सरल वाक्य है जैसे "The cat sat," तो शब्द एक-दूसरे पर बहुत अधिक निर्भर होते हैं।
  2. डुअल टोटल कोरिलेशन (DTC): यह मापता है कि टुकड़े बाकी दुनिया (संदर्भ) पर कितने निर्भर हैं।

यह पेपर साबित करता है कि उनका रैंडमाइज्ड तरीका स्वचालित रूप से इस बात के अनुकूल हो जाता है कि इन दोनों में से कौन सी "निर्भरता" बाधा (बॉटलनेक) है।

  • यदि पज़ल एक सरल, कम जटिल पैटर्न (जैसे चेकसम या दोहराव वाली लय) है, तो AI बहुत तेज़ी से आगे बढ़ता है।
  • यदि पज़ल जटिल है, तो AI ठीक उतना ही धीमा हो जाता है जितना कि सही होने के लिए आवश्यक है।

जादू: AI को यह बताने की आवश्यकता नहीं है, "हे, इस डेटा की जटिलता कम है!" वह बस इन रैंडमाइज्ड डांस स्टेप्स का पालन करके इसे खुद समझ लेता है।

परिणाम: गुणवत्ता से समझौता किए बिना गति

लेखक दिखाते हैं कि यह तरीका पुराने "एक-एक करके" वाले तरीकों की तुलना में गणितीय रूप से गारंटीकृत रूप से तेज़ है, विशेष रूप से उन डेटा के लिए जिनमें सरल अंतर्निहित संरचनाएं होती हैं (जो बहुत सारे वास्तविक दुनिया के टेक्स्ट के लिए सच है)।

  • उपमा: कल्पना कीजिए कि आप एक स्विमिंग पूल भरने की कोशिश कर रहे हैं।
    • पुराना तरीका: आप एक छोटे कप का उपयोग करते हैं, एक बार में एक कप। (धीमा, लेकिन सटीक)।
    • खराब पैरेलल मेथड: आप एक साथ फायरहोज (तेज धार वाला पाइप) डालने की कोशिश करते हैं, लेकिन आप आधे समय पूल से बाहर गिर जाते हैं। (तेज़, लेकिन अव्यवस्थित)।
    • इस पेपर का तरीका: आपके पास एक जादुई पाइप है जो अपनी प्रवाह दर को बेतरतीब ढंग से समायोजित करता है। कभी यह एक फुहार होती है, तो कभी एक तेज़ धार। क्योंकि यह पूल के आकार के आधार पर रैंडमली एडजस्ट होता है, यह सबसे कम पानी बर्बाद किए बिना सबसे तेज़ी से पूल को भरता है।

यह क्यों मायने रखता है

  1. कोई ट्रेनिंग आवश्यक नहीं: आपको AI को फिर से प्रशिक्षित करने या उसे विशेष निर्देश देने की आवश्यकता नहीं है। यह नए "रैंडमाइज्ड अनमास्किंग" शेड्यूल के साथ बेहतर काम करता है।
  2. तेज़ इन्फरेंस (Inference): इसका मतलब है कि भविष्य में AI मॉडल टेक्स्ट, कोड या कहानियाँ बहुत तेज़ी से बना सकेंगे, जिससे वे अधिक रिस्पॉन्सिव और सस्ते होंगे।
  3. सैद्धांतिक सफलता: यह AI सिद्धांत में एक लंबे समय से चले आ रहे रहस्य को हल करता है: हम पैरेलल जनरेशन में गति और सटीकता के बीच संतुलन कैसे बनाएं? उत्तर है: रैंडमनेस को अपनाएं।

संक्षेप में, यह पेपर हमें सिखाता है कि कभी-कभी, किसी जटिल समस्या को कुशलतापूर्वक हल करने के लिए, आपके पास एक कठोर योजना नहीं होनी चाहिए। इसके बजाय, आपको एक स्मार्ट, रैंडमाइज्ड रिदम का पालन करना चाहिए जो डेटा के संगीत के अनुकूल हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →