← नवीनतम पेपर
💬 NLP

Unifying Masked Diffusion Models with Various Generation Orders and Beyond

यह शोध पत्र ऑर्डर-एक्सप्रेसिव मास्कड डिफ्यूजन मॉडल (OeMDM) फ्रेमवर्क और इसके लर्नबल वेरिएंट (LoMDM) को प्रस्तुत करता है, जो विभिन्न जनरेशन ऑर्डर्स को एकीकृत करते हैं और मौजूदा डिस्क्रीट डिफ्यूजन मॉडल्स की तुलना में बेहतर भाषा जनरेशन प्रदर्शन प्राप्त करने के लिए डिफ्यूजन बैकबोन के साथ ऑर्डरिंग पॉलिसीज़ को स्क्रैच से संयुक्त रूप से अनुकूलित करते हैं।

मूल लेखक: Chunsan Hong, Sanghyun Lee, Jong Chul Ye

प्रकाशित 2026-05-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chunsan Hong, Sanghyun Lee, Jong Chul Ye

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र "Unifying Masked Diffusion Models with Various Generation Orders and Beyond" की व्याख्या दी गई है।

बड़ी तस्वीर: "रैंडम पेंटर" को ठीक करना

कल्पना कीजिए कि आप एक रोबोट को चित्र बनाना सिखाने की कोशिश कर रहे हैं, लेकिन एक खाली कैनवास से एक-एक ब्रशस्ट्रोक जोड़ने के बजाय (जैसा कि एक मानव कलाकार करता है), आप एक ऐसे कैनवास से शुरू करते हैं जो पूरी तरह से ग्रे पेंट से ढका हुआ है।

रोबोट का काम: रोबोट को यह समझना होगा कि अंतिम छवि को प्रकट करने के लिए उसे ग्रे पेंट के किन हिस्सों को हटाना है। Masked Diffusion Models (MDMs) टेक्स्ट लिखने के लिए इसी तरह काम करते हैं। वे "मास्क" (ग्रे पेंट) से भरे एक वाक्य से शुरू होते हैं और पूर्ण वाक्य प्रकट होने तक एक-एक करके शब्दों को अनमास्क (unmask) करने की कोशिश करते हैं।

समस्या: इस पुराने संस्करण वाले रोबोट में, जिस क्रम में वह ग्रे पेंट को हटाता था, वह रैंडम (यादृच्छिक) था। वह पहले वाक्य का आखिरी शब्द हटा सकता था, फिर पहला शब्द, फिर बीच का शब्द।

  • उपमा: कल्पना कीजिए कि आप एक जिग्सॉ पहेली (jigsaw puzzle) सुलझाने की कोशिश कर रहे हैं, लेकिन आपको बिना देखे एक बैग से टुकड़े चुनने के लिए मजबूर किया जाता है। आप आसमान के बीच में एक कोने वाला टुकड़ा फिट करने की कोशिश कर सकते हैं। यह अंततः काम तो करता है, लेकिन यह अक्षम है और अंतिम चित्र अक्सर थोड़ा अस्त-व्यस्त दिखता है।

यह शोध पत्र तर्क देता है कि जिस क्रम में रोबोट शब्दों को प्रकट करता है, वह उतना ही महत्वपूर्ण है जितना कि रोबोट की शब्दों को पहचानने की क्षमता।


भाग 1: "यूनिवर्सल ट्रांसलेटर" (OeMDM)

लेखकों ने सबसे पहले OeMDM (Order-Expressive Masked Diffusion Model) नामक एक नया ढांचा बनाया। इसे लिखने के विभिन्न तरीकों के लिए एक यूनिवर्सल ट्रांसलेटर समझें।

  • पुराने तरीके:

    • Autoregressive Models (ARMs): एक सख्त शिक्षक की तरह जो कहता है, "आपको पहला शब्द लिखना होगा, फिर दूसरा, फिर तीसरा।" (बाएँ-से-दाएँ)।
    • Block Diffusion: एक ऐसे शिक्षक की तरह जो कहता है, "पहले चार शब्द लिखें, फिर अगले चार।"
    • Random Diffusion: एक ऐसे शिक्षक की तरह जो कहता है, "अगला शब्द लिखने के लिए कोई भी शब्द चुनें।"
  • OeMDM नवाचार: लेखकों ने महसूस किया कि ये सभी अलग-अलग विधियाँ वास्तव में एक ही मशीन के विभिन्न सेटिंग्स हैं। उन्होंने एक गणितीय "लेंस" बनाया जो दिखाता है कि कैसे शेड्यूल (वह नियम जिससे तय होता है कि अगला शब्द कब प्रकट करना है) बदलने से पूरी प्रक्रिया बदल जाती है।

    • रूपक: एक संगीत कंडक्टर (conductor) की कल्पना करें। पहले, हमारे पास एक सख्त मार्च (बाएँ-से-दाएँ) के लिए एक कंडक्टर था, एक जैज़ इम्प्रोवाइजेशन (रैंडम) के लिए एक कंडक्टर था, और एक ब्लॉक रिदम के लिए एक कंडक्टर था। लेखकों ने एक सुपर-कंडक्टर बनाया जो केवल शीट म्यूजिक (शेड्यूल) बदलकर किसी भी शैली का संचालन कर सकता है, यह सिद्ध करते हुए कि वे सभी एक ही ऑर्केस्ट्रा का हिस्सा हैं।

भाग 2: "स्मार्ट कंडक्टर" (LoMDM)

एक बार जब उनके पास यूनिवर्सल ट्रांसलेटर आ गया, तो उन्होंने पूछा: "हमें शेड्यूल को मैन्युअल रूप से क्यों चुनना पड़ता है? ऐसा क्यों नहीं होता कि रोबोट खुद सबसे अच्छा शेड्यूल सीख ले?"

इससे उनका मुख्य आविष्कार हुआ: LoMDM (Learnable-Order Masked Diffusion Model)।

  • यह कैसे काम करता है: केवल शब्दों का अनुमान लगाने के बजाय, अब रोबोट के पास एक दूसरा मस्तिष्क (एक शेड्यूलर) है जो वाक्य के संदर्भ (context) के आधार पर यह तय करता है कि कौन सा शब्द कब प्रकट करना है।

    • उपमा: एक जटिल भोजन पकाते हुए एक शेफ की कल्पना करें।
      • पुराना रोबोट: शेफ उम्मीद में रैंडम क्रम में सामग्री बर्तन में डालता है कि सूप का स्वाद अच्छा होगा।
      • LoMDM: एक स्मार्ट सहायक है जो फुसफुसाता है, "ठीक है, सूप उबल रहा है, लेकिन गाजर डालने से पहले अभी नमक की आवश्यकता है।"
    • रोबोट सीखता है कि कुछ शब्द (जैसे "the" या "and") संरचनात्मक होते हैं और उन्हें वाक्य का ढांचा बनाने के लिए जल्दी प्रकट किया जाना चाहिए। अन्य शब्द (जैसे विशिष्ट संज्ञा या क्रिया) बाद में प्रकट किए जाने चाहिए जब संदर्भ अधिक स्पष्ट हो।
  • जादुई ट्रिक: रोबोट एक ही लक्ष्य का उपयोग करके "शब्दों" और "क्रम" दोनों को एक साथ सीखता है। इसे दो अलग-अलग प्रशिक्षण चरणों की आवश्यकता नहीं है। यह एक साथ साइकिल चलाने और संतुलन बनाने को सीखने जैसा है, न कि पहले पेडल चलाना सीखने और फिर बाद में संतुलन बनाने की कोशिश करने जैसा।

भाग 3: परिणाम (द रेस)

लेखकों ने अपने नए रोबोट (LoMDM) का कई भाषाई कार्यों पर पुराने रोबोटों के मुकाबले परीक्षण किया।

  • परिणाम: LoMDM तेज़ और बेहतर था।
    • गति: इसने मौजूदा सर्वोत्तम मॉडलों के समान गुणवत्ता तक 20% से भी कम समय (या प्रशिक्षण चरणों) में पहुँच लिया।
    • गुणवत्ता: इसने अधिक सुसंगत टेक्स्ट बनाया और इसमें "परप्लेक्सिटी" (perplexity - एक तकनीकी शब्द जिसका अर्थ है कि टेक्स्ट कम भ्रमित करने वाला और अधिक प्राकृतिक था) कम थी।
    • "कोर्स-टू-फाइन" (Coarse-to-Fine) खोज: जब उन्होंने देखा कि LoMDM कैसे लिखता है, तो उन्हें एक पैटर्न दिखाई दिया। यह बाएँ-से-दाएँ नहीं लिखता था। इसके बजाय, यह पहले संरचना, फिर विवरण लिखता था।
      • उदाहरण: यह "The," "cat," और "sat" (ढांचा) को प्रकट करेगा, इससे पहले कि वह "on," "the," "mat" (विवरण) को प्रकट करे। यह वॉलपेपर लगाने से पहले घर का फ्रेम बनाता है।

एक वाक्य में सारांश

लेखकों ने एक नया AI सिस्टम बनाया जो यह सीखता है कि क्या कहना है और कब कहना है, दोनों चीजें एक साथ, जिससे यह पिछले तरीकों की तुलना में बहुत तेज़ी से और अधिक स्वाभाविक रूप से टेक्स्ट लिखने में सक्षम होता है जो या तो रैंडम क्रम का अनुमान लगाते थे या कठोर नियमों का पालन करते थे।

यह पेपर क्या दावा नहीं करता है

  • यह दावा नहीं करता कि यह एक चिकित्सा उपकरण या क्लिनिकल डिवाइस है।
  • यह दावा नहीं करता कि यह पूरी तरह से मानव लेखकों की जगह लेगा या सभी AI समस्याओं को हल करेगा।
  • यह दावा नहीं करता कि यह छवियों या ऑडियो के लिए काम करता है (यह विशेष रूप से टेक्स्ट/भाषा के लिए है)।
  • यह दावा नहीं करता कि यह एक "अंतिम" समाधान है, बल्कि यह बताता है कि यह डिफ्यूजन मॉडल्स द्वारा टेक्स्ट को संभालने के तरीके में एक महत्वपूर्ण प्रगति है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →