← नवीनतम पेपर
🤖 machine learning

On the Trainability of Masked Diffusion Language Models via Blockwise Locality

यह शोध पत्र संरचित पीढ़ी कार्यों (structured generation tasks) पर मास्क किए गए डिफ्यूजन लैंग्वेज मॉडल्स (MDMs) की प्रशिक्षण क्षमता की जांच करता है, जो यह प्रकट करता है कि मानक रैंडम-मास्किंग दृष्टिकोण अस्थिरता से ग्रस्त हैं और ऑटोरेग्रेसिव स्थिरता के साथ डिफ्यूजन-आधारित योजना के लाभों को प्रभावी ढंग से संतुलित करने के लिए नवीन ब्लॉकवाइज़ लोकैलिटी-अवेयर मॉडल्स, जिगसॉ (Jigsaw) और स्कैटर (Scatter), का प्रस्ताव करता है।

मूल लेखक: Yuxiang Wang, Yu Xiang, Baojian Zhou, Qifang Zhao, Keyue Jiang, Yanghua Xiao, Xiaoxiao Xu

प्रकाशित 2026-04-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxiang Wang, Yu Xiang, Baojian Zhou, Qifang Zhao, Keyue Jiang, Yanghua Xiao, Xiaoxiao Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वाक्य लिखना, पहेलियाँ सुलझाना या रास्ता खोजना सिखाने की कोशिश कर रहे हैं। इसे सिखाने के दो मुख्य तरीके हैं:

  1. "एक-एक-शब्द-वाला" शिक्षक (ऑटोरेग्रेसिव मॉडल): यह शिक्षक रोबोट को सख्ती से बाएं से दाएं लिखने के लिए मजबूर करता है। वह कहता है, "पहला शब्द लिखो। ठीक है, अब पहले शब्द के आधार पर दूसरा शब्द लिखो। अब तीसरा..." यह बहुत व्यवस्थित है और कहानी का पालन करने में बहुत अच्छा है, लेकिन अगर रोबोट पहले वाक्य में गलती कर दे, तो वह फंस जाता है। वह पूरे को फिर से लिखे बिना शुरुआत को ठीक नहीं कर सकता।

  2. "स्क्रैच-एंड-स्निफ" शिक्षक (मास्क्ड डिफ्यूजन मॉडल): यह शिक्षक रोबोट को एक ऐसा पन्ना देता है जहाँ कुछ शब्द छिपे हुए (मास्क्ड) होते हैं। रोबोट दिखाई देने वाले शब्दों को देखता है और छिपे हुए शब्दों का अनुमान लगाने की कोशिश करता है। फिर, वह शब्दों का एक अलग सेट छिपा देता है और फिर से अनुमान लगाता है। वह अपने उत्तर को बार-बार सुधारता रहता है, जब तक कि पूरा पन्ना एकदम सही न हो जाए। यह गलतियों को सुधारने और "बड़ी तस्वीर" देखने के लिए बहुत अच्छा है, लेकिन यह अराजक और प्रशिक्षित करना कठिन हो सकता है।

समस्या
लेखकों ने पाया कि "स्क्रैच-एंड-स्निफ" (डिफ्यूजन) तरीका कुछ चीजों में अद्भुत है लेकिन कुछ में बहुत खराब।

  • अच्छा है: सुडोकू पहेलियाँ सुलझाने या भूलभुलैया के माध्यम से रास्ता खोजने में, जहाँ आपको एक बार में पूरी तस्वीर देखनी होती है।
  • खराब है: सरल गणितीय पैटर्न सीखने या वाक्य में खाली स्थान भरने में जहाँ क्रम बहुत महत्वपूर्ण होता है। ऐसे मामलों में, रोबोट भ्रमित हो जाता है, प्रशिक्षण अस्थिर हो जाता है, और वह अक्सर पैटर्न सीखने में विफल रहता है।

शोधकर्ताओं ने महसूस किया कि "स्क्रैच-एंड-स्निफ" तरीका बहुत रैंडम (यादृच्छिक) था। यह किसी भी क्रम में शब्दों का अनुमान लगाने की कोशिश करता था, जो पहेलियों के लिए तो अच्छा है लेकिन उन कार्यों के लिए भ्रमित करने वाला है जिनमें सख्त बाएं-से-दाएं प्रवाह की आवश्यकता होती है।

समाधान: दो नई शिक्षण शैलियाँ
इसे ठीक करने के लिए, लेखकों ने रोबोट को सिखाने के दो नए तरीके बनाए जो दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को मिलाते हैं। वे इसे जिगसॉ (Jigsaw) और स्कैटर (Scatter) कहते हैं।

वाक्य या पहेली को कागज की एक लंबी पट्टी के रूप में सोचें जिसे छोटे ब्लॉकों में काटा गया है।

  • स्कैटर (एक समन्वित टीम):
    एक टीम के श्रमिकों की कल्पना करें, जिनमें से प्रत्येक एक अलग ब्लॉक पकड़े हुए है। एक व्यक्ति के अपने ब्लॉक को पूरा करने का इंतजार करने के बजाय, वे सभी एक साथ काम करते हैं। हालाँकि, वे एक सख्त नियम का पालन करते हैं: टीम में हर कोई अपने ब्लॉक के पहले शब्द पर काम करता है, फिर हर कोई अपने दूसरे शब्द पर जाता है, फिर तीसरे पर, और इसी तरह।

  • यह क्यों काम करता है: यह सुनिश्चित करता है कि प्रत्येक छोटे ब्लॉक के भीतर "बाएं-से-दाएं" का क्रम बना रहे (ताकि रोबोट शब्द के क्रम को लेकर भ्रमित न हो), लेकिन यह पूरी टीम को समानांतर (पैरलेल) काम करने की अनुमति देता है (जो "स्क्रैच-एंड-स्निफ" की गति और लचीलेपन को बनाए रखता है)। यह गणितीय पैटर्न सीखने के लिए बहुत स्थिर साबित हुआ।

  • जिगसॉ (एक स्मार्ट प्लानर):
    एक पहेली सुलझाने वाले की कल्पना करें जो पूरी पहेली को देखता है और पूछता है, "अभी सबसे आसान हिस्सा कौन सा है जिसे हल किया जा सकता है?" वह उस हिस्से को चुनता है, उसे हल करता है, और फिर अगले आसान हिस्से की ओर बढ़ता है।

  • क्यों काम करता है: यह रोबोट को आत्मविश्वास बनाने के लिए समस्या के "आसान" हिस्सों को पहले हल करने की अनुमति देता है, और फिर कठिन हिस्सों की ओर बढ़ता है। यह उन कार्यों के लिए बहुत अच्छा है जहाँ आपको आगे की योजना बनानी होती है, जैसे भूलभुलैया में रास्ता खोजना।

उन्होंने क्या खोजा
शोधकर्ताओं ने इन नए तरीकों का परीक्षण तीन विशिष्ट चुनौतियों पर किया:

  1. लीनियर रिग्रेशन (गणितीय पैटर्न): मानक "स्क्रैच-एंड-स्निफ" तरीका बुरी तरह विफल रहा। रोबोट पैटर्न समझ ही नहीं पाया। लेकिन स्कैटर और जिगसॉ पूरी तरह से काम कर गए, जिससे उन्होंने सख्त "एक-एक-शब्द-वाले" शिक्षक की स्थिरता को प्राप्त किया।
  2. पाथ-फाइंडिंग (भूलभुलैया): यहाँ, सख्त "एक-एक-शब्द-वाला" शिक्षक विफल रहा क्योंकि वह आगे देख नहीं सकता था। मानक "स्क्रैच-एंड-स्निफ" शिक्षक सफल रहा। हालाँकि, जिगसॉ संघर्ष कर गया क्योंकि उसकी "सबसे आसान-पहले" वाली रणनीति भूलभुलैया के पीछे की तर्क व्यवस्था (backward logic) से भ्रमित हो गई। स्कैटर और मानक तरीका यहाँ अच्छा प्रदर्शन करते रहे।
  3. सुडोकू (ग्लोबल पहेलियाँ): सख्त शिक्षक पूरी तरह विफल रहा क्योंकि वह शुरुआती गलतियों को ठीक नहीं कर सकता था। "स्क्रैच-एंड-स्निफ" शिक्षक और जिगसॉ ने इन पहेलियों को लगभग पूरी तरह से हल किया क्योंकि वे पूरे ग्रिड को देख सकते थे और कहीं भी त्रुटियों को सुधार सकते थे।

बड़ा निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि रोबोट को सिखाने का कोई एक "सर्वश्रेष्ठ" तरीका नहीं है।

  • यदि आपको रोबोट को एक सख्त क्रम का पालन करने की आवश्यकता है (जैसे कहानी लिखना या गणित करना), तो आपको उसे लोकैलिटी (locality) (छोटे, व्यवस्थित टुकड़ों में काम करना) का सम्मान करने के लिए मजबूर करना होगा।
  • यदि आपको एक जटिल पहेली सुलझाने की आवश्यकता है जहाँ उत्तर पूरी तस्वीर पर निर्भर करता है, तो आपको ग्लोबल विज़िबिलिटी (global visibility) (एक साथ सब कुछ देखना) की आवश्यकता है।

लेखकों के नए तरीके, स्कैटर और जिगसॉ, "स्मार्ट एडेप्टर" की तरह हैं। वे रोबोट को एक सख्त क्रम-अनुयायी और एक बड़ी तस्वीर देखने वाले प्लानर के बीच स्विच करने की अनुमति देते हैं, जो कार्य की आवश्यकता पर निर्भर करता है। यह प्रशिक्षण को बहुत अधिक स्थिर और कुशल बनाता है, जिससे यह सिद्ध होता है कि रोबोट के सोचने की प्रक्रिया को कैसे व्यवस्थित किया जाता है, यह रोबोट के स्वयं के होने जितना ही महत्वपूर्ण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →