← नवीनतम पेपर
💬 NLP

Revise, Don't Freeze: Sampler-Matched Training for Self-Correcting Masked Diffusion Language Models

यह शोध पत्र D3IM को प्रस्तुत करता है, जो मास्क किए गए डिफ्यूजन लैंग्वेज मॉडल्स में सीधे टोकन संशोधन को सक्षम करने वाला एक पैरामीटर-मुक्त सैंपलर है, और SCOPE को, जो परिणामी प्रिजर्वेशन बायस (preservation bias) को कम करने के लिए एक पोस्ट-ट्रेनिंग विधि है, जो सामूहिक रूप से रीजनिंग और कोडिंग बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त करते हैं।

मूल लेखक: Longxuan Yu, Shaorong Zhang, Yu Fu, Hui Liu, Yue Dong, Greg Ver Steeg

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Longxuan Yu, Shaorong Zhang, Yu Fu, Hui Liu, Yue Dong, Greg Ver Steeg

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करते हुए पेपर "Revise, Don't Freeze" की व्याख्या दी गई है।

बड़ी समस्या: "जमी हुई गलती" (The "Frozen Mistake")

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े घबराए हुए रोबोट सहायक के साथ एक कहानी लिख रहे हैं। हर बार जब रोबोट किसी शब्द का अनुमान लगाता है, तो वह उसे कागज के एक टुकड़े पर लिख देता है।

इन रोबोटों के काम करने के मानक तरीके (जिसे Masked Diffusion Language Models कहा जाता है) में, एक बार जब रोबोट कोई शब्द लिख देता है और उसे पर्याप्त "आत्मविश्वास" महसूस होता है, तो वह उस शब्द को वहीं फ्रीज (जमा) कर देता है। वह उस पर टेप लगा देता है। भले ही रोबोट को बाद में एहसास हो जाए, "रुको, यह शब्द इस वाक्य में सही नहीं लग रहा है," फिर भी वह इसे बदल नहीं सकता क्योंकि वहाँ टेप लगा हुआ है। वह केवल उन खाली जगहों को भरने में सक्षम है जो अभी तक लिखी नहीं गई हैं।

यह गणित या कोडिंग जैसे कठिन कार्यों के लिए एक बहुत बड़ी समस्या है। यदि रोबट शुरुआत में ही गलत नंबर लिख देता है (जैसे "2" के बजाय "5" लिखना), तो वह वहीं फंस जाता है। वह उस गलत नंबर के इर्द-गिर्द बाकी का उत्तर बनाने की कोशिश करता है, जिससे परिणाम पूरी तरह से गलत हो जाता है।

समाधान: सुधार के दो हिस्से

लेखकों, लॉन्गक्सुआन यू (Longxuan Yu) और उनके सहयोगियों ने महसूस किया कि रोबोट के पास वास्तव में अपना विचार बदलने की क्षमता है, लेकिन खेल के नियम उसे ऐसा करने से रोकते हैं। उन्होंने इस समस्या को ठीक करने के लिए दो-भाग वाला समाधान पेश किया: एक नया तरीका जिससे खेल खेला जाए (D3IM) और रोबोट के लिए एक विशेष प्रशिक्षण अभ्यास (SCOPE)।

भाग 1: नए खेल के नियम (D3IM)

उपमा: "हॉट पोटैटो" (Hot Potato) के खेल की कल्पना करें जहाँ हर कोई वाक्य में अगला शब्द अनुमान लगा रहा है।

  • पुराने नियम: एक बार जब आप एक शब्द चिल्ला देते हैं, तो आप अंत तक उसे थामे रखते हैं। यदि आपने गलत शब्द चिल्लाया, तो आप उसी के साथ फंस गए।
  • D3IM नियम ("साफ स्लेट"): खेल के हर चरण में, रोबोट वाक्य के हर शब्द को देखता है, यहाँ तक कि उन शब्दों को भी जो उसने पहले ही चिल्ला दिए हैं। वह पूछता है, "क्या मुझे अभी भी लगता है कि यह सबसे अच्छा शब्द है?"
    • यदि रोबोट अभी भी आश्वस्त है, तो शब्द वहीं रहता है।
    • यदि उसे लगता है, "वास्तव में, यह गलत है," तो वह शब्द को मिटा देता है (उसे वापस खाली स्थान में बदल देता है) या तुरंत उसे बेहतर शब्द से बदल देता है।
    • उसे अनुमति मांगने या किसी विशेष उपकरण के उपयोग की आवश्यकता नहीं है; वह बस अपने वर्तमान आत्मविश्वास के आधार पर सब कुछ फिर से जांचता है।

चुनौती: रोबोट इस खेल में बहुत अच्छा है यदि उसे पता हो कि वह कब गलत है। लेकिन इसके मूल प्रशिक्षण में, रोबोट को कभी अपनी गलतियों को स्वीकार करने के लिए नहीं सिखाया गया था। इसे अपने पहले अनुमान पर भरोसा करने के लिए प्रशिक्षित किया गया था, भले ही वह अनुमान खराब हो। इसलिए, जब आप इसे नए "साफ स्लेट" वाले खेल में शामिल करते हैं, तो यह गलत शब्दों को फ्रीज करता रहता है क्योंकि यह सोचता है कि वे सही हैं।

भाग 2: विशेष प्रशिक्षण (SCOPE)

उपमा: यह "गलतियों के साथ रिहर्सल" की तरह है।
रोबोट की अपनी गलतियों पर भरोसा करने की बुरी आदत को ठीक करने के लिए, लेखकों ने एक प्रशिक्षण विधि बनाई जिसे SCOPE (Self-Conditioned On Prediction Errors) कहा जाता है।

  • यह कैसे काम करता है: प्रशिक्षण के दौरान, रोबोट को एक वाक्य लिखने के लिए कहा जाता है, लेकिन फिर उसे अपने ही काम को देखने और यह मानने के लिए मजबूर किया जाता है कि उसने गलती की है।
  • रोबोट एक वाक्य लिखता है, फिर ट्रेनर कहता है, "ठीक है, मैं तुम्हारे कुछ शब्द छिपा दूँगा। अब, उन्हें फिर से पहचानने की कोशिश करो।"
  • ट्विस्ट: ट्रेनर विशेष रूप से उन शब्दों को चुनता है जिन्हें रोबोट ने गलत लिखा था लेकिन वह उन्हें लेकर बहुत आश्वस्त था। रोबोट को अपने ही गलत उत्तर को देखना होता है, यह समझना होता है कि वह गलत है, और उसे सही उत्तर से बदलना होता है।
  • यह रोबोट को एक महत्वपूर्ण सबक सिखाता है: "सिर्फ इसलिए कि मैंने इसे उच्च आत्मविश्वास के साथ कहा है, इसका मतलब यह नहीं है कि यह सही है। मुझे अपना विचार बदलने के लिए तैयार रहना चाहिए।"

परिणाम: एक टीम जो मिलकर काम करती है

जब आप नए खेल के नियमों (D3IM) को विशेष प्रशिक्षण (SCOPE) के साथ मिलाते हैं, तो रोबोट एक आत्म-सुधार करने वाला जीनियस बन जाता है।

  • बिना प्रशिक्षण के: यदि आप विशेष प्रशिक्षण के बिना केवल रोबोट को नए नियम देते हैं, तो यह और भी खराब हो जाता है। यह शब्दों को बदलने की कोशिश तो करता है लेकिन वही गलतियाँ करता रहता है क्योंकि इसे अपनी गलतियों को पहचानने की क्षमता पर भरोसा नहीं होता।
  • प्रशिक्षण के साथ: रोबोट अपनी "जमी हुई गलतियों" को पहचानना सीख जाता है। अब वह गणित की समस्या में एक गलत नंबर को देख सकता है, कह सकता है, "नहीं, यह गलत है," और वाक्य बनते समय ही उसे सही नंबर से बदल सकता है।

वास्तविक दुनिया के परिणाम

पेपर ने एक मॉडल जिसे LLaDA-8B (एक स्मार्ट लैंग्वेज मॉडल) कहा जाता है, पर कठिन कार्यों के लिए परीक्षण किया:

  • गणित (GSM8K & MATH): स्कोर काफी बढ़ गया। उदाहरण के लिए, एक कठिन गणित परीक्षण पर, सटीकता 55.3% से बढ़कर 68.3% हो गई।
  • कोडिंग (HumanEval & MBPP): वर्किंग कोड लिखने की क्षमता नाटकीय रूप से सुधरी, एक टेस्ट पर यह 14.0% से बढ़कर 29.3% हो गई।

मुख्य निष्कर्ष (The Takeaway)

मुख्य खोज यह है कि अपना विचार बदलने की क्षमता होना ही काफी नहीं है; आपको यह जानने के लिए प्रशिक्षित भी होना होगा कि कब अपना विचार बदलना है।

लेखकों ने दिखाया कि मॉडल को अपनी आत्मविश्वासी गलतियों को पहचानने (SCOPE) के लिए सिखाकर और उसे उन गलतियों को तुरंत बेहतर विकल्पों से बदलने का तंत्र (D3IM) देकर, मॉडल पहले की तुलना में जटिल तर्क संबंधी समस्याओं को बहुत बेहतर तरीके से हल कर सकता है। यह रोबोट को स्मार्ट बनाने के बारे में नहीं है; यह उसे अपनी शुरुआती गलतियों के प्रति कम जिद्दी बनाना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →