← नवीनतम पेपर
💬 NLP

Mask-Aware Policy Gradients for Diffusion Language Models

यह शोध पत्र मास्क-अवेयर पॉलिसी ग्रेडिएंट्स (Mask-Aware Policy Gradients) का परिचय देता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो मास्क किए गए डिफ्यूजन लैंग्वेज मॉडल जनरेशन को टोकन चयन और स्थिति मास्किंग को संयुक्त रूप से अनुकूलित करने के लिए एक दो-चरणीय निर्णय प्रक्रिया के रूप में औपचारिक रूप देता है, जिससे लॉग-लाइक्लीहुड (log-likelihood) की जटिलता को दूर किया जा सकता है और गणितीय तर्क एवं कोडिंग बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सकता है।

मूल लेखक: Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl

प्रकाशित 2026-07-17
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कहानी लिखना या गणित की समस्या हल करना सिखाने की कोशिश कर रहे हैं। लंबे समय तक, ऐसा करने का सबसे अच्छा तरीका यह था कि रोबोट को एक बार में एक शब्द लिखने के लिए बनाया जाए, जैसे कि एक इंसान कीबोर्ड पर टाइप करता है। इसे "ऑटोरिग्रेसिव" (autoregressive) जनरेशन कहा जाता है। यह भरोसेमंद तो है, लेकिन यह धीमा भी है, जैसे हाईवे पार करता हुआ एक घोंघा। हाल ही में, वैज्ञानिकों ने एक तेज़ तरीका खोजा जिसे "डिफ्यूजन" (Diffusion) कहा जाता है। शून्य से लिखने के बजाय, रोबून ब्लैंक मास्क (जैसे [MASK]) से भरे हुए एक पन्ने से शुरुआत करता है और धीरे-धीरे उन्हें भरता जाता है, जिससे एक-एक करके शब्द प्रकट होते हैं और वाक्य पूरा हो जाता है। यह एक पहेली की तरह है जहाँ आप एक ढकी हुई तस्वीर से शुरुआत करते हैं और धीरे-धीरे कवर उठाते जाते हैं ताकि तस्वीर दिखाई दे सके।

हालाँकि, इन तेज़ "डिफ्यूजन" रोबोटों को रिवॉर्ड्स (इनाम) का उपयोग करके स्मार्ट बनाना (एक तकनीक जिसे रीइन्फोर्समेंट लर्निंग कहा जाता है) एक बुरा सपना रहा है। पुराने "शब्द-दर-शब्द" वाले तरीके में, यह गणना करना आसान है कि रोबोट के किसी विशिष्ट विकल्प को चुनने की संभावना कितनी थी। लेकिन "डिफ्यूजन" पद्धति में, रोबोट हर कदम पर दो निर्णय लेता है: वह यह तय करता है कि खाली जगह में कौन सा शब्द भरना है, और वह यह भी तय करता है कि अगला खाली स्थान किस क्रम में खोलना है। पिछले तरीकों ने रोबोट को केवल पहले विकल्प (शब्द) को देखकर सिखाने की कोशिश की और दूसरे विकल्प (खोलने के क्रम) को अनदेखा कर दिया। यह एक शेफ को एक बेहतरीन भोजन पकाने के लिए सिखाने जैसा है, जिसमें केवल उनके द्वारा चुने गए अवयवों (ingredients) की आलोचना की जाती है, जबकि इस बात को पूरी तरह से अनदेखा कर दिया जाता है कि उन्होंने उन्हें किस क्रम में काटा और मिलाया।

COLM 2026 कॉन्फ्रेंस में प्रस्तुत यह शोध पत्र सुझाव देता है कि हम पहेली का एक बहुत बड़ा हिस्सा भूल रहे थे। लेखक, हरन राजेश, कुलिन शाह और टेक्सास विश्वविद्यालय, ऑस्टिन की उनकी टीम का तर्क है कि डिफ्यूजन में महारत हासिल करने के लिए, आपको रोबोट को सही शब्द चुनने और उन्हें प्रकट करने के सही क्रम को चुनने, दोनों के लिए पुरस्कृत करना होगा। उन्होंने एक नई विधि विकसित की जिसे "मास्क-अवेयर पॉलिसी ग्रेडिएंट्स" (Mask-Aware Policy Gradients) कहा जाता है। केवल अगला शब्द अनुमान लगाने के बजाय, उनका सिस्टम "अगला मास्क कब उठाना है" के निर्णय को रोबोट की रणनीति के एक महत्वपूर्ण हिस्से के रूप में मानता है। सीखने की प्रक्रिया को इन दो अलग-अलग हिस्सों में गणितीय रूप से विभाजित करके, उन्होंने पाया कि रोबोट बहुत तेज़ी से सीखता है और कम गलतियाँ करता है।

इसके परिणाम काफी प्रभावशाली हैं। जब उन्होंने कठिन गणितीय समस्याओं और कोडिंग चुनौतियों पर इस नई विधि का परीक्षण किया, तो रोबोट उन्हें हल करने में काफी बेहतर हो गया। GSM8K नामक एक प्रसिद्ध गणित परीक्षण पर, उनकी विधि ने 87.1% की सटीकता प्राप्त की, और MBPP नामक कोडिंग परीक्षण पर, इसने 53.4% हासिल किया। ये संख्याएँ किसी भी पिछली विधि से अधिक हैं जिसने रिवॉर्ड्स का उपयोग करके डिफ्यूजन मॉडल को सिखाने की कोशिश की थी। यह शोध पत्र दिखाता है कि "मास्किंग" निर्णयों पर ध्यान देकर—यानी रोबोट अपने विचारों को किस क्रम में प्रकट करता है—हम इन तेज़, लचीले AI मॉडलों में बुद्धिमत्ता के एक नए स्तर को अनलॉक कर सकते हैं, जिससे वे न केवल तेज़, बल्कि अधिक स्मार्ट भी बनते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →