← नवीनतम पेपर
🤖 machine learning

DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models

DPRM डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक प्लग-इन मॉड्यूल है जो रैंडम या मायोपिक टोकन-ऑर्डरिंग रणनीतियों को Doob h-transform प्रोसेस रिवॉर्ड मॉडल द्वारा निर्देशित एक रिवॉर्ड-टिल्टेड पॉलिसी से बदलकर विभिन्न डोमेन में जनरेशन प्रदर्शन में सुधार करता है।

मूल लेखक: Dake Bu, Wei Huang, Andi Han, Hau-San Wong, Qingfu Zhang, Taiji Suzuki, Atsushi Nitanda

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Dake Bu, Wei Huang, Andi Han, Hau-San Wong, Qingfu Zhang, Taiji Suzuki, Atsushi Nitanda

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जिन्हें एक जटिल, बहु-परत वाला वेडिंग केक तैयार करने का काम सौंपा गया है।

AI की दुनिया में, अधिकांश "लैंग्वेज मॉडल्स" (जैसे ChatGPT) उन शेफ की तरह हैं जो बाएं से दाएं एक सख्त रेसिपी का पालन करते हैं: पहले स्पंज, फिर फिलिंग, फिर फ्रॉस्टिंग। इसे "ऑटोरिग्रेसिव" (autoregressive) मॉडलिंग कहा जाता है। यह भरोसेमंद है, लेकिन यह कठोर है।

यह पेपर एक अलग तरह के शेफ को पेश करता है: डिफ्यूजन मॉडल (Diffusion Model)। यह मॉडल ज़मीन से ऊपर बनाने के बजाय, सामग्री के एक ढेर (शोर या "noise" का एक बादल) से शुरू होता है और धीरे-धीरे उन्हें तब तक परिष्कृत करता है जब तक कि एक सुंदर केक सामने न आ जाए। क्योंकि यह बाएं-से-दाएं जाने के लिए मजबूर नहीं है, इसलिए यह पहले किनारों पर फ्रॉस्टिंग कर सकता है, या बेस बनाने से पहले बीच की परत रख सकता है।

समस्या: चुनाव का "निर्णय पक्षाघात" (Decision Paralysis)
हालांकि यह लचीलापन बहुत अच्छा है, लेकिन यह एक बड़ी समस्या पैदा करता है: शेफ को सामग्रियों को किस क्रम में प्रकट करना चाहिए?

यदि शेफ केवल उसी चीज़ पर ध्यान देता है जो अभी करना "सबसे आसान" है (जिसे पेपर में "कॉन्फिडेंस-ड्रिवन ऑर्डरिंग" कहा गया है), तो वह फंस सकता है। वह सारा समय किनारे पर एक छोटी सी चीनी की फूल को निखारने में बिता सकता है (एक उच्च-विश्वास वाला कार्य) जबकि वह वास्तव में बीच में केक बेक करना पूरी तरह से भूल सकता है (एक कम-विश्वास वाला लेकिन उच्च-पुरस्कार वाला कार्य)। इसे "मायोपिक एक्सप्लोरेशन" (myopic exploration) कहा जाता है—छोटी, आसान जीत पर इतना ध्यान केंद्रित करना कि आप बड़े मिशन में विफल हो जाएं।

समाधान: DPRM (द "स्मार्ट असिस्टेंट")
शोधकर्ताओं ने DPRM (Doob h-transform Process Reward Model) बनाया है। DPRM को एक अत्यधिक अनुभवी 'सू-शेफ' (Sous-Chef) के रूप में समझें जो मुख्य शेफ के बगल में खड़ा है।

DPRM रेसिपी को नहीं बदलता, और न ही यह सामग्री को बदलता है। यह केवल काम करने के क्रम को प्रबंधित करता है। यह दो चतुर चरणों में काम करता है:

  1. वार्म-अप (द "ईजी विन्स" फेज): शुरुआत में, DPRM शेफ को आसान, उच्च-विश्वास वाले कार्यों पर ध्यान केंद्रित करने देता है। इससे गति बनती है और यह सुनिश्चित होता है कि बुनियादी बातें पूरी हो गई हैं।
  2. रिवॉर्ड-गाइडेड फेज (द "बिग पिक्चर" फेज): जैसे-जैसे प्रक्रिया आगे बढ़ती है, DPRM "फाइनल रिवॉर्ड" (केक वास्तव में कितना स्वादिष्ट है) को देखना शुरू करता है। यह "Doob h-transform" नामक एक गणितीय ट्रिक का उपयोग करके कहता है: "हे, भले ही यह बीच की परत अभी कठिन और भ्रमित करने वाली लग रही हो, लेकिन अगर हम इसे नहीं करते हैं, तो पूरा केक विफल हो जाएगा। इसे प्राथमिकता दें!"

यह एक बड़ी बात क्यों है?
शोधकर्ताओं ने इस "स्मार्ट असिस्टेंट" का परीक्षण कई अलग-अलग "रसोईघरों" में किया:

  • भाषा और तर्क (Language & Reasoning): इसने AI को बहुत कठिन गणित और तर्क संबंधी पहेलियाँ हल करने में मदद की।
  • जीव विज्ञान और विज्ञान (Biology & Science): इसने AI को बेहतर प्रोटीन, दवाओं के लिए अणु और यहाँ तक कि DNA अनुक्रमों को डिजाइन करने में मदद की। इन क्षेत्रों में, कोई "बाएं-से-दाएं" का क्रम नहीं है; सब कुछ आपस में जुड़ा हुआ है, जैसे एक जटिल जाल।

निष्कर्ष (The Takeaway)
यह पेपर साबित करता है कि आप क्या कर रहे हैं जितना महत्वपूर्ण है, उतना ही महत्वपूर्ण यह भी है कि आप उसे कैसे कर रहे हैं। "क्या आसान है" और "अंतिम परिणाम के लिए वास्तव में क्या मायने रखता है" के बीच संतुलन बनाने वाले एक मॉड्यूल को जोड़कर, उन्होंने एक "मायोपिक" AI को एक "रणनीतिक" AI में बदल दिया।

संक्षेप में: DPRM AI को आसान विवरणों के प्रति जुनूनी होने के बजाय बड़ी जीत पर ध्यान केंद्रित करना सिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →