← नवीनतम पेपर
💬 NLP

Read the Trace, Steer the Path: Trajectory-Aware Reinforcement Learning for Diffusion Language Models

यह शोध पत्र CAPR को प्रस्तुत करता है, जो डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो सस्ते, ब्लॉक-स्तरीय पर्यवेक्षण संकेतों (supervision signals) को उत्पन्न करने के लिए डिनोइजिंग ट्रेसेस (denoising traces) का लाभ उठाता है, जिससे मौजूदा ट्री-आधारित विधियों की तुलना में काफी कम कम्प्यूटेशनल लागत के साथ रीजनिंग कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Anant Khandelwal, Manish Gupta

प्रकाशित 2026-06-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anant Khandelwal, Manish Gupta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल पहेली हल करना सिखा रहे हैं, जैसे कि सुडोकू या गणित की कोई समस्या। रोबोट केवल एक इंसान की तरह बाएं से दाएं नहीं लिखता। इसके बजाय, वह प्रश्न चिह्नों (मास्क) से भरे एक खाली पन्ने से शुरुआत करता है और धीरे-धीरे उस पन्ने को "डीनॉइज़" (denoise) करता है, यानी हर जगह क्या जाना चाहिए इसका अनुमान लगाता है, अपने अनुमानों में सुधार करता है, और अंत में अंतिम उत्तर पर पहुँचता है।

यह प्रक्रिया पीछे ब्रेडक्रंब्स का एक निशान (एक "डीनॉइज़िंग ट्रेस") छोड़ देती है। आप देख सकते हैं कि रोबोट ने कब किसी संख्या को लेकर आत्मविश्वास दिखाया, कब वह हिचकिचा रहा था, और कब उसने अपना उत्तर पक्का किया।

समस्या: "फ्लैट" बनाम "ट्री" दुविधा

प्रशिक्षण के लिए वर्तमान विधियाँ (Reinforcement Learning - RL) दो चरम सीमाओं के बीच फंसी हुई हैं:

  1. "फ्लैट" दृष्टिकोण (The "Flat" Approach): रोबोट पूरी पहेली हल करता है, अंत में एक एकल ग्रेड प्राप्त करता है (पास/फेल), और शिक्षक कहता है, "अच्छा काम किया!" या "बुरा काम किया!" पूरे प्रक्रम (process) के लिए।
    • दोष: रोबोट को यह पता नहीं चलता कि कौन सा विशिष्ट अनुमान एक जीनियस चाल थी और कौन सा केवल एक भाग्यशाली अनुमान था। यह पूरे सेमेस्टर के लिए अंतिम ग्रेड प्राप्त करने जैसा है बिना यह जाने कि किस विशिष्ट होमवर्क असाइनमेंट ने आपकी मदद की।
  2. "ट्री" दृष्टिकोण (The "Tree" Approach): अधिक सटीक होने के लिए, शिक्षक रोबोट को पहेली को कई बार हल करने के लिए कहता है, अलग-अलग बिंदुओं पर शाखाएं (branches) बनाता है ताकि यह देखा जा सके कि कौन सा रास्ता सबसे अच्छा काम करता है।
    • दोष: यह अविश्वसनीय रूप से महंगा और धीमा है। यह 100 अलग-अलग छात्रों को एक ही पहेली हल करने के लिए काम पर रखने जैसा है ताकि वे केवल एक सबसे अच्छा समाधान खोज सकें। यह बहुत अधिक कंप्यूटिंग शक्ति बर्बाद करता है।

समाधान: CAPR (द "स्मार्ट कोच")

पेपर CAPR (कैश्ड-एमोर्टाइज़्ड पाथ रिफाइनमेंट) पेश करता है। CAPR को एक स्मार्ट कोच के रूप में सोचें जो बेहतर फीडबैक देने के लिए 100 छात्रों को काम पर रखने के बजाय, वास्तविक समय में रोबोट के "ब्रेडक्रंब ट्रेल" को देखता है।

CAPR तीन सरल चरणों में काम करता है, जो एक धुंधले पहाड़ पर हाइकर (हाइकर) के नेविगेशन के रचनात्मक उदाहरण का उपयोग करता है:

1. कैश और स्टीयर (The "Compass" - दिशा सूचक)

जैसे-जैसे हाइकर धुंध के माध्यम से आगे बढ़ता है, कोच उसके आत्मविश्वास को देखता है।

  • यदि हाइकर रास्ते के बारे में आश्वस्त है (उच्च आत्मविश्वास, स्थिर), तो कोच उसे उसी दिशा में आगे बढ़ने के लिए एक हल्का सा धक्का देता है।
  • यदि हाइकर इधर-उधर डगमगा रहा है (कम आत्मविश्वास, उतार-चढ़ाव), तो कोच उसे वापस खींच लेता है ताकि वह गोल-गोल न घूमता रहे।
  • जादू: कोच हर कदम पर हाइकर के इस "मूड" को रिकॉर्ड करता है। इस रिकॉर्ड को पाथ स्टेट (Path State) कहा जाता है। यह "हम कहाँ निश्चित हैं" और "हम कहाँ भ्रमित हैं" का एक संक्षिप्त सारांश है।

2. ब्रांच और प्रून (The "Shortcut" - शॉर्टकट)

100 हाइकर्स को पहाड़ पर भेजने के बजाय (महंगा "ट्री" तरीका), कोच कुछ चालाकी करता है:

  • हाइकर पहाड़ के आधे रास्ते तक पहुँच जाता है।
  • कोच कहता है, "ठीक है, रुक जाओ। चलो इसी सटीक स्थान से दो अलग रास्ते आज़माते हैं।"
  • क्योंकि कोच ने पहले आधे हिस्से का "पाथ स्टेट" सहेज लिया है, हाइकर को पहला आधा हिस्सा फिर से चढ़ने की ज़रूरत नहीं है। वे बस आधे रास्ते पर कूद जाते हैं और दो नए अंत आज़माते हैं।
  • यदि कोई रास्ता संदिग्ध दिखता है (पाथ स्टेट के आधार पर), तो कोच उसे तुरंत काट देता है (Pruning)।
  • परिणाम: आपको विभिन्न रास्तों की तुलना करने का लाभ मिलता है, लेकिन आप केवल थोड़ा सा अतिरिक्त चलने की लागत चुकाते हैं, पूरा पहाड़ फिर से नहीं चढ़ते।

3. ब्लॉक क्रिटिक (The "Scorecard" - स्कोरकार्ड)

अंत में, रोबोट को एक अंतिम स्कोर मिलता है (जैसे, "आपने सुडोकू हल कर लिया!")।

  • ब्लॉक क्रिटिक एक छोटा AI सहायक है जो यात्रा के दौरान रिकॉर्ड किए गए "पाथ स्टेट" को देखता है।
  • यह पूछता है: "यात्रा के कौन से हिस्से वास्तव में उपयोगी थे?"
  • यह उस एकल अंतिम स्कोर को लेता है और उसे विभाजित करता है, जिससे उन विशिष्ट ब्लॉक्स को श्रेय दिया जाता है जहाँ रोबोट ने अच्छे और स्थिर निर्णय लिए थे।
  • यह एक अस्पष्ट "अच्छा काम किया" को एक विस्तृत रिपोर्ट कार्ड में बदल देता है: "पहली पंक्ति में बहुत अच्छा काम किया, लेकिन बीच के कॉलम में आप डगमगाए थे।"

यह क्यों महत्वपूर्ण है

  • सस्ता: CAPR की लागत एक मानक "फ्लैट" विधि की तुलना में लगभग 75% और एक "ट्री" विधि की तुलना में केवल 60% है। यह एक साधारण पास/फेल ग्रेड की कीमत पर विस्तृत रिपोर्ट कार्ड प्राप्त करने जैसा है।
  • स्मार्ट: कठिन तर्क पहेलियों (सुडोकू, काउंटडाउन, GSM8K, Math500) पर, CAPR रोबोट को पिछले तरीकों की तुलना में तेज़ी से सीखने और बेहतर स्कोर प्राप्त करने में मदद करता है।
  • कुशल: यह महंगे "ट्री" तरीकों के समान उच्च प्रदर्शन प्राप्त करता है, लेकिन एक-तिहाई से भी कम कंप्यूटिंग समय का उपयोग करता है।

निचोड़

CAPR AI मॉडल्स को केवल अंतिम परिणाम के बजाय उनकी अपनी "सोचने की प्रक्रिया" (डीनॉइज़िंग ट्रेस) से सीखने में मदद करता है। यह एक स्मार्ट कोच की तरह कार्य करता है जो जानता है कि छात्र को कब प्रोत्साहित करना है और कब सुधार करना है, और वह भी बिना अनावश्यक अभ्यास दौरों में समय या पैसा बर्बाद किए।

नोट: पेपर विशेष रूप से गणित और तर्क पहेलियों (सुडोकू, काउंटडाउन, GSM8K, Math500) पर इसका परीक्षण किया गया है। यह दावा नहीं करता है कि यह रचनात्मक लेखन, संवाद या सुरक्षा संरेखण जैसे खुले कार्यों पर काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →