← नवीनतम पेपर
🤖 AI

DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes

DenoiseRL एक स्केलेबल रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो कमजोर मॉडलों के गलत ट्रेसेस (traces) से सीधे सीखकर और शोर वाले प्रीफिक्स (noisy prefixes) से उबरकर बड़े भाषा मॉडलों में तर्क क्षमता को बढ़ाता है, जिससे महंगे टीचर सुपरविजन या क्यूरेटेड डेटासेट्स की आवश्यकता समाप्त हो जाती है और यह मजबूत ऑन-पॉलिसी बेसलाइन्स से बेहतर प्रदर्शन करता है।

मूल लेखक: Caijun Xu, Changyi Xiao, Zhongyuan Peng, Yixin Cao

प्रकाशित 2026-05-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Caijun Xu, Changyi Xiao, Zhongyuan Peng, Yixin Cao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र को जटिल गणित की समस्याएं हल करना सिखाने की कोशिश कर रहे हैं। आमतौर पर, आप उन्हें सही चरण दिखाने के लिए एक जीनियस ट्यूटर (प्रतिभाशाली शिक्षक) को काम पर रखेंगे। लेकिन क्या होगा यदि आपके पास कोई जीनियस ट्यूटर नहीं है? क्या होगा यदि आपके पास केवल एक ऐसा छात्र है जो गणित में कमजोर है?

वर्तमान AI प्रशिक्षण विधियों में आमतौर पर कहा जाता है, "यदि हमारे पास कोई जीनियस नहीं है, तो हम बेहतर नहीं हो सकते।" यह नया पेपर, DenoiseRL, कहता है, "वास्तव में, हम स्मार्ट छात्र को और भी स्मार्ट बनाने के लिए कमजोर छात्र की गलतियों का उपयोग कर सकते हैं।"

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "परफेक्ट ट्यूटर" की बाधा (Bottleneck)

अभी, AI को तर्क करने (जैसे गणित हल करने) में स्मार्ट बनाने के लिए, हमें आमतौर पर एक "मजबूत" AI की आवश्यकता होती है जो शिक्षक के रूप में कार्य करे। यह उन्नत कैलकुलस सीखने के लिए एक प्रोफेसर से सीखने की कोशिश करने जैसा है। लेकिन क्या होगा यदि आपके पास कोई प्रोफेसर नहीं है? आप फंस जाते हैं।

2. समाधान: "डिटूर" (मार्ग परिवर्तन) प्रशिक्षण

DenoiseRL खेल बदल देता है। एक "परफेक्ट टीचर" खोजने के बजाय, यह एक "कमजोर" AI (खराब छात्र) को लेता है और उसे एक समस्या हल करने के लिए कहता है। कमजोर AI संभवतः रास्ता भटक जाएगा, गलत मोड़ लेगा और एक डेड एंड (बंद रास्ते) पर पहुँच जाएगा।

उन गलत उत्तरों को फेंकने के बजाय, DenoiseRL उनका उपयोग एक प्रशिक्षण बाधा दौड़ (obstacle course) के रूप में करता है।

  • उपमा: कल्पना करें कि एक हाइकर (AI) पहाड़ की चोटी (सही उत्तर) तक पहुँचने की कोशिश कर रहा है।
    • सामान्य प्रशिक्षण: हाइकर नीचे से शुरू करता है और रास्ता खोजने की कोशिश करता है।
    • DenoiseRL प्रशिक्षण: हाइकर को जादुई रूप से पहाड़ के बीच में एक जगह पहुँचा दिया जाता है, लेकिन वह कीचड़ के दलदल (कमजोर AI द्वारा उत्पन्न गलत तर्क चरणों) में खड़ा है।
    • लक्ष्य: हाइकर को केवल आगे चलने की अनुमति नहीं है। उसे यह समझना होगा, "अरे, मैं कीचड़ में फँसा हूँ। मुझे इस गंदगी से बाहर कैसे निकलना है और चोटी तक पहुँचने के लिए सही रास्ते पर वापस कैसे आना है?"

3. यह कैसे काम करता है: पथ को "डीनॉइज़" (शोर हटाना) करना

पेपर इसे "Denoising" कहता है। कमजोर AI के गलत चरणों को रेडियो सिग्नल पर "शोर" (noise) या स्टेटिक की तरह समझें।

  • सिस्टम कमजोर AI के गलत उत्तर के एक हिस्से (गलत प्रिफिक्स/शुरुआती भाग) को लेता है।
  • यह स्मार्ट AI को अपना उत्तर उस गलत जगह से शुरू करने के लिए मजबूर करता है।
  • स्मार्ट AI को यह महसूस करना होगा, "ओह, यह पहला हिस्सा गलत है। मुझे इसे सुधारना होगा, ट्रैक बदलना होगा, और समाधान खोजने के लिए सही रास्ता ढूँढना होगा।"

यह AI को एक सुपरपावर सिखाता है: रिकवरी (सुधारना)। यह सीखता है कि भले ही इसकी शुरुआत गलत रास्ते से हुई हो, यह त्रुटि को पहचान सकता है, उसे ठीक कर सकता है, और फिर भी सही उत्तर तक पहुँच सकता है।

4. सही संतुलन: कीचड़ को बहुत गहरा न बनाएं

शोधकर्ताओं ने पाया कि "कीचड़" (गलत चरण) की गहराई सही होनी चाहिए।

  • बहुत उथला: यदि गलत चरण बहुत छोटे हैं, तो AI बहुत कम सीखता है।
  • बहुत गहरा: यदि गलत चरण बहुत बड़े हैं, तो AI भ्रमित हो जाता है और "जरूरत से ज्यादा सोचने" (overthinking) लगता है। वह खुद पर संदेह करने, अपने काम की बार-बार जांच करने और कभी खत्म न कर पाने के लूप में फंस जाता है।
  • बिल्कुल सही: गलत चरणों की एक मध्यम मात्रा AI को बिना पंगु हुए गलतियों को सुधारने का अभ्यास करने के लिए मजबूर करती है।

5. परिणाम

जब उन्होंने गणित और तर्क संबंधी पहेलियों पर इसका परीक्षण किया:

  • DenoiseRL के साथ प्रशिक्षित AI ने मानक तरीकों से प्रशिक्षित AI की तुलना में बेहतर स्कोर प्राप्त किया।
  • इसे किसी "जीनियस" शिक्षक की आवश्यकता नहीं थी; इसने अपने ही एक "कमजोर" संस्करण की गलतियों को सुधारकर सीखा।
  • यह अपनी गलतियों को पहचानने और उन्हें चलते-चलते (on the fly) सुधारने में बेहतर हो गया।

सारांश

DenoiseRL AI दिमागों के लिए एक जिम की तरह है। केवल वजन उठाने (शून्य से समस्याओं को हल करने) के बजाय, यह AI को ऐसी स्थिति में डालता है जहाँ उसे एक गड्ढे से बाहर निकलने के लिए संघर्ष करना पड़ता है जिसे उसने खुद नहीं खोदा है। गलतियों से उबरने का अभ्यास करके, AI अधिक मजबूत, स्मार्ट और उसे मार्गदर्शन देने के लिए एक परफेक्ट टीचर पर कम निर्भर हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →