← नवीनतम पेपर
💬 NLP

Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes

PrefixRL सफल ट्रेसेस (traces) के ऑफ-पॉलिसी प्रीफिक्स (off-policy prefixes) पर निर्भर होकर कठिन रीजनिंग समस्याओं पर सुदृढीकरण शिक्षण (reinforcement learning) की अक्षमता को संबोधित करता है ताकि प्रशिक्षण को स्थिर किया जा सके और सैंपल दक्षता को बढ़ाया जा सके, जिससे मानक बेसलाइनों की तुलना में तेज़ अभिसरण (convergence) और बेहतर प्रदर्शन प्राप्त होता है और रिजेक्शन सैंपलिंग (rejection sampling) के माध्यम से एक स्व-सुधार लूप सक्षम होता है।

मूल लेखक: Amrith Setlur, Zijian Wang, Andrew Cohen, Paria Rashidinejad, Sang Michael Xie

प्रकाशित 2026-02-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Amrith Setlur, Zijian Wang, Andrew Cohen, Paria Rashidinejad, Sang Michael Xie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र (एक AI मॉडल) को अविश्वसनीय रूप से कठिन गणितीय समस्याओं को हल करना सिखाने की कोशिश कर रहे हैं। छात्र बुद्धिमान है, लेकिन जब वह किसी बहुत कठिन प्रश्न का सामना करता है, तो वह आमतौर पर केवल अनुमान लगाता है और गलत हो जाता है। वास्तव में, वह इतनी बार गलत होता है कि सीखना बंद कर देता है क्योंकि उसे कभी भी "सही" उत्तर नहीं मिलता जिसे वह अध्ययन के लिए उपयोग कर सके। यही वह समस्या है जिसे यह शोध पत्र संबोधित करता है: कठिन समस्याओं पर रीइन्फोर्समेंट लर्निंग (RL) अक्सर रुक जाती है क्योंकि AI को कभी जीतने वाला कदम दिखाई नहीं देता।

लेखक एक नया और चतुर तरीका प्रस्तावित करते हैं जिसे PrefixRL कहा जाता है। यह कैसे काम करता है, इसे सरल उपमाओं (analogies) का उपयोग करके यहाँ समझाया गया है:

1. समस्या: "अंधेरे में फँसा हुआ" परिदृश्य

कल्पना कीजिए कि छात्र एक अंधेरी भूलभुलैया (maze) में है और बाहर निकलने का रास्ता खोजने की कोशिश कर रहा है। हर बार जब वह एक कदम लेता है, तो वह दीवार से टकरा जाता है और उसे "0 अंक" का संकेत मिलता है। वह गोल-गोल घूमता रहता है, ऊर्जा (कंप्यूटर पावर) बर्बाद करता है, लेकिन बाहर निकलने के रास्ते तक कभी नहीं पहुँच पाता। क्योंकि उसे कभी बाहर निकलने का रास्ता नहीं मिला, इसलिए उसे पता नहीं चलता कि कौन सी दिशा सही है, और उसका सीखना रुक जाता है।

AI के संदर्भ में, यह तब होता है जब मॉडल एक कठिन समस्या को हल करने की कोशिश करता है और लगभग कभी भी अपने आप सही उत्तर नहीं बना पाता। "रिवॉर्ड" (वह संकेत जो कहता है "तुमने कर दिखाया!") इतना दुर्लभ होता है कि AI अटक जाता है।

2. पुराना तरीका: "बस उत्तर याद कर लो"

पहले, यदि शोधकर्ताओं के पास पिछले प्रयास से कुछ सही उत्तर होते थे (off-policy data), तो वे छात्र को पहले उन उत्तरों को याद करने के लिए मजबूर करने की कोशिश करते थे (Supervised Fine-Tuning) इससे पहले कि उन्हें फिर से प्रयास करने दिया जाए।

  • दोष: यह छात्र को भूलभुलैया के एक विशिष्ट मार्ग को याद करने के लिए मजबूर करने जैसा है। एक बार जब वे इसे याद कर लेते हैं, तो वे अन्वेषण (exploring) करना बंद कर देते हैं। यदि भूलभुलैया थोड़ी बदल जाती है, या यदि उन्हें एक बेहतर मार्ग खोजने की आवश्यकता होती है, तो वे फंस जाते हैं क्योंकि उन्होंने अपनी जिज्ञासा और रचनात्मकता खो दी है। वे बहुत कठोर बन जाते हैं।

3. नया तरीका: PrefixRL (एक "हेड स्टार्ट" रणनीति)

PrefixRL खेल बदल देता है। छात्र को पूरा उत्तर याद करने के लिए मजबूर करने के बजाय, शोधकर्ता उन्हें एक हेड स्टार्ट (शुरुआती बढ़त) देते हैं।

  • उपमा: कल्पना कीजिए कि छात्र फिर से अंधेरी भूलभुलैया में फँसा हुआ है। इस बार, एक मित्र (जिसने पहले भूलभुलैया को सुलझा लिया था) उसे कागज का एक टुकड़ा देता है जिस पर लिखा है: "तुम अभी उस कोने पर हो जहाँ लाल दरवाजा है। यहाँ से, बाईं ओर मुड़ें।"
  • छात्र को लाल दरवाजे तक पहुँचने का पता लगाने की ज़रूरत नहीं है; वे बस वहां से शुरू कर सकते हैं।
  • महत्वपूर्ण बात: छात्र अभी भी भूलभुलैया के बाकी हिस्से को अपने दम पर सुलझाने के लिए जिम्मेदार है। वे केवल पूरे रास्ते की नकल नहीं कर रहे हैं; वे यात्रा के बाकी हिस्से का अभ्यास करने के लिए उस "हेड स्टार्ट" का उपयोग कर रहे हैं।

तकनीकी शब्दों में, AI एक पुराने सही समाधान को लेता है, उसके शुरुआती हिस्से (प्रिफिक्स/prefix) को काट देता है, और उसे समस्या के साथ जोड़ देता है। AI फिर शेष समाधान को पूरा करने का प्रयास करता है। क्योंकि वह एक "अच्छी" जगह से शुरू करता है, इसलिए उसके सही उत्तर (रिवॉर्ड) प्राप्त करने की संभावना बहुत अधिक होती है और वह सीख पाता है।

4. जादुई ट्रिक: "बैक-जनरलाइजेशन" (Back-Generalization)

इस शोध पत्र की सबसे आश्चर्यजनक खोज है जिसे लेखक Back-Generalization कहते हैं।

  • उपमा: कल्पना कीजिए कि आप केवल हाईवे के एक विशिष्ट, आसान हिस्से पर ड्राइविंग का अभ्यास करते हैं (प्रिफिक्स्ड हिस्सा)। आप उस हिस्से पर मर्ज करना, गति बढ़ाना और स्टीयरिंग करना पूरी तरह से सीख लेते हैं।
  • आश्चर्य: भले ही आपने कठिन, घुमावदार पहाड़ी सड़कों (मूल, अनप्रिफिक्स्ड समस्या) पर कभी अभ्यास नहीं किया, फिर भी हाईवे पर आपकी ड्राइविंग कौशल किसी तरह आपको पहाड़ी सड़कों पर भी बेहतर ड्राइवर बना देता है।
  • क्यों? शोध पत्र सुझाव देता है कि "हेड स्टार्ट" वाली समस्याओं पर अभ्यास करके, AI समस्या को हल करने के लिए आवश्यक अंतर्निहित तर्क (underlying logic) और रणनीतियों को सीखता है। यह केवल यह नहीं सीखता कि क्या सोचना है, बल्कि यह सीखता है कि कैसे सोचना है। इसलिए, जब वह बिना हेड स्टार्ट के मूल कठिन समस्या पर वापस जाता है, तो वह उन नई रणनीतियों को लागू कर सकता है और उसे पहले की तुलना में बेहतर तरीके से हल कर सकता है।

5. यह बेहतर क्यों है (परिणाम)

शोध पत्र ने इसका परीक्षण बहुत कठिन गणित और कोडिंग समस्याओं पर किया।

  • गति: PrefixRL ने पिछले सर्वोत्तम तरीकों की तुलना में दोगुनी तेजी से सीखा। इसने कंप्यूटर पावर कम बर्बाद की क्योंकि इसे अंधेरे में बार-बार अनुमान नहीं लगाना पड़ा।
  • गुणवत्ता: अंतिम AI पुराने तरीकों की तुलना में कठिन समस्याओं को हल करने में तीन गुना बेहतर था।
  • लचीलापन: यह तब भी काम करता है जब "हेड स्टार्ट" किसी पूरी तरह से अलग प्रकार के AI (जैसे कि Llama मॉडल को प्रशिक्षित करने के लिए Qwen मॉडल के संकेतों का उपयोग करना) से आता है। इसका मतलब है कि आपको संकेत उत्पन्न करने के लिए बिल्कुल उसी AI की आवश्यकता नहीं है; कोई भी स्मार्ट AI "हेड स्टार्ट" प्रदान कर सकता है।

सारांश

PrefixRL एक संघर्ष कर रहे छात्र को प्रश्न के सबसे कठिन हिस्से को पार करने के लिए एक संकेत देने जैसा है, ताकि वे बाकी हिस्से को हल करने का अभ्यास कर सकें। आश्चर्यजनक रूप से, संकेत के साथ अभ्यास करके, छात्र समस्या के तर्क में इतने कुशल हो जाते हैं कि वे मूल, बिना संकेत वाले संस्करण को भी पहले से कहीं बेहतर तरीके से हल कर सकते हैं। यह नए सीखने को तेज़ और स्मार्ट बनाने के लिए पुराने कंप्यूटर कार्य का पुन: उपयोग करता है, बिना AI को केवल उत्तर रटने के लिए मजबूर किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →