← नवीनतम पेपर
🤖 machine learning

Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime

यह शोध पत्र प्रिफिक्स सैंपलिंग (Prefix Sampling) का प्रस्ताव करता है, जो बाइनरी-रिवॉर्ड एजेंटिक आरएल (binary-reward agentic RL) को एक इष्टतम 50% पास रेट की ओर निर्देशित करने के लिए ट्रेजेक्टरी प्रिफिक्स को पुनर्गठित करता है, जिससे रिवॉर्ड एंट्रॉपी और कंट्रास्टिव सिग्नल को अधिकतम किया जा सके ताकि SWE-bench और AIME जैसे बेंचमार्क पर महत्वपूर्ण वॉल-क्लॉक स्पीडअप और बेहतर प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Tianshu Zhu, Wenyu Zhang, Xiaoying Zuo, Lun Tian, Haotian Zhao, Yucheng Zeng, Jingnan Gu, Daxiang Dong, Jianmin Wu, Dawei Yin, Dou Shen

प्रकाशित 2026-05-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tianshu Zhu, Wenyu Zhang, Xiaoying Zuo, Lun Tian, Haotian Zhao, Yucheng Zeng, Jingnan Gu, Daxiang Dong, Jianmin Wu, Dawei Yin, Dou Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रचनात्मक उपमाओं का उपयोग करते हुए शोध पत्र (paper) का स्पष्टीकरण दिया गया है।

बड़ी समस्या: "बहुत आसान" या "बहुत कठिन" कार्यों पर ऊर्जा बर्बाद करना

कल्पना कीजिए कि आप जटिल पहेलियों को हल करने के लिए छात्र एथलीटों की एक टीम को प्रशिक्षित करने वाले एक कोच हैं। आप उन्हें एक बार में 8 पहेलियों का एक समूह देते हैं।

  • "बहुत आसान" समूह: 7 या 8 छात्र पहेली को तुरंत हल कर लेते हैं। वे ऊब जाते हैं, और आप कुछ भी नया नहीं सीख पाते क्योंकि उन सभी ने इसे सही हल कर लिया।
  • "बहुत कठिन" समूह: 0 या 1 छात्र इसे हल कर पाता है। बाकी सभी अटक जाते हैं। आप कुछ भी नहीं सीख पाते क्योंकि अध्ययन करने के लिए कोई सफल उदाहरण मौजूद नहीं है।
  • "बिल्कुल सही" समूह: 4 छात्र इसे हल करते हैं, और 4 विफल होते हैं। यह 'स्वीट स्पॉट' (सही संतुलन) है। आपके पास सीखने के लिए सफलता और विफलता का एक आदर्श मिश्रण है। जो छात्र असफल हुए, वे देख सकते हैं कि सफल होने वालों ने क्या अलग किया।

AI की दुनिया में, इसे रीइन्फोर्समेंट लर्निंग (RL) कहा जाता है। AI किसी समस्या को हल करने के लिए कई "रोलआउट्स" (प्रयास) उत्पन्न करता है। शोध पत्र का तर्क है कि वर्तमान AI प्रशिक्षण "बहुत आसान" और "बहुत कठिन" समूहों पर भारी मात्रा में कंप्यूटर शक्ति बर्बाद करता है क्योंकि वे उपयोगी सीखने के संकेत (learning signals) प्रदान नहीं करते हैं।

समाधान: "प्रीफिक्स सैंपलिंग" ("हेड स्टार्ट" और "हैंडीकैप" वाली ट्रिक)

शोधकर्ताओं ने इसे ठीक करने के लिए प्रीफिक्स सैंपलिंग (Prefix Sampling) नामक एक चतुर विधि प्रस्तावित की है। खराब बैचों को फेंक देने या AI को फिर से शुरू से प्रयास करने के लिए कहने के बजाय (जो धीमा और महंगा है), वे एक "टाइम-ट्रैवल" (समय यात्रा) ट्रिक का उपयोग करते हैं।

AI के प्रयास को एक लंबी कहानी के रूप में सोचें जिसे लिखा जा रहा है।

  1. "बहुत कठिन" परिदृश्य: AI एक कठिन समस्या को हल करने की कोशिश करता है और ज्यादातर विफल रहता है।

    • ट्रिक: सिस्टम उस एक सफल प्रयास को ढूंढता है जो AI ने उस बैच में किया था। यह उस सफल कहानी का पहला आधा हिस्सा (जिसे "प्रीफिक्स" कहा जाता है) लेता है और AI को मजबूर करता है कि वह अपना अगला प्रयास ठीक उसी बिंदु से शुरू करे।
    • उपमा: यह संघर्ष कर रहे छात्र को "हेड स्टार्ट" (शुरुआती बढ़त) देने जैसा है। "तुम यहाँ अटक गए थे, लेकिन देखो, तुमने पहले हिस्से को वास्तव में सही ढंग से हल किया है। अपना अगला प्रयास यहीं से शुरू करो।" यह कठिन समस्या को आसान बनाता है, जिससे सफलता दर 50% की ओर बढ़ जाती है।
  2. "बहुत आसान" परिदृश्य: AI समस्या को बहुत आसानी से हल कर लेता है।

    • ट्रिक: सिस्टम उस बैच में एक विफल प्रयास को ढूंढता है। यह उस विफलता का पहला आधा हिस्सा लेता है और AI को वहां से शुरू करने के लिए मजबूर करता है।
    • उपमा: यह एक जीनियस छात्र को "हैंडीकैप" (कमी या बाधा) देने जैसा है। "तुमने इसे बहुत जल्दी हल कर लिया। चलो मान लेते हैं कि तुमने शुरुआत में एक गलती की थी। अपना अगला प्रयास इस त्रुटि से शुरू करो।" यह आसान समस्या को कठिन बनाता है, जिससे सफलता दर 50% की ओर नीचे आती है।

क्यों 50% एक जादुई संख्या है

शोध पत्र यह सिद्ध करने के लिए कुछ गणित का उपयोग करता है कि 50% सफलता सबसे अधिक सूचनात्मक बिंदु है।

  • एन्ट्रॉपी (भ्रम/अनिश्चितता): यदि आप जानते हैं कि AI हमेशा जीतेगा या हमेशा हारेगा, तो कोई आश्चर्य (surprise) नहीं रह जाता। यदि वह आधी बार जीतता है, तो इसमें अधिकतम "आश्चर्य" या सीखने के लिए जानकारी होती है।
  • कंट्रास्ट (विपरीतता): सीखने के लिए, आपको एक "जीत" की तुलना एक "हार" से करने की आवश्यकता होती है। यदि सभी जीतते हैं, तो आपके पास तुलना के लिए कोई हार नहीं है। यदि सभी हारते हैं, तो आपके पास कोई जीत नहीं है। सर्वोत्तम कंट्रास्ट प्राप्त करने के लिए आपको 50/50 के विभाजन की आवश्यकता होती है।

यह वास्तविक दुनिया में कैसे काम करता है ("स्टेटफुल" वाला हिस्सा)

यह समझाने में सबसे कठिन हिस्सा है, लेकिन यह महत्वपूर्ण है। सरल गणित समस्याओं में, AI केवल टेक्स्ट लिखता है। लेकिन सॉफ्टवेयर इंजीनियरिंग (जैसे कोड ठीक करना) में, AI एक "एजेंट" है जो फाइलें खोलता है, कमांड चलाता है और कंप्यूटर की स्थिति (state) को बदलता है।

आमतौर पर, यदि आप पिछले प्रयास को फिर से चलाना चाहते हैं, तो आपको पूरे कंप्यूटर वातावरण को रीसेट करना पड़ता है, जो धीमा है।

  • नवाचार: शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो AI के कार्यों को स्टेप-दर-स्टेप "रिप्ले" (दोहरा) कर सकता है ताकि कंप्यूटर की सटीक स्थिति (कोड, फाइलें, इतिहास) को बिना दोबारा शुरू किए बनाया जा सके।
  • मास्किंग: जब AI इस रिप्ले की गई स्थिति से आगे बढ़ता है, तो सिस्टम AI को बताता है: "आपने पहला हिस्सा नहीं लिखा (हमने आपके लिए उसे रिप्ले कर दिया है)। आपको केवल उस नए हिस्से के लिए श्रेय मिलता है जो आप लिखते हैं।" यह सुनिश्चित करता है कि AI अपने नए निर्णयों से सीखता है, न कि पुराने निर्णयों से।

परिणाम: तेज़ और स्मार्ट

शोधकर्ताओं ने दो प्रकार के कार्यों पर परीक्षण किया:

  1. सॉफ्टवेयर इंजीनियरिंग (SWE-bench): वास्तविक दुनिया के कोड बग्स को ठीक करना।
  2. मैथ (AIME 2025): कठिन गणित ओलंपियाड की समस्याओं को हल करना।

लाभ:

  • गति: बड़े मॉडलों पर AI ने आधे समय में (2x तक तेज़) समान उच्च प्रदर्शन स्तर प्राप्त कर लिया।
  • दक्षता: इसने बेकार "सभी-जीत" या "सभी-हार" वाले प्रयासों पर कंप्यूटर शक्ति कम खर्च की।
  • प्रदर्शन: अंतिम AI वास्तव में मानक प्रशिक्षण पद्धति की तुलना में समस्याओं को हल करने में बेहतर था, जिसने उच्च स्कोर प्राप्त किया।

सारांश

यह शोध पत्र AI प्रशिक्षण के लिए एक "ट्रैफिक कंट्रोलर" पेश करता है। AI को अनियंत्रित होकर उन कार्यों पर समय बर्बाद करने देने के बजाय जो बहुत आसान या बहुत कठिन हैं, यह सक्रिय रूप से प्रशिक्षण बैचों को 50% सफलता दर की ओर मोड़ता है। यह संघर्ष कर रहे AI को पिछले सफल प्रयास से "हेड स्टार्ट" देकर और अत्यधिक आत्मविश्वासी AI को पिछले विफलता से "हैंडीकैप" देकर ऐसा करता है। यह सीखने की प्रक्रिया को "गोल्डिलॉक्स ज़ोन" (बिल्कुल सही स्थिति) में रखता है, जिससे प्रशिक्षण काफी तेज़ और अधिक प्रभावी हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →