← नवीनतम पेपर
🤖 machine learning

XRPO: Pushing the limits of GRPO with Targeted Exploration and Exploitation

XRPO एक एकीकृत ढांचा है जो लक्षित अन्वेषण (exploration) के लिए एक अनुकूली रोलआउट आवंटक (adaptive rollout allocator) और बेहतर शोषण (exploitation) के लिए एक नवीनता-जागरूक लाभ तीक्ष्णता तंत्र (novelty-aware advantage sharpening mechanism) को पेश करके बड़े भाषा मॉडलों के लिए GRPO-आधारित सुदृढीकरण लर्निंग (reinforcement learning) को बढ़ाता है, जिसके परिणामस्वरूप गणित और कोडिंग बेंचमार्क पर उत्कृष्ट प्रदर्शन और तेज़ अभिसरण (convergence) प्राप्त होता है।

मूल लेखक: Udbhav Bamba, Minghao Fang, Yifan Yu, Haizhong Zheng, Fan Lai

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Udbhav Bamba, Minghao Fang, Yifan Yu, Haizhong Zheng, Fan Lai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन जिद्दी छात्र (एक AI) को कठिन गणित की समस्याएं हल करना या जटिल कोड लिखना सिखाने की कोशिश कर रहे हैं। सिखाने का पारंपरिक तरीका ऐसा है जैसे उन्हें एक बहुविकल्पीय (multiple-choice) परीक्षा देना, जहाँ उन्हें हर एक प्रश्न के लिए 16 बार अनुमान लगाना पड़ता है। यदि वे सही उत्तर देते हैं, तो उन्हें एक गोल्ड स्टार मिलता है; यदि वे गलत होते हैं, तो उन्हें कुछ भी नहीं मिलता।

समस्या यह है कि यह तरीका अक्षम है। छात्र उन प्रश्नों पर बार-बार वही अंदाज़ा लगाता रहता है जो वह पहले से जानता है, जिससे समय बर्बाद होता है। वहीं दूसरी ओर, वास्तव में कठिन प्रश्नों पर जहाँ उसे बार-बार शून्य स्टार मिलते हैं, वह बस हार मान लेता है और सीखने की कोशिश करना बंद कर देता है क्योंकि उसे कभी कोई फीडबैक (प्रतिपुष्टि) नहीं मिलता।

XRPO एक नया शिक्षण ढांचा (framework) है जिसे इस समस्या को ठीक करने के लिए डिज़ाइन किया गया है। यह एक सुपर-स्मार्ट ट्यूटर की तरह काम करता है जो छात्र की ज़रूरत के आधार पर ठीक उसी क्षण अपनी रणनीति बदल देता है। यह कैसे काम करता है, यहाँ तीन सरल तरीकों में दिया गया है:

1. "स्मार्ट बेटिंग" रणनीति (Targeted Exploration)

पुराने तरीके में, छात्र को हर प्रश्न के लिए 16 बार अनुमान लगाने के लिए मजबूर किया जाता था, चाहे प्रश्न कितना भी आसान या कठिन क्यों न हो।

  • XRPO का समाधान: ट्यूटर प्रश्नों को देखता है और पूछता है, "छात्र सबसे अधिक कहाँ भ्रमित है?"
    • यदि कोई प्रश्न कठिन है और छात्र के उत्तर इधर-उधर बिखरे हुए हैं (उच्च अनिश्चितता), तो ट्यूटर कहता है, "ठीक है, चलिए इस पर 20 अनुमान लगाते हैं!" क्योंकि यहीं पर असली सीख होती है।
    • यदि छात्र किसी प्रश्न में पहले से ही कुशल है, तो ट्यूटर कहता है, "बहुत अच्छा, केवल एक अनुमान ही काफी है।"
    • उपमा: यह एक ऐसे जुआरी की तरह है जो उस सिक्के के उछाल पर दांव लगाना बंद कर देता है जिसे वह जानता है कि निष्पक्ष है, और इसके बजाय उस पासे के खेल पर सारा पैसा लगा देता है जिसके बदलने की संभावना सबसे अधिक है। यह समय बचाता है और प्रयास को वहीं केंद्रित करता है जहाँ इसकी सबसे अधिक आवश्यकता है।

2. "संकेत के साथ नकल" वाला तरीका (ICL Seeding)

कभी-कभी, छात्र के सामने एक ऐसा प्रश्न आता है जो इतना कठिन होता है कि उसे हर बार शून्य स्टार मिलते हैं। पुराने सिस्टम में, छात्र बस खाली पन्ने को घूरता रहता, निराश हो जाता, और शिक्षक के पास मदद करने का कोई तरीका नहीं होता क्योंकि छात्र कभी भी कोई "सही" उत्तर ही नहीं दे पाता जिससे सीखा जा सके।

  • XRPO का समाधान: ट्यूटर चुपके से छात्र के हाथ में एक "चीट शीट" (संकेत पत्र) थमा देता है। यह वर्तमान प्रश्न का उत्तर नहीं है, बल्कि एक समान समस्या है जिसे छात्र ने अतीत में सही ढंग से हल किया था।
    • उपमा: कल्पना कीजिए कि आप एक पहेली में फंस गए हैं। खाली पन्ने को घूरने के बजाय, कोई आपको कल हल की गई एक समान पहेली की तस्वीर थमा देता है। अचानक, आपको याद आता है, "ओह! मैंने कल इसी तरह का तरीका इस्तेमाल किया था!" यह छात्र को "फंसे हुए" राज्य से बाहर निकालता है और उस दीवार को तोड़ने में मदद करता है जिसे वह अकेले पार नहीं कर पा रहा था।

3. "रचनात्मकता को पुरस्कृत करना" बोनस (Novelty Sharpening)

पुराने सिस्टम में, यदि छात्र सही उत्तर देता था, तो उसे गोल्ड स्टार मिलता था। इससे कोई फर्क नहीं पड़ता था कि उसने इसे एक उबाऊ, मानक तरीके से हल किया या एक चतुर, अद्वितीय तरीके से। इसने सभी छात्रों के उत्तरों को एक जैसा बना दिया, और उन्होंने रचनात्मक होना छोड़ दिया।

  • XRPO का समाधान: ट्यूटर सही उत्तरों को देखता है और कहता है, "आपने इसे सही किया, लेकिन आपने इसे बहुत ही असामान्य तरीके से किया! यह प्रभावशाली है।"
    • उपमा: एक कुकिंग कॉन्टेस्ट (खाना पकाने की प्रतियोगिता) की कल्पना करें। यदि सभी ने एक बेहतरीन बर्गर बनाया, तो सबको एक ही स्कोर मिलेगा। लेकिन XRPO उस व्यक्ति को अतिरिक्त अंक देता है जिसने एक गुप्त, दुर्लभ मसाले का उपयोग करके एक बेहतरीन बर्गर बनाया जिसे उसने खुद आविष्कार किया है। यह छात्र को सामान्य समाधानों की नकल करने के बजाय नए, रचनात्मक रास्तों को खोजने के लिए प्रोत्साहित करता है।

परिणाम

जब शोधकर्ताओं ने इस नए "ट्यूटर" (XRPO) का पुराने तरीकों के मुकाबले परीक्षण किया:

  • यह तेजी से सीखा: छात्र ने आधे से भी कम समय में (2.7 गुना तेज़) समान कौशल स्तर प्राप्त कर लिया।
  • यह अधिक स्मार्ट बना: छात्र ने अधिक समस्याओं को सही ढंग से हल किया, विशेष रूप से उन कठिन समस्याओं को जो पहले उन्हें उलझा देती थीं।
  • यह कुशल था: छात्र ने लंबे, भ्रामक उत्तर लिखने में समय बर्बाद नहीं किया; उसने संक्षिप्त और सटीक होना सीखा।

संक्षेप में, XRPO AI को केवल अनुमान लगाने से रोकता है और इसे एक मानव शिक्षार्थी की तरह व्यवहार करना सिखाता है: कठिन हिस्सों पर ध्यान केंद्रित करना, फंसने पर संकेत देना, और चतुर सोच को पुरस्कृत करना।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →