← नवीनतम पेपर
💬 NLP

ExGRPO: Learning to Reason from Experience

ExGRPO एक नवीन ढांचा है जो शुद्धता और एंट्रॉपी के आधार पर मूल्यवान रोलआउट अनुभवों की पहचान करके और उन्हें प्राथमिकता देकर सत्यापन योग्य पुरस्कारों से सुदृढीकरण शिक्षण (reinforcement learning) की दक्षता और स्थिरता को बढ़ाता है, जिससे मानक ऑन-पॉलिसी विधियों की तुलना में विभिन्न बड़े भाषा मॉडलों में तर्क प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Runzhe Zhan, Yafu Li, Zhi Wang, Xiaoye Qu, Dongrui Liu, Jing Shao, Derek F. Wong, Yu Cheng

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Runzhe Zhan, Yafu Li, Zhi Wang, Xiaoye Qu, Dongrui Liu, Jing Shao, Derek F. Wong, Yu Cheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अनुभवहीन छात्र को जटिल गणितीय पहेलियाँ हल करना सिखाने की कोशिश कर रहे हैं। आप उसे एक समस्या देते हैं, वह उसे हल करने की कोशिश करता है, और फिर आप उत्तर की जाँच करते हैं।

पुराना तरीका (Standard RL):
पारंपरिक विधि में, छात्र समस्या को हल करने का प्रयास करता है। यदि वह इसे सही ढंग से हल करता है, तो आप कहते हैं "बहुत अच्छा!" और वह थोड़ा सा सीखता है। यदि वह गलत करता है, तो आप कहते हैं "फिर से प्रयास करें।"
समस्या क्या है? उस एक प्रयास के बाद, आप छात्र की पूरी विचार प्रक्रिया को कचरे के डिब्बे में फेंक देते हैं। भले ही उसने अंतिम गणना में गलती करने से पहले बीच में एक बहुत अच्छा तार्किक कदम उठाया हो, वह शानदार सोच हमेशा के लिए खो जाती है। आप उसे हर बार शून्य से शुरू करने के लिए मजबूर करते हैं। यह अविश्वसनीय रूप से विनाशकारी है, जैसे एक किताब पढ़ना, एक वाक्य सीखना, और फिर अगला पृष्ठ पढ़ने से पहले उस किताब को जला देना।

नया तरीका (ExGRPO):
ExGRPO एक स्मार्ट, व्यवस्थित नोटबुक देने जैसा है, न कि कचरे के डिब्बे जैसा।

ExGRPO कैसे काम करता है, इसे सरल उपमाओं में यहाँ समझाया गया है:

1. "गोल्डिलॉक्स" फ़िल्टर (सही समस्याओं का चयन)

कल्पना कीजिए कि आपके पास होमवर्क की समस्याओं का एक ढेर है जो "जूते के फीते कैसे बांधें" (बहुत आसान) से लेकर "क्वांटम भौतिकी" (बहुत कठिन) तक फैला हुआ है।

  • बहुत आसान: छात्र बिना सोचे-समझे इसे तुरंत हल कर देता है। वे कुछ भी नया नहीं सीखते।
  • बहुत कठिन: छात्र तुरंत हार मान लेता है या बेतरतीब ढंग से अनुमान लगाने लगता है। वे निराश हो जाते हैं और कुछ भी नहीं सीखते।
  • बिल्कुल सही (Just Right): छात्र थोड़ा संघर्ष करता है, गहराई से सोचता है, और अंततः इसे सुलझा लेता है। यहीं पर असली जादू होता है।

ExGRGB एक सख्त लेकिन निष्पक्ष शिक्षक की तरह कार्य करता है। यह छात्र के पिछले प्रयासों को देखता है और केवल "बिल्कुल सही" समस्याओं को ही नोटबुक में रखता है। यह उन समस्याओं को हटा देता है जो बहुत आसान थीं या जिनमें छात्र पूरी तरह से खो गया था। यह सुनिश्चित करता है कि छात्र अपना समय उन चीजों के अभ्यास में बिताए जो वास्तव में उन्हें स्मार्ट बनाएंगी।

2. "स्पष्ट सोच" डिटेक्टर (एन्ट्रॉपी/Entropy)

कभी-कभी, एक छात्र गलती से सही उत्तर प्राप्त कर सकता है, या एक अव्यवस्थित, भ्रमित करने वाला पैराग्राफ लिखकर जिसमें संयोग से सही संख्या मौजूद हो।

  • उच्च एन्ट्रॉपी (अव्यवस्थित सोच): छात्र इधर-उधर भटक रहा है, 10 अलग-अलग यादृच्छिक रास्तों को आज़मा रहा है, और भ्रमित हो रहा है। भले ही उसे सही उत्तर मिल जाए, लेकिन उसका तर्क कमजोर है।
  • कम एन्ट्रॉपी (स्पष्ट सोच): छात्र के विचार शांत, प्रत्यक्ष और तार्किक हैं। उसे पता है कि वह वास्तव में क्या कर रहा है।

ExGRPO के पास "अव्यवस्थित सोच" का पता लगाने के लिए एक विशेष सेंसर है। यदि छात्र की नोटबुक प्रविष्टि भटकने और भ्रम से भरी है (उच्च एन्ट्रॉपी), तो सिस्टम कहता है, "नहीं, यह सीखने के लिए एक अच्छा उदाहरण नहीं है।" यह केवल उन प्रविष्टियों को सहेजता है जहाँ छात्र ने स्पष्ट और तार्किक रूप से सोचा था। यह छात्र को बुरी आदतें सीखने या "किस्मत के भरोसे सही उत्तर" पाने से रोकता है।

3. "स्मार्ट नोटबुक" (अनुभव पुनरावृत्ति/Experience Replay)

"बिल्कुल सही" और "स्पष्ट सोच" वाले प्रयासों को फेंकने के बजाय, ExGRPO उन्हें एक स्मार्ट नोटबुक में रखता है।

  • मिश्रण: जब अध्ययन करने का समय होता है, तो शिक्षक छात्र को केवल नई समस्याएँ नहीं देता। वे उन्हें एक मिश्रण देते हैं: 50% नई समस्याएँ अन्वेषण के लिए, और 50% नोटबुक से ली गई समस्याएँ समीक्षा के लिए।
  • लाभ: "स्वर्ण" अतीत के प्रयासों की समीक्षा करके, छात्र जो पहले से जानता है उसे सुदृढ़ करता है और उस पर आगे बढ़ता है। उन्हें हर दिन बुनियादी बातें फिर से सीखने की आवश्यकता नहीं होती। यह सीखने की प्रक्रिया को बहुत तेज़ और अधिक स्थिर बनाता है।

यह क्यों महत्वपूर्ण है

यह पेपर दिखाता है कि यह तरीका चमत्कार करता है, विशेष रूप से:

  • कमजोर छात्रों के लिए: यह उन्हें विफलता के चक्र में फंसने से रोकता है। अपने कुछ "भाग्यशाली हिट्स" (शुरुआती दौर में मिले सही उत्तर) की समीक्षा करके, वे आत्मविश्वास प्राप्त करते हैं और तेजी से सीखते हैं।
  • मजबूत छात्रों के लिए: यह उन्हें आसान समस्याओं पर समय बर्बाद करने के बजाय सबसे मूल्यवान, चुनौतीपूर्ण समस्याओं पर ध्यान केंद्रित करके उच्च स्तर के तर्क तक पहुँचने में मदद करता है।

संक्षेप में:
ExGRPO "कोशिश करो, असफल हो जाओ, भूल जाओ" प्रणाली से "कोशिश करो, विश्लेषण करो, व्यवस्थित करो और समीक्षा करो" प्रणाली में अपग्रेड करने जैसा है। यह AI को अपने सीखने के सबसे अच्छे क्षणों को क्यूरेट (संग्रहित) करके, यह सुनिश्चित करके कि वह केवल उन्हीं समस्याओं का अभ्यास करे जो मायने रखती हैं और करते समय स्पष्ट रूप से सोचे, एक बेहतर छात्र बनना सिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →