← नवीनतम पेपर
💬 NLP

EBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy Optimization

यह शोध पत्र EBPO का प्रस्ताव करता है, जो एक नवीन ढांचा है जो लार्ज लैंग्वेज मॉडल्स के लिए ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन को स्थिर करने हेतु एम्पेरिकल बेयस श्रिंकेज (Empirical Bayes shrinkage) का उपयोग करके स्थानीय बेसलाइन्स को वैश्विक सांख्यिकी के साथ नियमित करता है, जिससे अनुमानित वेरिएंस कम होता है, वैनिशिंग ग्रेडिएंट्स को रोकता है, और विविध रीजनिंग बेंचमार्क पर मौजूदा विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Kevin Han, Yuhang Zhou, Mingze Gao, Gedi Zhou, Serena Li, Abhishek Kumar, Xiangjun Fan, Weiwei Li, Lizhu Zhang

प्रकाशित 2026-02-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kevin Han, Yuhang Zhou, Mingze Gao, Gedi Zhou, Serena Li, Abhishek Kumar, Xiangjun Fan, Weiwei Li, Lizhu Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान छात्र (एक AI) को कठिन गणित की समस्याएं हल करना सिखाने की कोशिश कर रहे हैं। आप उसे एक समस्या देते हैं, और वह उसे कई बार हल करने की कोशिश करता है। कभी वह सही होता है, कभी गलत।

उसे सिखाने में मदद करने के लिए, आपको उसे फीडबैक (प्रतिपुष्टि) देना होगा। वर्तमान सबसे अच्छा तरीका (जिसे GRPO कहा जाता है) इस प्रकार काम करता है:

  1. आप छात्र से एक ही समस्या को 8 बार हल करने के लिए कहते हैं (एक "ग्रुप")।
  2. आप उन 8 उत्तरों को देखते हैं। यदि 4 सही हैं और 4 गलत, तो आप छात्र को कहते हैं, "तुम औसत रहे।"
  3. यदि सभी 8 उत्तर गलत हैं, तो वर्तमान तरीका कहता है, "खैर, सब फेल हो गए, इसलिए औसत शून्य है। उत्तरों के बीच कोई अंतर नहीं है, इसलिए मैं तुम्हें यह नहीं बता सकता कि तुम्हें अलग से क्या करना चाहिए।" छात्र को शून्य फीडबैक मिलता है और वह उस प्रयास से कुछ भी नहीं सीख पाता।
  4. यदि सभी 8 उत्तर सही हैं, तो छात्र को कोई नई जानकारी नहीं मिलती क्योंकि सभी सफल रहे।

यह दो बड़ी समस्याएं पैदा करता है:

  • "छोटा समूह" वाली समस्या (The Small Group Problem): यदि आप केवल पैसा/कंप्यूटर शक्ति बचाने के लिए छात्र को 2 या 3 बार ही पूछ सकते हैं, तो औसत बहुत अस्थिर होता है। एक भाग्यशाली अनुमान भी पूरे सबक को बिगाड़ सकता है।
  • "पूर्ण विफलता" वाली समस्या (The Total Failure Problem): यदि समस्या बहुत कठिन है और छात्र हर बार विफल रहता है, तो शिक्षक हार मान लेता है और उस दौर के लिए सिखाना बंद कर देता है।

पेश है EBPO: "बुद्धिमान गुरु" वाला दृष्टिकोण

यह पेपर एक नया तरीका पेश करता है जिसे EBPO (एम्पिरिकल बेयस पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है। छात्र के पिछले 8 प्रयासों को अलग से देखने के बजाय, EBPO एक बुद्धिमान गुरु की तरह काम करता है जो छात्र के संपूर्ण इतिहास को याद रखता है।

यह एक सरल उपमा (analogy) का उपयोग करके इस प्रकार काम करता है:

1. "श्रिंकेज" (Shrinkage) का तरीका (शक्ति उधार लेना)

कल्पना कीजिए कि छात्र एक परीक्षा दे रहा है।

  • पुराना तरीका (GRPO): यदि छात्र एक कठिन कैलकुलस की समस्या पर 0/8 अंक प्राप्त करता है, तो शिक्षक कहता है, "तुम्हारा स्कोर 0 है। बस इतना ही।"
  • नया तरीका (EBPO): शिक्षक छात्र के पिछले प्रदर्शन को देखता है। "रुको, तुम आमतौर पर आसान बीजगणित (algebra) में 80% अंक लाते हो, लेकिन कठिन कैलकुलस में केवल 20%। भले ही आज तुम 0/8 लाए हो, लेकिन मैं जानता हूँ कि तुम एक बुद्धिमान छात्र हो जो आमतौर पर 0 से बेहतर प्रदर्शन करता है। इसलिए, मैं तुम्हारे स्कोर को तुम्हारे सामान्य औसत की ओर 'श्रिंक' (shrink) कर दूँगा।"

"0" कहने के बजाय, शिक्षक कहता है, "तुम सामान्य से खराब प्रदर्शन कर रहे हो, लेकिन पूरी तरह विफल होने जितना बुरा भी नहीं।" यह छात्र को एक पेनल्टी सिग्नल (अधिक मेहनत करने के लिए प्रेरित करना) देता है, भले ही वह पूरी तरह विफल हो जाए। यह "सीखना रुक जाने" की समस्या को रोकता है।

2. "स्मार्ट बेसलाइन" (Smart Baseline) (ग्लोबल बनाम लोकल)

"बेसलाइन" को तुलना के मानक के रूप में समझें।

  • GRPO एक लोकल बेसलाइन का उपयोग करता है: यह छात्र की तुलना केवल उसके अभी के 8 प्रयासों से करता है। यदि समूह छोटा या अराजक है, तो बेसलाइन शोर भरी (noisy) और अविश्वसनीय होती है।
  • EBPO एक ग्लोबल बेसलाइन का उपयोग करता है: यह छात्र के वर्तमान प्रयासों की तुलना उन हजारों पिछली समस्याओं के "ग्लोबल एवरेज" से करता है जिन्हें छात्र ने हल किया है।
    • यदि छात्र एक कठिन समस्या में विफल होता है, तो EBPO कहता है, "यह अपेक्षित है; तुम आमतौर पर इनमें विफल होते हो।" (छोटा दंड/penalty)।
    • यदि छात्र एक आसान समस्या में विफल होता है, तो EBPO कहता है, "यह अजीब है! तुम आमतौर पर इनमें महारत हासिल करते हो!" (बड़ा दंड/penalty)।

यह AI को यह समझने में सक्षम बनाता है कि "यह समस्या इतनी कठिन है कि कोई भी इसमें विफल हो सकता है" और "मैंने एक आसान सवाल पर मूर्खतापूर्ण गलती की है" के बीच क्या अंतर है।

3. "पाठ्यक्रम" (Curriculum) (सीखने का क्रम मायने रखता है)

पेपर यह भी सुझाव देता है कि प्रशिक्षण को एक स्कूल पाठ्यक्रम की तरह व्यवस्थित किया जाए।

  • रैंडम अराजकता (Random Chaos): "1+1" और "क्वांटम फिजिक्स" की समस्याओं को रैंडमली मिलाने से गुरु की याददाश्त भ्रमित हो जाती है कि क्या "कठिन" है और क्या "आसान"।
  • EBPO रणनीति: पहले आसान समस्याएं शुरू करें, फिर मध्यम, फिर कठिन। इससे "बुद्धिमान गुरु" को छात्र की क्षमताओं का अधिक सटीक मानचित्र बनाने में मदद मिलती है, जिससे फीडबैक और भी सटीक हो जाता है।

यह एक बड़ी बात क्यों है?

  1. पैसा बचाता है: क्योंकि EBPO डेटा का उपयोग करने में इतना स्मार्ट है, इसलिए आपको अच्छे परिणाम प्राप्त करने के लिए प्रति समस्या 32 या 64 उत्तर उत्पन्न करने की आवश्यकता नहीं है। आप केवल 8 के साथ भी बेहतरीन परिणाम प्राप्त कर सकते हैं। यह भारी मात्रा में कंप्यूटर शक्ति बचाता है।
  2. हार नहीं मानता: भले ही एक कठिन समस्या पर AI हर बार विफल हो जाए, EBPO फिर भी उसे उपयोगी फीडबैक देने का रास्ता निकाल लेता है। GRPO बस हार मान लेता है।
  3. स्थिरता (Stability): यह AI को पागल होने (exploding gradients) या फंस जाने (vanishing gradients) से रोकता है। यह सीखने की प्रक्रिया को सुचारू और स्थिर रखता है।

निचोड़ (The Bottom Line)

GRPO एक ऐसे शिक्षक की तरह है जो केवल छात्र के वर्तमान प्रदर्शन को देखता है और यदि छात्र का दिन खराब हो या सैंपल साइज छोटा हो, तो वह भ्रमित हो जाता है।

EB_PO एक ऐसे शिक्षक की तरह है जो छात्र के पूरे इतिहास को जानता है, विशिष्ट विषय की कठिनाई को समझता है, और तब भी व्यक्तिगत और सहायक फीडबैक देता है जब छात्र पूरी तरह विफल हो जाता है। यह AI प्रशिक्षण को तेज़, सस्ता और अधिक विश्वसनीय बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →