← नवीनतम पेपर
🤖 machine learning

Gradient Extrapolation-Based Policy Optimization

यह शोध पत्र ग्रेडिएंट एक्सट्रैपोलेशन-आधारित पॉलिसी ऑप्टिमाइज़ेशन (GXPO) का प्रस्ताव करता है, जो GRPO-शैली के रीजनिंग RL के लिए एक प्लग-कम्पैटिबल विधि है, जो बिना किसी नए रोलआउट की आवश्यकता के, केवल तीन बैकवर्ड पास का उपयोग करके महंगे मल्टी-स्टेप लुकअहेड्स का अनुमान लगाता है ताकि pass@1 प्रदर्शन और प्रशिक्षण दक्षता में महत्वपूर्ण सुधार किया जा सके।

मूल लेखक: Ismam Nur Swapnil, Aranya Saha, Tanvir Ahmed Khan, Mohammad Ariful Haque, Ser-Nam Lim

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ismam Nur Swapnil, Aranya Saha, Tanvir Ahmed Khan, Mohammad Ariful Haque, Ser-Nam Lim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "ग्रेडिएंट एक्सट्रपलेशन-बेस्ड पॉलिसी ऑप्टिमाइज़ेशन (GXPO)" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया।

बड़ी तस्वीर: "लुक-अहेड" (आगे देखने की) समस्या

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान छात्र (एक लार्ज लैंग्वेज मॉडल) को जटिल गणित के सवाल हल करना सिखा रहे हैं। आप उसे एक सवाल देते हैं, वह उसे हल करने की कोशिश करता है, और यदि वह सही हल करता है, तो आप उसे शाबाशी (रिवॉर्ड) देते हैं। यदि वह गलत होता है, तो आप उसे फिर से कोशिश करने के लिए कहते हैं।

वर्तमान मानक विधि (जिसे GRPO कहा जाता है) में, छात्र एक कदम उठाता है, फीडबैक प्राप्त करता है, और तुरंत केवल उस एक कदम के आधार पर अपनी सोच को सुधारता है। यह ऐसा है जैसे किसी अंधेरे जंगल में चलते समय केवल अपने पैरों के ठीक नीचे की ज़मीन को देखना। यह सुरक्षित और तेज़ है, लेकिन आप इससे कुछ कदम आगे चल रहे बेहतर रास्ते को मिस कर सकते हैं।

दूर तक देखने के लिए, आप छात्र को यह तय करने से पहले कि उसे किस दिशा में मुड़ना है, 10 कदम आगे जाकर अन्वेषण (explore) करने के लिए भेज सकते हैं। इसे "लुक-अहेड" (आगे देखना) कहा जाता है। हालाँकि, AI की दुनिया में, 10 कदम आगे जाकर अन्वेषण करना अविश्वसनीय रूप से महंगा है। इसके लिए कंप्यूटर को हर एक सबक के लिए बहुत अधिक भारी काम (गणितीय गणना) करना पड़ता है, जो सब कुछ धीमा कर देता है और बिजली का एक बड़ा खर्च भी कराता है।

समाधान: GXPO (द "क्रिस्टल बॉल" ट्रिक)

लेखकों ने GXPO नामक एक नई विधि प्रस्तावित की है। GXPO को एक स्मार्ट शॉर्टकट के रूप में समझें जो छात्र को वास्तव में पूरी दूरी तय किए बिना भविष्य में "झाँकने" (peek) की अनुमति देता है।

यहाँ बताया गया है कि GXPO कैसे काम करता है, जिसे तीन सरल चरणों में विभाजित किया गया है:

1. "प्रोब" (दो त्वरित कदम उठाना)

केवल अपने पैरों के नीचे की ज़मीन को देखने के बजाय, छात्र दो त्वरित, छोटे कदम आगे बढ़ाता है और तुरंत ज़मीन की जाँच करता है।

  • स्टेप A: वह एक छोटा कदम लेता है।
  • स्टेप B: वह एक और छोटा कदम लेता है।
  • चेक (जाँच): वह तुलना करता है कि शुरुआत में, स्टेप A के बाद, और स्टेप B के बाद ज़मीन कैसी महसूस हुई।

2. "एक्सट्रपलेशन" (भविष्यवाणी करना)

इन दो छोटे कदमों की तुलना करके, छात्र एक पैटर्न का अनुमान लगा सकता है।

  • उदाहरण: कल्पना कीजिए कि आप कार चला रहे हैं। यदि आप स्टीयरिंग व्हील को थोड़ा बाईं ओर घुमाते हैं, और कार थोड़ी बाईं ओर मुड़ती है, और फिर आप इसे फिर से घुमाते हैं और यह और अधिक मुड़ती है, तो आप अनुमान लगा सकते हैं कि यदि आप इसे घुमाते रहते, तो कार अंततः एक बड़ा मोड़ लेती।
  • GXPO इस पैटर्न का उपयोग यह भविष्यवाणी करने के लिए करता है कि यदि छात्र ने केवल दो के बजाय 10 कदम (या KK कदमों की कोई भी संख्या) उठाए होते, तो वह कहाँ होता। यह एक "आभासी" (virtual) गंतव्य बनाता है।

3. "करेक्शन" (सुरक्षा जाल)

यह सबसे महत्वपूर्ण हिस्सा है। छात्र केवल उस अनुमानित 10-कदम वाले गंतव्य की ओर अंधाधुंध नहीं कूदता। ऐसा करना खतरनाक हो सकता है क्योंकि भविष्यवाणी थोड़ी गलत हो सकती है।

  • इसके बजाय, छात्र उस अनुमानित स्थान की ओर आधे रास्ते तक बढ़ता है।
  • फिर, वह रुकता है और इस नए स्थान पर ज़मीन का वास्तविक, सावधानीपूर्वक अवलोकन करता है।
  • वह इस वास्तविक जानकारी का उपयोग अपना अंतिम निर्णय लेने के लिए करता है।

यह एक बड़ी बात क्यों है?

पेपर का दावा है कि GXPO बिना भारी लागत के, दूर तक देखने (बेहतर तर्क/reasoning) के लाभ प्राप्त करता है।

  • मानक लुक-अहेड: 10 कदम आगे देखने के लिए, आपको आमतौर पर 11 गणनाएँ करनी पड़ती हैं (1 शुरुआत के लिए + 10 कदमों के लिए)।
  • GXPO: 10 कदम आगे देखने के लिए, GXPO केवल 3 गणनाएँ करता है (2 त्वरित प्रोब के लिए + 1 अंतिम करेक्शन के लिए)।

यह एक ऐसे क्रिस्टल बॉल की तरह है जो आपको 10 कदम आगे देखने की अनुमति देता है, लेकिन आपको केवल 3 कदम देखने की कीमत चुकानी पड़ती है।

"सेफ्टी स्विच" (सुरक्षा स्विच)

लेखकों ने एक सुरक्षा तंत्र भी बनाया है। कभी-कभी, "क्रिस्टल बॉल" (भविष्यवाणी) अस्थिर या अविश्वसनीय हो सकती है, खासकर यदि छात्र कुछ बहुत नया या कठिन सीख रहा हो।

  • GXPO में एक अंतर्निहित "Z-score गेट" (एक निगरानी प्रणाली) है। यदि इसे महसूस होता है कि भविष्यवाणी बहुत अधिक अनियंत्रित या अस्थिर हो रही है, तो यह स्वचालित रूप से क्रिस्टल बॉल को बंद कर देता है।
  • जब ऐसा होता है, तो सिस्टम तुरंत मानक, सुरक्षित विधि (केवल पैरों के नीचे की ज़मीन को देखना) पर वापस आ जाता है जब तक कि स्थितियाँ सामान्य न हो जाएँ। यह सुनिश्चित करता है कि एक गलत अनुमान के कारण छात्र दुर्घटनाग्रस्त न हो जाए।

परिणाम

पेपर ने Qwen और Llama जैसे मॉडल्स का उपयोग करके गणितीय तर्क कार्यों (जैसे बीजगणित और ज्यामिति के सवालों को हल करना) पर इसका परीक्षण किया।

  • बेहतर स्कोर: GXPO मॉडल्स ने मानक विधि की तुलना में अधिक समस्याओं को सही ढंग से हल किया।
  • तेज़ सीखना: वे अपने शिखर प्रदर्शन (peak performance) तक बहुत तेज़ी से (कम चरणों और कम समय में) पहुँचे।
  • समान लागत: भले ही वे "और दूर देख रहे थे," उन्होंने मानक विधि की तुलना में अधिक कंप्यूटर पावर का उपयोग नहीं किया क्योंकि उन्होंने प्रत्येक स्टेप में केवल वे 3 गणनाएँ ही कीं।

सारांश

GXPO AI के लिए एक स्मार्ट ट्रेनिंग ट्रिक है। यह AI को यह "अनुमान" लगाने की अनुमति देता है कि यदि इसने लंबे समय तक अभ्यास किया होता तो क्या होता, यह जाँचता है कि क्या वह अनुमान सुरक्षित है, और फिर उस अंतर्दृष्टि का उपयोग तेज़ी से सीखने के लिए करता है। यह वास्तविक योजना बनाने की भारी कीमत चुकाए बिना, गहरी योजना (deep planning) के लाभ प्राप्त करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →