← नवीनतम पेपर
🤖 machine learning

Rollout-Level Advantage-Prioritized Experience Replay for GRPO

यह शोध पत्र रोलआउट-लेवल एडवांटेज-प्रायोरिटाइज्ड एक्सपीरियंस रिप्ले (Rollout-Level Advantage-Prioritized Experience Replay) का प्रस्ताव करता है, जो एक ऐसी विधि है जो एज इविक्शन (age eviction) और फ्रेश-एंकर्ड कंपोजिशन (fresh-anchored composition) के माध्यम से स्टेलेनेस (staleness) को सीमित करते हुए एडवांटेज मैग्नीट्यूड (advantage magnitude) के आधार पर व्यक्तिगत रोलआउट्स को संग्रहीत और प्राथमिकता देकर GRPO की सैंपल इनएफिशिएंसी (sample inefficiency) को कम करती है, जिसके परिणामस्वरूप विभिन्न गणितीय बेंचमार्क पर विभिन्न मॉडल स्केल्स पर महत्वपूर्ण प्रदर्शन और दक्षता लाभ प्राप्त होते हैं।

मूल लेखक: Gyeongtae Yoo, Sanghyeok Park, Soohyuk Jang, Ik-hwan Kim, Sungroh Yoon

प्रकाशित 2026-06-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gyeongtae Yoo, Sanghyeok Park, Soohyuk Jang, Ik-hwan Kim, Sungroh Yoon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान छात्र (एक AI) को कठिन गणितीय समस्याओं को हल करना सिखा रहे हैं। आप छात्र को एक समस्या देते हैं, और वह उसे हल करने की कोशिश करता है। कभी वह सही होता है, कभी गलत।

इस शोध पत्र में वर्णित मानक पद्धति (जिसे GRPO कहा जाता है) में, शिक्षक छात्र द्वारा किए गए 8 प्रयासों के एक समूह को देखता है। यदि छात्र ने 7 गलतियाँ कीं और 1 सही किया, तो शिक्षक कहता है, "ठीक है, वह एक सही उत्तर बहुत बढ़िया था! चलिए इससे सीखते हैं।" फिर, शिक्षक उन सभी 8 प्रयासों को फेंक देता है और छात्र को तुरंत 8 नए प्रयास करने के लिए कहता है। पुराने प्रयासों को फिर कभी नहीं देखा जाता।

इस शोध पत्र के लेखक कहते हैं कि यह एक बर्बादी है। गलत उत्तरों के समुद्र में वह एक अकेला "सही" उत्तर जानकारी का एक खजाना है, लेकिन इसे केवल एक बार देखने के बाद फेंक दिया जाता है।

समस्या: "बासी भोजन" की समस्या (The "Stale" Food Issue)

लेखकों ने एक सरल विचार आजमाया: एक्सपीरियंस रिप्ले (Experience Replay)। यह एक फ्रिज में पिछले प्रयासों को रखने जैसा है ताकि छात्र बाद में उन्हें फिर से पढ़ सके।

लेकिन इसमें एक पेंच है: छात्र बहुत तेज़ी से सीखता है। जब तक आप फ्रिज से कोई पुराना प्रयास दोबारा पढ़ने के लिए निकालते हैं, तब तक छात्र इतना बदल चुका होता है कि वह पुराना प्रयास अब समझ में नहीं आता। यह एक किशोर को उस पाठ्यपुस्तक से पढ़ाने की कोशिश करने जैसा है जो एक छोटे बच्चे के लिए लिखी गई थी; छात्र उस संदर्भ से इतना दूर जा चुका होता है कि वह "ड्रिफ्ट" कर गया है। यदि आप उसे इसे पढ़ने के लिए मजबूर करते हैं, तो यह उसे भ्रमित करता है और उसके सीखने में बाधा डालता है।

समाधान: एक स्मार्ट, ताज़ा-प्रथम रसोई (A Smart, Fresh-First Kitchen)

लेखकों ने इस समस्या को ठीक करने के लिए तीन मुख्य नियम बनाने का प्रस्ताव दिया है:

1. "ताज़ा एंकर" (वर्तमान को न भूलें) (The "Fresh Anchor")
पुराने प्रयासों को एक बड़े ढेर में बेतरतीब ढंग से मिलाने के बजाय, वे नवीनतम प्रयासों को अलग रखते हैं और हमेशा उन्हें मुख्य पाठ के रूप में उपयोग करते हैं। इसे एक ऐसे शेफ की तरह समझें जो हमेशा ताजी सामग्री के साथ भोजन बनाना शुरू करता है। वे फिर, अतिरिक्त स्वाद जोड़ने के लिए कुछ "गरम किए हुए" बचे हुए व्यंजनों (पुराने प्रयासों) को मिश्रण में जोड़ते हैं, लेकिन ताजी सामग्री ही आधार होती है। यह सुनिश्चित करता है कि छात्र हमेशा वही सीख रहा है जो उसने अभी किया है, जबकि उसे अतीत से मिलने वाला बोनस भी मिलता है।

2. "एक्सपायरी डेट" (आयु निष्कासन) (The "Expiration Date")
फ्रिज में "बासी भोजन" की समस्या को रोकने के लिए, वे हर प्रयास पर एक सख्त समाप्ति तिथि लगाते हैं। यदि कोई प्रयास कुछ निश्चित चरणों (जैसे, 10 दिन) से अधिक पुराना है, तो उसे तुरंत बाहर निकाल दिया जाता है। यह गारंटी देता है कि फ्रिज कितना भी बड़ा क्यों न हो, छात्र कभी भी ऐसी चीज़ का अध्ययन नहीं करेगा जो प्रासंगिक होने के लिए बहुत पुरानी हो गई है।

3. "स्टार स्टूडेंट" प्राथमिकता (Advantage Prioritization)
सभी पुराने प्रयास समान रूप से उपयोगी नहीं होते। लेखकों ने महसूस किया कि सबसे मूल्यवान सबक "दुर्लभ" प्रयासों से आते हैं।

  • रूपक (Metaphor): कल्पना करें कि 8 छात्र एक परीक्षा दे रहे हैं। 7 को 'D' ग्रेड मिलता है, और 1 को 'A' ग्रेड मिलता है। वह एक 'A' ही "स्टार" है।
  • पुराना तरीका: कुछ प्रणालियाँ 8 के पूरे समूह को एक इकाई मानती थीं। यदि समूह मिश्रित था, तो वे उसे फिर से नहीं चुन पाते थे।
  • नया तरीका: यह प्रणाली व्यक्तिगत प्रयासों को देखती है। यह 'D' ग्रेड वाले समूह में उस एक 'A' को देखती है और कहती है, "यह विशिष्ट प्रयास एक खजाना है!" यह उस विशिष्ट 'A' को बचाने और फिर से पढ़ने को प्राथमिकता देती है क्योंकि यह सबसे अधिक सिखाता है। यह उन उबाऊ 'D' ग्रेड वाले प्रयासों को अनदेखा कर देती है जिन्हें लोग पहले से ही जानते हैं।

परिणाम: बड़े मॉडल बेहतर सीखते हैं (The Results: Bigger Models Learn Better)

टीम ने गणितीय पहेलियों का उपयोग करके तीन अलग-अलग आकारों के AI मॉडल (छोटे, मध्यम और बड़े) पर परीक्षण किया।

  • छोटा मॉडल (Small Model): इसमें मामूली सुधार देखा गया।
  • मध्यम मॉडल (Medium Model): इसमें अच्छा सुधार देखा गया।
  • बड़ा मॉडल (Large Model): इसमें भारी सुधार देखा गया।

सबसे बड़े मॉडल ने गणित की समस्याओं को हल करने में काफी बेहतर प्रदर्शन किया (औसतन लगभग 4.35% अधिक सटीक) और यह अधिक कुशलता से हुआ। इसने अनावश्यक टेक्स्ट उत्पन्न किए बिना अधिक सटीक होना सीखा।

यह क्यों मायने रखता है

यह शोध पत्र दिखाता है कि हम यह तय करके कि किन पुराने पाठों को रखना है, उन्हें कितनी देर तक रखना है, और उन्हें नए पाठों के साथ कैसे मिलाना है, AI को बहुत बेहतर तरीके से सिखा सकते हैं। यह केवल कड़ी मेहनत करने के बारे में नहीं है; यह अतीत के सबसे अच्छे क्षणों को वर्तमान को भ्रमित किए बिना पुनर्चक्रित (recycle) करने के बारे में है।

संक्षेप में: उन्होंने AI प्रशिक्षण के लिए एक स्मार्ट "टाइम कैप्सूल" बनाया है जो सबसे अच्छे, सबसे हालिया और सबसे अनूठे पाठों को सुरक्षित रखता है, जिससे यह सुनिश्चित होता है कि AI अपनी गलतियों से भ्रमित हुए बिना अपने सबसे अच्छे क्षणों से सीख सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →