GRPO is Secretly a Process Reward Model
यह शोध पत्र सैद्धांतिक रूप से सिद्ध करता है कि आउटकम रिवॉर्ड मॉडल के साथ ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO), एक प्रोसेस रिवॉर्ड मॉडल के समान है, असंतुलित स्टेप्स (imbalanced steps) को संभालने में इसकी एक खामी की पहचान करता है, और एक सरल संशोधन (-GRPO) प्रस्तावित करता है जो स्पष्ट प्रोसेस रिवॉर्ड मॉडल्स की आवश्यकता के बिना, रीजनिंग प्रदर्शन और प्रशिक्षण दक्षता में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ इस पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों के माध्यम से समझाया गया है।
मुख्य विचार: रेसिपी में "गुप्त सामग्री" (The "Secret Sauce" in the Recipe)
कल्पना कीजिए कि आप एक रोबोट को एक जटिल गणित की समस्या हल करना सिखा रहे हैं। आप रोबोट को एक प्रॉम्प्ट देते हैं, और वह समाधान को चरण-दर-चरण (step-by-step) लिखने की कोशिश करता है।
आमतौर पर, रोबोट को ग्रेड देने के दो तरीके होते हैं:
- अंतिम ग्रेड (Outcome Reward): आप केवल अंत में देखते हैं। क्या उसने सही उत्तर दिया? यदि हाँ, तो +10 अंक। यदि नहीं, तो 0 अंक। यह एक ऐसे शिक्षक की तरह है जो केवल अंतिम परीक्षा के स्कोर को देखता है और इस बात को नज़रअंदाज़ कर देता है कि छात्र ने काम कैसे किया।
- चरण-दर-चरण ग्रेड (Process Reward): आप हर एक चरण (step) को ग्रेड देते हैं। "समीकरण सेट करने के लिए अच्छा काम किया," "ओह, यहाँ साइन गलत है।" यह करना कठिन है क्योंकि इसके लिए आपको हर लाइन की जाँच करने के लिए एक इंसान (या एक स्मार्ट AI) की आवश्यकता होती है।
पेपर की खोज:
लेखकों ने पाया कि GRPO (Group Relative Policy Optimization) नामक एक लोकप्रिय प्रशिक्षण विधि वास्तव में दूसरे काम (चरण-दर-चरण ग्रेडिंग) को गलती से कर रही है, भले ही इसे केवल पहले काम (अंतिम ग्रेड) के लिए बनाया गया हो।
वे इसे एक "प्रोसेस रिवॉर्ड मॉडल" (Process Reward Model - PRM) कहते हैं, लेकिन वे कहते हैं कि GRPO "गुप्त रूप से" एक ऐसा ही मॉडल है। यह एक ऐसे शेफ की तरह है जिसे लगता है कि वह सिर्फ केक बना रहा है, लेकिन वास्तव में वह एक गुप्त सामग्री का उपयोग कर रहा है जो बिना उसके जाने ही केक को पूरी तरह से फुला देती है।
"गुप्त" प्रक्रिया कैसे काम करती है: क्लास चैट का उदाहरण (The "Group Chat" Analogy)
यह समझने के लिए कि GRPO गुप्त रूप से चरणों को कैसे ग्रेड करता है, एक कक्षा के छात्रों (एक "ग्रुप") की कल्पना करें जो एक ही पहेली को हल करने की कोशिश कर रहे हैं।
- सेटअप: शिक्षक एक प्रश्न पूछता है। पाँच छात्र अपने उत्तर लिखते हैं।
- ओवरलैप (Overlap):
- छात्र A लिखता है: "पहले, मैं 2 जोड़ता हूँ..."
- छात्र B लिखता है: "पहले, मैं 2 जोड़ता हूँ..."
- छात्र C लिखता है: "पहले, मैं 2 जोड़ता हूँ..."
- छात्र D लिखता है: "पहले, मैं 5 से गुणा करता हूँ..."
- छात्र E लिखता है: "पहले, मैं 5 से गुणा करता हूँ..."
ध्यान दें कि छात्र A, B, और C का पहला चरण समान है ("2 जोड़ें")। छात्र D और E का एक अलग पहला चरण है।
- गुप्त ग्रेडिंग:
- यदि समूह का अंतिम उत्तर अच्छा है, तो शिक्षक पूरे समूह को उच्च स्कोर देता है।
- क्योंकि A, B, और C ने एक ही पहला चरण साझा किया था, एल्गोरिदम समझ जाता है: "हे, यह विशिष्ट चरण ('2 जोड़ें') इन तीनों लोगों के लिए अच्छे परिणाम की ओर ले जाता है।"
- इसके बाद, यह उन सभी के लिए उस विशिष्ट चरण के लिए एक "बोनस" देता जिन्होंने इसका उपयोग किया था।
- इसके विपरीत, यदि समूह विफल हो जाता है, और D और E दोनों ने "5 से गुणा करें" के साथ शुरुआत की थी, तो एल्गोरिदम समझ जाता है कि यह चरण जोखिम भरा है और इसे दंड (penalty) देता है।
परिणाम: भले ही शिक्षक ने केवल अंतिम उत्तर देखा हो, एल्गोरिदम प्रभावी रूप से यह पता लगा लेता है कि कौन से चरण अच्छे थे और कौन से बुरे, बस यह देखकर कि कौन से चरण सफल समूहों में एक साथ दिखाई दिए।
समस्या: "अनुचित भीड़" (The "Unfair Crowd")
लेखकों ने इस गुप्त तंत्र में एक खामी पाई। यह तब बहुत अच्छा काम करता है जब भीड़ संतुलित हो, लेकिन जब भीड़ असंतुलित होती है, तो यह टूट जाता है।
उदाहरण:
एक मतदान प्रणाली की कल्पना करें जहाँ आप गिनते हैं कि कितने लोगों ने एक विशिष्ट विचार के लिए वोट दिया।
- परिदृश्य: 90% छात्र "2 जोड़ें" से शुरुआत करते हैं, और केवल 10% "5 से गुणा करें" से।
- खामी: यदि "2 जोड़ें" समूह को औसत से थोड़ा कम स्कोर मिलता है, तो एल्गोरिदम "2 जोड़ें" चरण को "5 से गुणा करें" चरण की तुलना में 90 गुना अधिक तीव्रता से दंडित करेगा, केवल इसलिए क्योंकि वहाँ बहुत सारे लोग इसे कर रहे थे।
- परिणाम: रोबोट "2 जोड़ें" वाले रास्ते को पूरी तरह से छोड़ सकता है, भले ही वह वास्तव में एक अच्छा रास्ता हो, सिर्फ इसलिए क्योंकि "भीड़" बहुत बड़ी थी और उसे थोड़ा खराब स्कोर मिला। यह नए रास्तों को खोजने या अच्छे रास्तों पर टिके रहने से डरने लगता है यदि संख्याएँ झुकी हुई हों।
समाधान: -GRPO (द "फेयरनेस फ़िल्टर")
लेखकों ने -GRPO नामक एक सरल सुधार प्रस्तावित किया है।
उदाहरण:
हर एक वोट को समान रूप से गिनने के बजाय, वे एक "फेयरनेस फ़िल्टर" (निष्पक्षता फ़िल्टर) जोड़ते हैं।
- यदि कोई चरण बहुत लोकप्रिय है (कई छात्रों ने इसे किया), तो फ़िल्टर कहता है, "ठीक है, आइए स्कोर को लोगों की संख्या से विभाजित करें।"
- यदि कोई चरण दुर्लभ है, तो फ़िल्टर कहता है, "ठीक है, आइए इसे थोड़ा अधिक महत्व दें।"
यह सुनिश्चित करता है कि एक चरण का मूल्यांकन उसके अपने गुणों के आधार पर हो, न कि इस आधार पर कि उस विशिष्ट समूह में कितने लोग उसे कर रहे थे। यह एल्गोरिदम को भीड़ के आकार से डराए बिना काम करने में मदद करता है।
परिणाम: तेज़ और स्मार्ट
लेखकों ने वास्तविक गणितीय समस्याओं पर इस सुधार का परीक्षण किया:
- बेहतर प्रदर्शन: -GRPO का उपयोग करने वाले मॉडलों ने मानक मॉडलों की तुलना में गणितीय तर्क कार्यों पर बेहतर स्कोर प्राप्त किया।
- तेज़ सीखना: वे आधे समय में (कम प्रशिक्षण चरणों में) अपने शिखर प्रदर्शन तक पहुँच गए।
- कोई अतिरिक्त लागत नहीं: उन्हें हर चरण को ग्रेड करने के लिए महंगे इंसानों को काम पर रखने की आवश्यकता नहीं पड़ी। उन्होंने बस मौजूदा एल्गोरिदम के गणित में बदलाव किया।
सारांश
यह पेपर प्रकट करता है कि एक लोकप्रिय AI प्रशिक्षण विधि (GRPO) गुप्त रूप से एक चरण-दर-चरण ग्रेडर की तरह काम कर रही थी। हालाँकि, इसमें एक बग था जहाँ यह असंतुलित समूहों से भ्रमित हो जाती थी। लेखकों ने इस बग को एक सरल गणितीय सुधार (-GRPO) के साथ ठीक किया, जिससे AI बिना किसी अतिरिक्त महंगे टूल के तर्क संबंधी कार्यों को तेज़ी से और बेहतर तरीके से सीख सका।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।