GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
यह शोध पत्र GTPO और GRPO-S को प्रस्तुत करता है, जो दो नवीन सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम हैं जो सूक्ष्म-स्तरीय (fine-grained), टोकन-स्तरीय और अनुक्रम-स्तरीय क्रेडिट असाइनमेंट प्राप्त करने के लिए गतिशील एंट्रॉपी-आधारित रिवॉर्ड शेपिंग को लागू करके लार्ज लैंग्वेज मॉडल रीजनिंग को उन्नत करते हैं, जिससे GRPO और DAPO जैसी मौजूदा विधियों की स्थूल-स्तरीय (coarse-grained) सीमाओं को दूर किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ इस शोध पत्र "GTPO और GRPO-S: पॉलिसी एंट्रॉपी के साथ टोकन और सीक्वेंस-लेवल रिवॉर्ड शेपिंग" का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया।
बड़ी समस्या: "सब कुछ या कुछ भी नहीं" वाला ग्रेड
कल्पना कीजिए कि आप एक छात्र (AI) को एक बहुत लंबी, जटिल गणित की समस्या हल करना सिखा रहे हैं। छात्र एक 50-चरणों (steps) वाला समाधान लिखता है।
- चरण 1 से 49 तक शानदार, तार्किक और सही हैं।
- चरण 50 (अंतिम उत्तर) एक छोटी सी गणना की गलती के कारण गलत है।
वर्तमान मुख्यधारा की विधियों (जैसे GRPO) में, शिक्षक अंतिम परिणाम को देखता है, देखता है कि वह गलत है, और पूरे 50-चरणों के निबंध को फेल कर देता है (0 अंक)।
- परिणाम: छात्र सोचता है, "ओह, मुझे लगता है कि चरण 1 से 49 भी बेकार थे।" वे अच्छे हिस्सों को भूल जाते हैं और अगली बार पूरी तरह से एक अलग, यादृच्छिक (random) दृष्टिकोण अपनाने की कोशिश कर सकते हैं।
- दोष: इसे कोर्स-ग्रेन्ड क्रेडिट असाइनमेंट (coarse-grained credit assignment) कहा जाता है। यह पूरे विचार क्रम (chain of thought) को एक एकल ब्लॉक के रूप में मानता है, यह अनदेखा करते हुए कि अधिकांश हिस्सा वास्तव में सटीक था।
समाधान: "एंट्रॉपी" दिशा-सूचक (Compass)
इस शोध पत्र के लेखक छात्र को ग्रेड देने का एक नया तरीका प्रस्तावित करते हैं। वे पॉलिसी एंट्रॉपी (Policy Entropy) नामक एक अवधारणा पेश करते हैं।
एंट्रॉपी को "कड़ी मेहनत से सोचने" या "अनिश्चितता" के माप के रूप में समझें।
- कम एंट्रॉपी (Low Entropy): छात्र बहुत आश्वस्त है। वह बस वही टाइप कर रहा है जो वह पहले से जानता है (जैसे, "1 + 1 = 2")।
- उच्च एंट्रॉपी (High Entropy): छात्र रुक रहा है, कई विकल्पों पर विचार कर रहा है, और एक कठिन विकल्प के साथ संघर्ष कर रहा है। वह विभिन्न रास्तों की खोज कर रहा है।
शोध पत्र का तर्क है कि जब आप सही होते हैं तो उच्च एंट्रॉपी अच्छी होती है (इसका अर्थ है कि आपने सही रास्ते की सावधानीपूर्वक खोज की), लेकिन जब आप गलत होते हैं तो उच्च एंट्रॉपी बुरी होती है (इसका अर्थ है कि आप गलत दिशा में आत्मविश्वास के साथ अनुमान लगा रहे थे)।
दो नई एल्गोरिदम
यह शोध पत्र दो नए "शिक्षक" (एल्गोरिदम) पेश करता है जो बेहतर फीडबैक देने के लिए इस एंट्रॉपी दिशा-सूचक का उपयोग करते हैं।
1. GTPO (ग्रुप टोकन पॉलिसी ऑप्टिमाइज़ेशन)
उपमा: "हाइलाइटर" वाला शिक्षक
पूरे निबंध को एक साथ ग्रेड देने के बजाय, GTPO हर एक शब्द (टोकन) को व्यक्तिगत रूप से ग्रेड देता है।
- यदि निबंध सही है: शिक्षक उन शब्दों को हाइलाइट करता है जहाँ छात्र हिचकिचाया या विभिन्न विकल्पों की खोज की (उच्च एंट्रॉपी) और उन्हें अतिरिक्त बोनस अंक देता है। यह छात्र को बताता है: "उस विशिष्ट चरण के बारे में कड़ी मेहनत करने के लिए बहुत अच्छा काम किया!"
- यदि निबंध गलत है: शिक्षक उन शब्दों को देखता है जहाँ छात्र बहुत अधिक आत्मविश्वासी लेकिन गलत था (कम एंट्रॉपी)। वे इन शब्दों को भारी दंड (penalty) देते हैं। यह छात्र को बताता है: "आप यहाँ बहुत आश्वस्त थे, और आप गलत थे। अगली बार इतने आत्मविश्वासी न रहें।"
यह क्यों मदद करता है: यह तर्क के अच्छे हिस्सों को सुरक्षित रखता है और उस विशिष्ट अति-आत्मविश्वास को दंडित करता है जिसके कारण विफलता हुई।
2. GRPO-S (सीक्वेंस-लेवल GRPO)
उपमा: "रिपोर्ट कार्ड" वाला शिक्षक
कभी-कभी, हर एक शब्द को ग्रेड देना बहुत धीमा या गणनात्मक रूप से भारी हो सकता है। GRPO-S एक हल्का संस्करण है।
- व्यक्तिगत शब्दों को देखने के बजाय, यह पूरे निबंध के औसत "सोचने के प्रयास" को देखता है।
- यदि निबंध सही है: यह जाँचता है, "क्या छात्र ने आम तौर पर कड़ी मेहनत की और खोज की?" यदि हाँ, तो पूरे निबंध को बढ़ावा मिलता है।
- यदि निबंध गलत है: यह जाँचता है, "क्या छात्र आत्मविश्वास के साथ गलत था?" यदि हाँ, तो पूरे निबंध को बड़ा दंड मिलता है।
यह क्यों मदद करता है: यह तेज़ है लेकिन पुराने "सब कुछ या कुछ भी नहीं" वाले तरीके से अधिक स्मार्ट है। यह बहुत लंबे तर्क कार्यों के दौरान छात्र को स्थिर रखने के लिए विशेष रूप से अच्छा है।
परिणाम: क्या हुआ?
लेखकों ने कठिन गणित बेंचमार्क (जैसे AIME और MATH) पर इन नए शिक्षकों का परीक्षण किया।
- पुराना तरीका (GRPO/DAPO): छात्र अक्सर फंस जाता था। वे या तो बहुत जल्दी हार मान लेते थे या आत्मविश्वासपूर्ण लेकिन गलत उत्तरों के लूप में "फंस" जाते थे (पॉलिसी कोलैप्स)।
- नया तरीका (GTPO/GRPO-S):
- एक्सप्लोरेशन (Exploration): छात्र लंबे समय तक विभिन्न रास्तों को आज़माते रहे क्योंकि उन्हें "कड़ी मेहनत करने" (उच्च एंट्रॉपी) के लिए पुरस्कृत किया गया था जब वे सही थे।
- सटीकता (Precision): उन्होंने आत्मविश्वास के साथ गलत होने से बचना सीख लिया।
- प्रदर्शन (Performance): उन्होंने कठिन गणित समस्याओं पर काफी बेहतर स्कोर किया, और पहले की तुलना में अधिक जटिल तर्क श्रृंखलाओं को हल किया।
एक वाक्य में सारांश
यह शोध पत्र AI मॉडल्स को एक लंबे विचार क्रम को केवल "पास या फेल" ग्रेड के रूप में देखना बंद करने की शिक्षा देता है, और इसके बजाय उन्हें एक विस्तृत रिपोर्ट कार्ड देता है जो उन्हें सही होने पर कड़ी मेहनत करने और गलत होने पर विनम्र रहने के लिए पुरस्कृत करता है, जिससे बहुत अधिक स्मार्ट तर्क क्षमता विकसित होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।