STRIDE: Strategic Trajectory Reasoning via Discriminative Estimation for Verifiable Reinforcement Learning
यह शोध पत्र STRIDE को प्रस्तुत करता है, जो एक सूक्ष्म-स्तरीय (fine-grained) सत्यापन योग्य पुरस्कारों (Verifiable Rewards) के साथ सुदृढीकरण शिक्षण (Reinforcement Learning) ढांचा है, जो रणनीतिक -gram पैटर्न से सत्यापन योग्य, परिणाम-भेदभावपूर्ण पर्यवेक्षण (outcome-discriminative supervision) प्राप्त करके बड़े भाषा मॉडलों में तर्क क्षमता को बढ़ाता है ताकि मौजूदा विधियों की तुलना में अधिक सटीक क्रेडिट असाइनमेंट (credit assignment) सक्षम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल गणितीय पहेली हल करना सिखा रहे हैं। इन रोबोटों को प्रशिक्षित करने के पुराने तरीके में (जिसे लार्ज लैंग्वेज मॉडल्स कहा जाता है), आप उन्हें समस्या हल करने देते थे, और यदि वे अंतिम उत्तर सही देते थे, तो आप पूरे प्रयास के लिए उन्हें एक 'गोल्ड स्टार' देते थे। यदि वे गलत होते, तो आप उन्हें बिना यह बताए कि उन्होंने कहाँ गलती की, बस "फिर से प्रयास करें" कह देते थे।
इस "सब कुछ या कुछ भी नहीं" वाले दृष्टिकोण की समस्या यह है कि रोबोट यह नहीं सीख पाता कि कौन से विशिष्ट चरण शानदार थे और कौन से बेवकूफी भरे अनुमान थे। यह हर शब्द को समान रूप से महत्वपूर्ण मानता है, भले ही कुछ शब्द केवल भरने के लिए हों।
STRIDE एक नया, अधिक स्मार्ट तरीका है। इसे एक डिटेक्टिव कोच (जासूसी कोच) की तरह समझें जो केवल अंतिम स्कोर को नहीं देखता, बल्कि पूरी "गेम टेप" की समीक्षा करता है ताकि यह देख सके कि किन सटीक चालों ने जीत और हार की ओर ले जाने का रास्ता बनाया।
यहाँ बताया गया है कि STRIDE कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:
1. "विजेता बनाम हारने वाले" का मुकाबला
केवल एक उत्तर को ग्रेड देने के बजाय, STRIDE रोबोट को एक ही प्रश्न के उत्तरों का एक पूरा समूह तैयार करने के लिए कहता है।
- कुछ उत्तर सही होंगे (विजेता)।
- कुछ उत्तर गलत होंगे (हारने वाले)।
STRIDE फिर इन दोनों समूहों को अगल-बगल रखता है। यह विशिष्ट वाक्यांशों या शब्दों के पैटर्न (जैसे "आइए इसे प्रतिस्थापित करते हैं" या "रुको, यह तर्कसंगत नहीं लगता") की तलाश करता है जो विजेताओं में हारने वालों की तुलना में बहुत अधिक बार दिखाई देते हैं।
2. "कन्फ्यूजन मीटर" (एंट्रॉपी - Entropy)
सिर्फ इसलिए कि कोई वाक्यांश एक विजेता उत्तर में दिखाई देता है, इसका मतलब यह नहीं है कि वह एक अच्छा कदम था। कभी-कभी, रोबोट गलती से फैंसी शब्दों का उपयोग करते हैं। इसे छानने के लिए, STRIDE एक "कन्फ्यूजन मीटर" का उपयोग करता है।
AI की दुनिया में, उच्च "एंट्रॉपी" का अर्थ है कि रोबोट अनिश्चित था या गहराई से सोच रहा था।
- कम एंट्रॉपी: रोबोट बस सामान्य शब्द टाइप कर रहा है (जैसे "और फिर...")।
- उच्च एंट्रॉपी: रोबोट एक कठिन निर्णय लेने या अपने काम की जाँच करने के लिए रुक रहा है।
STRIDE केवल उन "विजेता वाक्यांशों" की परवाह करता है जिनमें उच्च कन्फ्यूजन मीटर भी था। यह सुनिश्चित करता है कि वह रोबोट को शानदार शब्दावली का उपयोग करने के लिए नहीं, बल्कि स्मार्ट और महत्वपूर्ण निर्णय लेने के लिए पुरस्कृत कर रहा है।
3. "बोनस पॉइंट्स" प्रणाली
एक बार जब STRIDE एक ऐसे वाक्यांश की पहचान कर लेता है जो दोनों है:
- विजेता उत्तरों में सामान्य है (डिस्क्रिमिनेटिव), और
- गहरी सोच का क्षण है (उच्च एंट्रॉपी),
तो यह उस विशिष्ट वाक्यांश को एक बोनस रिवॉर्ड देता है। इसके विपरीत, यदि कोई वाक्यांश हारने वाले उत्तरों में अक्सर दिखाई देता है और उसमें गहरी सोच शामिल थी, तो उसे पेनल्टी (दंड) मिलती है।
यह एक कोच की तरह है जो कहता है: "बहुत बढ़िया, उस विशिष्ट चरण पर जहाँ आपने अपना गणित दोबारा जांचा! इसीलिए आप जीते। लेकिन उस चरण पर जहाँ आपने नंबर का अनुमान लगाया? इसीलिए आप हारे। आइए पहले वाले को और अधिक करें और दूसरे को कम करें।"
यह क्यों महत्वपूर्ण है
पेपर का दावा है कि इस पद्धति का उपयोग करने से रोबोट पहले की तुलना में बहुत तेज़ी से और बेहतर तरीके से सीखता है।
- यह विभिन्न दिमागों पर काम करता है: उन्होंने इसे कई अलग-अलग प्रकार के रोबोट मॉडल (जैसे Qwen और Llama) पर परखा और इसने उन सभी की मदद की।
- यह विभिन्न पहेलियों पर काम करता है: इसने कठिन गणित प्रतियोगिताओं (जैसे AIME और AMC) में प्रदर्शन में सुधार किया और यहाँ तक कि छवियों और एजेंटों (जो दुनिया के साथ बातचीत करते हैं) से जुड़े कार्यों में भी।
- यह निष्पक्ष है: अन्य तरीकों के विपरीत जो अस्पष्ट भावनाओं के आधार पर यह अनुमान लगाने की कोशिश करते हैं कि कोई चरण "अच्छा" है या नहीं, STRIDE केवल उन चरणों को पुरस्कृत करता है जिन्हें सही उत्तर की ओर ले जाने के लिए सिद्ध किया जा सकता है।
निचोड़
STRIDE एक ऐसा प्रशिक्षण तंत्र है जो रोबोट द्वारा लिखे गए प्रत्येक शब्द को एक समान मानने से रुकता है। इसके बजाय, यह एक पैनी नज़र वाले कोच की तरह कार्य करता है, उन विशिष्ट "रणनीतिक चालों" की पहचान करता है जो वास्तव में सफलता की ओर ले जाती हैं और उन चालों को अतिरिक्त क्रेडिट देता है, जबकि उन चालों को दंडित करता है जो विफलता की ओर ले जाती हैं। यह रोबोट को केवल एक बेहतर अनुमान लगाने वाले के बजाय एक बहुत बेहतर विचारक बनने में मदद करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।