← नवीनतम पेपर
🤖 AI

STRIDE: Strategic Trajectory Reasoning via Discriminative Estimation for Verifiable Reinforcement Learning

यह शोध पत्र STRIDE को प्रस्तुत करता है, जो एक सूक्ष्म-स्तरीय (fine-grained) सत्यापन योग्य पुरस्कारों (Verifiable Rewards) के साथ सुदृढीकरण शिक्षण (Reinforcement Learning) ढांचा है, जो रणनीतिक nn-gram पैटर्न से सत्यापन योग्य, परिणाम-भेदभावपूर्ण पर्यवेक्षण (outcome-discriminative supervision) प्राप्त करके बड़े भाषा मॉडलों में तर्क क्षमता को बढ़ाता है ताकि मौजूदा विधियों की तुलना में अधिक सटीक क्रेडिट असाइनमेंट (credit assignment) सक्षम किया जा सके।

मूल लेखक: Qinjian Zhao, Zhihao Dou, Dinggen Zhang, Xiangyu Li, Chaoda Song, Zhongwei Wan, Xinpeng Li, Yanyan Zhang, Kaijie Chen, Qingtao Pan, Chengcheng Feng, Zhiqiang Gao, Xiaoyu Xia

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qinjian Zhao, Zhihao Dou, Dinggen Zhang, Xiangyu Li, Chaoda Song, Zhongwei Wan, Xinpeng Li, Yanyan Zhang, Kaijie Chen, Qingtao Pan, Chengcheng Feng, Zhiqiang Gao, Xiaoyu Xia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल गणितीय पहेली हल करना सिखा रहे हैं। इन रोबोटों को प्रशिक्षित करने के पुराने तरीके में (जिसे लार्ज लैंग्वेज मॉडल्स कहा जाता है), आप उन्हें समस्या हल करने देते थे, और यदि वे अंतिम उत्तर सही देते थे, तो आप पूरे प्रयास के लिए उन्हें एक 'गोल्ड स्टार' देते थे। यदि वे गलत होते, तो आप उन्हें बिना यह बताए कि उन्होंने कहाँ गलती की, बस "फिर से प्रयास करें" कह देते थे।

इस "सब कुछ या कुछ भी नहीं" वाले दृष्टिकोण की समस्या यह है कि रोबोट यह नहीं सीख पाता कि कौन से विशिष्ट चरण शानदार थे और कौन से बेवकूफी भरे अनुमान थे। यह हर शब्द को समान रूप से महत्वपूर्ण मानता है, भले ही कुछ शब्द केवल भरने के लिए हों।

STRIDE एक नया, अधिक स्मार्ट तरीका है। इसे एक डिटेक्टिव कोच (जासूसी कोच) की तरह समझें जो केवल अंतिम स्कोर को नहीं देखता, बल्कि पूरी "गेम टेप" की समीक्षा करता है ताकि यह देख सके कि किन सटीक चालों ने जीत और हार की ओर ले जाने का रास्ता बनाया।

यहाँ बताया गया है कि STRIDE कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. "विजेता बनाम हारने वाले" का मुकाबला

केवल एक उत्तर को ग्रेड देने के बजाय, STRIDE रोबोट को एक ही प्रश्न के उत्तरों का एक पूरा समूह तैयार करने के लिए कहता है।

  • कुछ उत्तर सही होंगे (विजेता)।
  • कुछ उत्तर गलत होंगे (हारने वाले)।

STRIDE फिर इन दोनों समूहों को अगल-बगल रखता है। यह विशिष्ट वाक्यांशों या शब्दों के पैटर्न (जैसे "आइए इसे प्रतिस्थापित करते हैं" या "रुको, यह तर्कसंगत नहीं लगता") की तलाश करता है जो विजेताओं में हारने वालों की तुलना में बहुत अधिक बार दिखाई देते हैं।

2. "कन्फ्यूजन मीटर" (एंट्रॉपी - Entropy)

सिर्फ इसलिए कि कोई वाक्यांश एक विजेता उत्तर में दिखाई देता है, इसका मतलब यह नहीं है कि वह एक अच्छा कदम था। कभी-कभी, रोबोट गलती से फैंसी शब्दों का उपयोग करते हैं। इसे छानने के लिए, STRIDE एक "कन्फ्यूजन मीटर" का उपयोग करता है।

AI की दुनिया में, उच्च "एंट्रॉपी" का अर्थ है कि रोबोट अनिश्चित था या गहराई से सोच रहा था।

  • कम एंट्रॉपी: रोबोट बस सामान्य शब्द टाइप कर रहा है (जैसे "और फिर...")।
  • उच्च एंट्रॉपी: रोबोट एक कठिन निर्णय लेने या अपने काम की जाँच करने के लिए रुक रहा है।

STRIDE केवल उन "विजेता वाक्यांशों" की परवाह करता है जिनमें उच्च कन्फ्यूजन मीटर भी था। यह सुनिश्चित करता है कि वह रोबोट को शानदार शब्दावली का उपयोग करने के लिए नहीं, बल्कि स्मार्ट और महत्वपूर्ण निर्णय लेने के लिए पुरस्कृत कर रहा है।

3. "बोनस पॉइंट्स" प्रणाली

एक बार जब STRIDE एक ऐसे वाक्यांश की पहचान कर लेता है जो दोनों है:

  1. विजेता उत्तरों में सामान्य है (डिस्क्रिमिनेटिव), और
  2. गहरी सोच का क्षण है (उच्च एंट्रॉपी),

तो यह उस विशिष्ट वाक्यांश को एक बोनस रिवॉर्ड देता है। इसके विपरीत, यदि कोई वाक्यांश हारने वाले उत्तरों में अक्सर दिखाई देता है और उसमें गहरी सोच शामिल थी, तो उसे पेनल्टी (दंड) मिलती है।

यह एक कोच की तरह है जो कहता है: "बहुत बढ़िया, उस विशिष्ट चरण पर जहाँ आपने अपना गणित दोबारा जांचा! इसीलिए आप जीते। लेकिन उस चरण पर जहाँ आपने नंबर का अनुमान लगाया? इसीलिए आप हारे। आइए पहले वाले को और अधिक करें और दूसरे को कम करें।"

यह क्यों महत्वपूर्ण है

पेपर का दावा है कि इस पद्धति का उपयोग करने से रोबोट पहले की तुलना में बहुत तेज़ी से और बेहतर तरीके से सीखता है।

  • यह विभिन्न दिमागों पर काम करता है: उन्होंने इसे कई अलग-अलग प्रकार के रोबोट मॉडल (जैसे Qwen और Llama) पर परखा और इसने उन सभी की मदद की।
  • यह विभिन्न पहेलियों पर काम करता है: इसने कठिन गणित प्रतियोगिताओं (जैसे AIME और AMC) में प्रदर्शन में सुधार किया और यहाँ तक कि छवियों और एजेंटों (जो दुनिया के साथ बातचीत करते हैं) से जुड़े कार्यों में भी।
  • यह निष्पक्ष है: अन्य तरीकों के विपरीत जो अस्पष्ट भावनाओं के आधार पर यह अनुमान लगाने की कोशिश करते हैं कि कोई चरण "अच्छा" है या नहीं, STRIDE केवल उन चरणों को पुरस्कृत करता है जिन्हें सही उत्तर की ओर ले जाने के लिए सिद्ध किया जा सकता है।

निचोड़

STRIDE एक ऐसा प्रशिक्षण तंत्र है जो रोबोट द्वारा लिखे गए प्रत्येक शब्द को एक समान मानने से रुकता है। इसके बजाय, यह एक पैनी नज़र वाले कोच की तरह कार्य करता है, उन विशिष्ट "रणनीतिक चालों" की पहचान करता है जो वास्तव में सफलता की ओर ले जाती हैं और उन चालों को अतिरिक्त क्रेडिट देता है, जबकि उन चालों को दंडित करता है जो विफलता की ओर ले जाती हैं। यह रोबोट को केवल एक बेहतर अनुमान लगाने वाले के बजाय एक बहुत बेहतर विचारक बनने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →