STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning
STRIDE एक नवीन प्रशिक्षण ढांचा है जो केवल परिणाम-आधारित पुरस्कारों का उपयोग करके एक जनरेटर और एक जेनेरेटिव वेरीफायर को सह-प्रशिक्षित करके लार्ज लैंग्वेज मॉडल की तर्क क्षमता को बढ़ाता है, जिससे स्केलर स्कोर के स्थान पर सीखने योग्य, चरण-दर-चरण भाषाई फीडबैक प्राप्त होता है जो विफलताओं को स्पष्ट रूप से स्थानीयकृत करता है और तर्क प्रक्षेपवक्रों को पुनः निर्देशित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े भ्रमित छात्र को एक जटिल भूलभुलैया (maze) हल करना सिखा रहे हैं। अतीत में, इन AI "छात्रों" (Large Language Models) को प्रशिक्षित करने का तरीका ऐसा था जैसे आप उन्हें एक परीक्षा देते और केवल उनका अंतिम स्कोर बताते: "तुम गलत हो।"
यही वह समस्या है जिसे STRIDE हल करने की कोशिश करता है। यहाँ बताया गया है कि यह कैसे काम करता है, रोजमर्रा के उदाहरणों का उपयोग करते हुए।
समस्या: "मौन" स्कोरकार्ड (The "Silent" Scorecard)
वर्तमान में, अधिकांश AI प्रशिक्षण Reinforcement Learning नामक पद्धति का उपयोग करता है। इसे एक वीडियो गेम की तरह समझें जहाँ AI एक लेवल खेलता है, और अंत में उसे "Game Over" या "You Win" का संदेश मिलता है।
- समस्या: यदि AI 10-चरणों वाली गणित की समस्या के तीसरे चरण में गलती करता है, तो शिक्षक (कंप्यूटर) यह नहीं कहता, "अरे, तुमने चरण 3 में संख्याओं को गलत जोड़ा।" वह केवल कहता है, "गलत उत्तर।"
- परिणाम: AI को यह अनुमान लगाना पड़ता है कि वह कहाँ गलत हुआ। यह एक टूटे हुए इंजन को ठीक करने की कोशिश करने जैसा है जहाँ आपको केवल यह पता है कि कार शुरू नहीं हो रही है, लेकिन कोई मैकेनिक आपको यह नहीं बता रहा कि कौन सा हिस्सा ढीला है। इसे Information Bottleneck कहा जाता है—शिक्षक विशिष्ट त्रुटि को ठीक करने के लिए बहुत कम जानकारी दे रहा है।
कुछ पिछली विधियों ने चरण-दर-चरण स्कोर देने की कोशिश की (जैसे "चरण 1: अच्छा, चरण 2: बुरा"), लेकिन ये स्कोर केवल संख्याएँ (0 या 1) हैं। वे अभी भी यह स्पष्ट नहीं करते कि चरण क्यों बुरा था।
समाधान: STRIDE (एक "बातूनी" कोच)
लेखक STRIDE का प्रस्ताव करते हैं, जिसका अर्थ है Stepwise Trajectory Redirection with In-context Deep Evaluation।
एक मौन स्कोरकार्ड के बजाय, STRIDE एक Generative Verifier पेश करता है। इसे एक कोचिंग सहायक के रूप में समझें जो छात्र के बगल में बैठता है और वास्तविक समय में समस्या पर चर्चा करता है।
STRIDE तीन चरणों में कैसे काम करता है, एक ट्रेनिंग कैंप की तरह:
चरण 1: वार्म-अप (Base Policy)
AI छात्र अपने आप समस्याओं को हल करने का प्रयास करता है। उसे अंत में एक सरल "सही/गलत" स्कोर मिलता है। यह एक बुनियादी आधार बनाता है, ठीक वैसे ही जैसे खेल के नियम सीखना।
चरण 2: कोच को प्रशिक्षित करना (The Verifier)
अब, सिस्टम एक दूसरे AI (Verifier) को कोच के रूप में कार्य करने के लिए प्रशिक्षित करता है।
- जादू: कोच को किसी इंसान द्वारा हर चरण के लिए सही/गलत उत्तरों की सूची देकर नहीं सिखाया जाता (जो बहुत महंगा और धीमा है)। इसके बजाय, कोच छात्र को समस्या हल करते हुए देखता है और यह जाँचता है कि क्या अंतिम उत्तर सही था।
- कौशल: समय के साथ, कोच छात्र के काम को देखना सीख जाता है और कह सकता है, "रुको, चरण 3 में तुम 'एक' (one) ले जाना भूल गए," या "तुमने यहाँ एक तार्किक चरण छोड़ दिया।" वह एक साधारण "गलत" स्कोर को एक विस्तृत, लिखित आलोचना में बदलने में सक्षम हो जाता है।
चरण 3: मार्गदर्शन के साथ "दोबारा प्रयास" (Trajectory Redirection)
यही मुख्य नवाचार है। जब छात्र किसी समस्या में विफल होता है:
- पहली गलती खोजें: कोच (Verifier) छात्र के काम को स्कैन करता है और First Point of Failure (FPF) को ढूंढ निकालता है। यह सटीक रूप से उस बिंदु को चिन्हित करता है जहाँ तर्क टूट गया।
- "रीडायरेक्शन" (मार्गदर्शन): छात्र को पूरी समस्या फिर से शुरू करने के बजाय (जो कि बर्बादी है), सिस्टम कहता है: "ठीक है, तुम चरण 2 तक बहुत अच्छा कर रहे थे। चलो वहीं रुकते हैं। यहाँ मेरा लिखित नोट है जो समझाता है कि चरण 3 क्यों विफल हुआ। अब, मेरी सलाह का उपयोग करते हुए, चरण 2 से शुरू करके बाकी समस्या को फिर से हल करने का प्रयास करें।"
- Multi-Point रणनीति: कभी-कभी, चरण 3 में हुई गलती वास्तव में चरण 1 में किए गए एक "बुरे चुनाव" के कारण होती है जो उस समय ठीक लग रहा था। STRIDE इतना स्मार्ट है कि वह कह सकता है: "चलो चरण 1 और चरण 2 से फिर से शुरू करते हैं," जिससे छात्र को बेहतर रास्ता खोजने के लिए कई मौके मिलते हैं।
यह एक बड़ी बात क्यों है?
लेखक का दावा है कि यह दृष्टिकोण दो प्रमुख समस्याओं को हल करता है:
- "मौन" को तोड़ना: भाषा संबंधी फीडबैक (शब्दों) का उपयोग करके, STRIDE को केवल स्केलर रिवॉर्ड्स (संख्याओं) के बजाय बहुत समृद्ध स्पष्टीकरण मिलता है। यह एक शिक्षक के "F" ग्रेड कहने और एक शिक्षक के "आपने नेगेटिव साइन को डिस्ट्रीब्यूट करना भूल गए" कहने के बीच का अंतर है।
- "असंभव" को हल करना: लेखकों ने पाया कि बहुत कठिन समस्याओं के लिए जहाँ AI आमतौर पर 0% सही होता है, मानक विधियाँ हार मान लेती हैं क्योंकि उन्हें कोई उपयोगी संकेत नहीं मिलता। हालाँकि, STRIDE अभी भी सीख सकता है। भले ही AI विफल हो जाए, कोच त्रुटि की ओर इशारा कर सकता है, और AI उस विशिष्ट बिंदु से एक अलग रास्ता अपनाकर सफलता प्राप्त कर सकता है।
एनालॉजी सारांश
- पुराना तरीका: आप एक परीक्षा देते हैं। आपको "0/100" मिलता है। आपको पता ही नहीं कि क्या पढ़ना है।
- पिछला "स्टेप" तरीका: आपको एक परीक्षा मिलती है जिसमें "चरण 1: 10/10, चरण 2: 0/10" लिखा है। आप जानते हैं कि आप कहाँ विफल हुए, लेकिन क्यों नहीं।
- STRIDE: आप एक परीक्षा देते हैं। आपको "0/100" मिलता है, लेकिन आपका शिक्षक आपको एक लिखित नोट भी देता है जिसमें लिखा है: "आप चरण 2 पर अटक गए क्योंकि आपने गलत फॉर्मूला का उपयोग किया। चलिए चरण 1 पर वापस चलते हैं, इस नोट को देखते हैं, और एक अलग दृष्टिकोण आज़माते हैं।"
परिणाम
इस शोध पत्र ने कठिन गणित और तर्क पहेलियों पर इसका परीक्षण किया।
- STRIDE ने सभी अन्य वर्तमान विधियों (पिछले अत्याधुनिक तरीकों सहित) को पछाड़ दिया।
- इसने गणित की समस्याओं, कोडिंग चुनौतियों और तर्क पहेलियों पर काम किया।
- सबसे महत्वपूर्ण बात यह है कि इसने उन समस्याओं को हल करने में सफलता पाई जिन्हें पहले इन मॉडल्स के लिए "असंभव" माना जाता था, जिससे 0% सफलता दर को सीखने के अवसर में बदल दिया गया।
संक्षेप में, STRIDE AI को अपनी गलतियों से बात करके सीखने के लिए प्रशिक्षित करता है, न कि केवल अंधे होकर अनुमान लगाने के लिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।