Selective Off-Policy Reference Tuning with Plan Guidance
यह शोध पत्र सेलेक्टिव ऑफ-पॉलिसी रेफरेंस ट्यूनिंग (SORT) प्रस्तुत करता है, जो एक ऐसी विधि है जो संदर्भ समाधानों (reference solutions) से मरम्मत अपडेट (repair updates) प्राप्त करने के लिए योजना मार्गदर्शन (plan guidance) का लाभ उठाती है, जिससे विफल रोलआउट्स को संरचना-जागरूक शिक्षण संकेतों (structure-aware learning signals) में परिवर्तित किया जा सके, जो मानक GRPO दृष्टिकोणों की तुलना में, विशेष रूप से कमजोर मॉडलों पर, तर्क प्रदर्शन (reasoning performance) में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "सेलेक्टिव ऑफ-पॉलिसी रेफरेंस ट्यूनिंग विद प्लान गाइडेंस (SORT)" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।
बड़ी समस्या: "साइलेंट" विफलता (The "Silent" Failure)
कल्पना कीजिए कि आप एक छात्र (एक AI) को कठिन गणित के सवाल हल करना सिखा रहे हैं। आप उसे एक सवाल देते हैं, और वह उसे हल करने की कोशिश करता है।
- अच्छा परिदृश्य: कभी-कभी, छात्र इसे सही हल कर लेता है। आप कहते हैं, "बहुत बढ़िया!" और वह उस सफलता से सीखता है।
- बुरा परिदृश्य: कभी-कभी, सवाल इतना कठिन होता है कि छात्र उसे हल करने के लिए 8 अलग-अलग तरीके आजमाता है, और सभी 8 प्रयास गलत होते हैं।
मानक AI प्रशिक्षण विधियों (जिन्हें GRPO कहा जाता है) में, जब एक छात्र कठिन समस्या पर हर बार विफल हो जाता है, तो शिक्षक भ्रमित हो जाता है। सिस्टम कहता है, "चूंकि उन्होंने कुछ भी सही नहीं किया, इसलिए यह बताने का कोई तरीका नहीं है कि उनकी सोच का कौन सा हिस्सा अच्छा था और कौन सा बुरा। इसलिए, हम इस समस्या को अनदेखा कर देंगे और आगे बढ़ जाएंगे।"
यह शोध तर्क देता है कि यह एक बहुत बड़ी बर्बादी है। भले ही उत्तर गलत हो, छात्र के पास अक्सर एक "सत्यापित संदर्भ समाधान" (सही उत्तर कुंजी) होता है। समस्या यह है कि केवल उत्तर कुंजी की नकल करना बुरा है क्योंकि यह छात्र को पूरे समाधान को रटने के लिए मजबूर करता है, जिसमें "संख्या 5 लिखें" या "कोमा लगाएँ" जैसे उबाऊ हिस्से भी शामिल हैं, बजाय इसके कि वह उन कठिन तर्क चरणों (logic steps) को सीखे जिनके कारण विफलता हुई।
समाधान: SORT (द "प्लान" डिटेक्टिव)
लेखकों ने SORT (सेलेक्टिव ऑफ-पॉलिसी रेफरेंस ट्यूनिंग विद प्लान गाइडेंस) नामक एक नई विधि प्रस्तावित की है। इसे एक स्मार्ट ट्यूटरिंग सिस्टम के रूप में सोचें जो छात्र के समस्या हल करने के तरीके को बदले बिना "साइलेंट फेलियर" की समस्या को ठीक करता है।
SORT इस प्रकार काम करता है, चरण-दर-चरण:
1. "बफर" (विफलताओं को सहेजना)
जब AI एक कठिन समस्या को आजमाता है और हर बार गलत होता है, तो उस समस्या को फेंकने के बजाय, SORT उसे एक विशेष "वेटिंग रूम" (बफर) में रख देता है। यह तब तक इंतजार करता है जब तक कि इसके पास इन कठिन विफलताओं में से कुछ जमा न हो जाएं, फिर यह उन्हें अलग से प्रोसेस करता है।
2. "प्लान" (ब्लूप्रिंट)
प्रत्येक विफल समस्या के लिए, SORT सही उत्तर कुंजी को देखता है। लेकिन यह केवल उत्तर को पढ़ता नहीं है; यह AI से उस उत्तर से एक "प्लान" या "ब्लूप्रिंट" निकालने के लिए कहता है।
- उपमा: कल्पना कीजिए कि उत्तर कुंजी केक बनाने की एक लंबी, अस्त-व्यस्त रेसिपी है। "प्लान" केवल महत्वपूर्ण चरणों की सूची है: "ओवन प्रीहीट करें," "मैदा मिलाएं," "अंडे फोल्ड करें।" यह "काउंटर पोंछें" या "धीरे से चलाएं" जैसे उबाऊ हिस्सों को अनदेखा कर देता है।
3. "डबल चेक" (जादुई परीक्षण)
यही मुख्य नवाचार है। SORT AI को लेता है और उसे सही उत्तर कुंजी को दो बार देखने के लिए कहता है:
- टेस्ट A: "यहाँ समस्या है। अब, उत्तर कुंजी के इस चरण को देखें। इसकी संभावना कितनी है कि आप इस चरण का अनुमान लगा लेंगे?" (AI के पास कोई मदद नहीं है)।
- टेस्ट B: "यहाँ समस्या है और यहाँ 'प्लान' (ब्लूप्रिंट) है। अब, उत्तर कुंजी के उसी चरण को देखें। इसकी संभावना कितनी है कि आप इस चरण का अनुमान लगा लेंगे?"
4. "लाइटबल्ब मोमेंट" (चयनात्मकता)
SORT दोनों परिणामों की तुलना करता है:
- यदि AI पहले से ही चरण का अनुमान लगाने में अच्छा था: तो "प्लान" से बहुत अधिक बदलाव नहीं आता। ये आमतौर पर उबाऊ, नियमित चरण होते (जैसे नंबर लिखना)। SORT कहता है, "हमें AI को यह सिखाने की आवश्यकता नहीं है; वह इसे पहले से ही जानता है।"
- यदि AI चरण का अनुमान लगाने में बुरा था, लेकिन "प्लान" ने इसे आसान बना दिया: तो यह "लाइटबल्ब मोमेंट" है। AI को एहसास होता है, "ओह! अगर मुझे पता होता कि प्लान 'पैरिटी चेक करना' था, तो मैं इस चरण का अनुमान लगा सकता था!"
- ये महत्वपूर्ण तर्क चरण (critical reasoning steps) हैं (लॉजिक गैप्स)।
- SORT इन विशिष्ट चरणों को बड़ा बढ़ावा (boost) देता है। यह AI को बताता है, "अपनी सारी ऊर्जा यहाँ लगाओ! यहीं तुम असफल हुए थे, और इसे ठीक करने की कुंजी यही है।"
यह अन्य तरीकों से बेहतर क्यों है?
- मानक कॉपी करना (SFT): एक छात्र को पूरी किताब पन्ने-दर-पन्ना कॉपी करने के लिए मजबूर करने जैसा है। वे लिखावट और फॉर्मेटिंग सीखते हैं, लेकिन शायद तर्क (logic) नहीं।
- अन्य "हिंट" विधियाँ: कुछ विधियाँ AI को समस्या हल करते समय संकेत (hints) देती हैं। यह परीक्षण के दौरान AI के सोचने के तरीके को बदल देता है।
- SORT: SORT AI की "सोचने की प्रक्रिया" (rollout) को पूरी तरह से अकेला छोड़ देता है। यह केवल "स्कूल के बाद की ट्यूशनिंग" (अपडेट) को ठीक करता है। यह यह जानने के लिए "प्लान" का उपयोग करता है कि सही उत्तर के कौन से विशिष्ट शब्द सबसे महत्वपूर्ण हैं जिन्हें सीखना आवश्यक है।
परिणाम
पेपर ने तीन अलग-अलग AI मॉडल (छोटे से बड़े) और आठ अलग-अलग गणित और तर्क संबंधी बेंचमार्क पर इसका परीक्षण किया।
- विजेता: SORT ने लगातार मानक विधियों को हराया।
- बड़ी जीत: इसने सबसे कमजोर मॉडल्स की सबसे अधिक मदद की। यह समझ में आता है क्योंकि कमजोर मॉडल अधिक बार विफल होते हैं, जिसका अर्थ है कि उनके पास ठीक करने के लिए अधिक "साइलेंट फेलियर्स" होते हैं।
- दक्षता (Efficiency): इसने AI को लंबे, भ्रामक उत्तर लिखने के लिए मजबूर नहीं किया (जो अन्य विधियों का एक सामान्य दुष्प्रभाव है)। इसने बस उत्तरों को स्मार्ट बनाया।
सारांश उपमा
कल्पना कीजिए कि एक कोच एक बास्केटबॉल खिलाड़ी को लगातार 8 शॉट मिस करते हुए देख रहा है।
- पुराना तरीका: कोच कहता है, "तुमने सब कुछ मिस कर दिया। हम इस ड्रिल को अनदेखा करेंगे।"
- बुरा तरीका: कोच कहता है, "प्रो खिलाड़ी द्वारा शॉट मारने के परफेक्ट वीडियो को देखो। उसके हर मूव की नकल करो, यहाँ तक कि अपने जूते के फीते बांधने के तरीके की भी।"
- SORT तरीका: कोच कहता है, "आइए प्रो खिलाड़ी के वीडियो को देखें। मैं उस सटीक क्षण को हाईलाइट करूँगा जब उन्होंने अपने घुटने मोड़े थे और सटीक कोण जब उन्होंने गेंद छोड़ी थी। ये दो चीजें हैं जो आपने मिस की हैं। बाकी वीडियो को भूल जाओ; आइए बस उन दो विशिष्ट मूव्स का अभ्यास करें।"
केवल उन "स्ट्रक्चरल" मूव्स पर ध्यान केंद्रित करके जिन्हें खिलाड़ी ने मिस किया था, SORT AI को तेजी से और स्मार्ट तरीके से सीखने में मदद करता है, खासकर जब चीजें वास्तव में कठिन होती हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।