TREK: Distill to Explore, Reinforce to Refine
TREK एक सामान्य, चरणबद्ध प्रशिक्षण ढांचा है जो बाहरी या आंतरिक शिक्षकों से सत्यापित उम्मीदवार समाधानों के माध्यम से कठिन प्रॉम्प्ट्स पर एक मॉडल की अन्वेषण क्षमताओं का विस्तार करने के लिए फॉरवर्ड-KL डिस्टिलेशन का उपयोग करके ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) को बढ़ाता है, जिससे जटिल गणितीय और एजेंटिक रीजनिंग कार्यों पर अभिसरण को गति मिलती है और प्रदर्शन में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक छात्र (AI) को बहुत कठिन पहेलियाँ हल करना सिखाने की कोशिश कर रहे हैं। आपके पास एक शक्तिशाली उपकरण है जिसे GRPO (Group Relative Policy Optimization) कहा जाता है। GRPO को एक कोच के रूप में समझें जो छात्र को कहता है: "इस पहेली को 16 अलग-अलग तरीकों से हल करने की कोशिश करो। अगर तुम सही हल कर लेते हो, तो बहुत अच्छा! अगर तुम गलत होते हो, तो यह पता लगाने की कोशिश करो कि तुम्हारे 16 प्रयासों में से कौन सा प्रयास 'सबसे कम गलत' था और वैसा ही अधिक करने की कोशिश करो।"
यह तब बहुत अच्छा काम करता है जब छात्र पहले से ही उत्तर के करीब हो। लेकिन क्या होता है जब पहेली इतनी कठिन हो कि आपके 16 प्रयासों में से कोई भी करीब तक न हो? छात्र बस गोल-गोल घूमता रहता है, बेतरतीब ढंग से अनुमान लगाता है, और कभी भी सही रास्ते पर नहीं पहुँच पाता। कोच फंस जाता है क्योंकि उसे पुख्ता करने के लिए कोई "अच्छा" प्रयास नहीं मिलता।
यहीं पर यह शोध पत्र TREK (Teacher-Routed Exploration via Forward KL) पेश करता है।
मुख्य विचार: "गाइडबुक" का उदाहरण
TREK एक गाइडबुक (शिक्षक) को पेश करके खेल बदल देता है।
- समस्या: छात्र एक विशिष्ट कठिन पहेली पर अटका हुआ है। वह अपने आप समाधान नहीं खोज पा रहा है।
- हस्तक्षेप: छात्र को फिर से अंधेरे में अनुमान लगाने देने के बजाय, TREK गाइडबुक से उस पहेली को हल करने के लिए कहता है। गाइडबुक अधिक स्मार्ट है (या उसके पास अधिक समय/उपकरण हैं) और सही समाधान खोज लेती है।
- फ़िल्टर: गाइडबुक कई तरीके खोज सकती है। TREK सब कुछ कॉपी नहीं करता। यह छात्र के वर्तमान कौशल स्तर को देखता है और उस समाधान को चुनता है जो छात्र की मौजूदा कल्पना के सबसे करीब है। यह एक गाइडबुक के समान है जो कहती है, "यहाँ उत्तर है, लेकिन मैं तुम्हें इसका वह संस्करण दिखा रही हूँ जो तुम्हारे वर्तमान ज्ञान से बस एक कदम दूर है।"
- "स्ट्रेच" (Forward KL): इससे पहले कि छात्र अपने दम पर अभ्यास करना शुरू करे, TREK उसे उस विशिष्ट "करीब वाले" समाधान पर एक त्वरित, केंद्रित पाठ देता है। यह एक वार्म-अप स्ट्रेच की तरह है जो छात्र की मांसपेशियों को इतना लचीला बना देता है कि वे उस नए स्थान तक पहुँच सकें।
- वापसी: अब, छात्र वापस अपने "16 प्रयासों" वाले खेल पर जाता है। क्योंकि वार्म-अप हुआ है, वह अंततः सही समाधान तक पहुँच पाता है। एक बार जब वह वहाँ पहुँच जाता है, तो मूल कोच (GRPO) नियंत्रण संभाल सकता है और उसे इसमें महारत हासिल करने में मदद कर सकता है।
यह विशेष क्यों है
अधिकांश पिछले तरीकों ने छात्र को गाइडबुक के उत्तर दिखाते हुए सिखाने की कोशिश की जब छात्र पहले से ही पहेली को हल करने की कोशिश कर रहा था। लेकिन यदि छात्र पूरी तरह से खो गया है, तो उसे उत्तर दिखाने से यह नहीं पता चलता कि वहाँ तक कैसे पहुँचना है; यह केवल जादू जैसा लगता है।
TREK अलग है क्योंकि यह गाइडबुक के उत्तर को केवल एक "कॉपी-पेस्ट निर्देश" के रूप में नहीं, बल्कि एक नए क्षेत्र के मानचित्र के रूप में देखता है। यह विशेष रूप से उन क्षणों को लक्षित करता है जब छात्र पूरी तरह से फंस जाता है, एक ऐसा रास्ता खोजने के लिए गाइडबुक का उपयोग करता है जो पहुंच योग्य हो, और फिर छात्र की उस रास्ते पर चलने की क्षमता को "स्ट्रेच" (विस्तारित) करता है।
परिणाम: तेज़ और स्मार्ट
शोध पत्र ने दो प्रकार की चुनौतियों पर इसका परीक्षण किया:
- गणित की पहेलियाँ (AIME): कल्पना कीजिए कि एक गणित प्रतियोगिता चल रही है। मानक विधि (GRPO) कठिन समस्याओं का लगभग 37% सही हल करती है। TREK के साथ, एक सुपर-स्मार्ट गाइडबुक का उपयोग करके, स्कोर बढ़कर 40% से अधिक हो गया। और भी प्रभावशाली बात यह है कि जब छात्र ने बाहरी गाइडबुक के बजाय अपने खुद के दिमाग का उपयोग अतिरिक्त संकेतों के साथ किया, तब भी इसमें महत्वपूर्ण सुधार हुआ।
- रोबोट कार्य (ALFWorld और ScienceWorld): कल्पना कीजिए कि एक रोबोट कमरा साफ करने या विज्ञान प्रयोग करने की कोशिश कर रहा है। ये लंबे, जटिल कार्य हैं जहाँ रोबोट अक्सर भटक जाता है।
- मानक विधि सबसे कठिन कार्यों पर अटक जाती है, उन्हें समझने में बहुत समय लेती है।
- TREK ने रोबोट को कठिन कार्यों में बहुत पहले सफल होने में मदद की। यह ऐसा है जैसे रोबोट को घंटों तक अंधेरे में भटकने की ज़रूरत नहीं पड़ी; गाइडबुक ने बस इतना प्रकाश किया कि रोबोट को दरवाज़ा दिख जाए, और फिर रोबोट ने अपने दम पर उस रास्ते पर चलना शुरू कर दिया।
"सीक्रेट सॉस"
शोध पत्र इस बात पर ज़ोर देता है कि TREK बहुत लचीला है। "गाइडबुक" को एक अलग, बड़ा AI होने की आवश्यकता नहीं है। यह हो सकता है:
- एक सुपर-स्मार्ट बाहरी AI (Black-box)।
- वही AI, लेकिन उसे अधिक समय या बेहतर उपकरण दिए गए हों (White-box/Self-context)।
- वही AI, जो अपनी पिछली विफलताओं के "चीट शीट" के साथ चल रहा हो।
मुख्य बात यह है कि TREK केवल तभी गाइडबुक के उत्तरों का उपयोग करता है जब छात्र वास्तव में फंस जाता है, और यह केवल उन्हीं उत्तरों को चुनता है जो सीखने के लिए पर्याप्त करीब हैं। यह एक स्मार्ट, चरणबद्ध दृष्टिकोण है: खोजें (Explore) मदद के साथ, स्ट्रेच (Stretch) करें ताकि नए स्थान तक पहुँचा जा सके, फिर अपने दम पर परिष्कृत (Refine) करें।
संक्षेप में, TREK एक ऐसा तरीका है जो AI को दीवार से सिर टकराने से रोकता है, उसे संक्षिप्त रूप में एक सीढ़ी थमाता है, उसे चढ़ना सिखाता है, और फिर उसे बाकी का रास्ता अपने दम पर चढ़ने के लिए छोड़ देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।