Self-Distilled Agentic Reinforcement Learning
यह शोध पत्र SDAR को प्रस्तुत करता है, जो एक नवीन ढांचा (framework) है जो लंबी अवधि के एजेंटिक कार्यों (long-horizon agentic tasks) के लिए स्थिर, सघन टोकन-स्तरीय मार्गदर्शन प्रदान करने हेतु ऑन-पॉलिसी सेल्फ-डिस्टिलेशन (On-Policy Self-Distillation) को एक गेटेड ऑक्जिलरी ऑब्जेक्टिव के रूप में सुदृढीकरण शिक्षण (Reinforcement Learning) में एकीकृत करता है, जो कई बेंचमार्क और मॉडल स्केल्स में मानक RL और नाइव हाइब्रिड बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बुद्धिमान लेकिन अनुभवहीन प्रशिक्षु (छात्र) को खजाना खोजने के लिए एक जटिल, बहु-चरणीय भूलभुलैया (maze) में रास्ता दिखाना सिखा रहे हैं। आपके पास उन्हें सिखाने के दो मुख्य तरीके हैं:
"गलती से सीखना" कोच (Reinforcement Learning): आप प्रशिक्षु को भूलभुलैया में भटकने देते हैं। यदि वे दीवार से टकराते हैं, तो उन्हें "आह" का संकेत मिलता है। यदि वे खजाने के करीब पहुँचते हैं, तो उन्हें "बहुत अच्छे" का संकेत मिलता है। यह बड़े चित्र (big picture) को सीखने के लिए बेहतरीन है, लेकिन फीडबैक धीमा और अस्पष्ट है। आपको केवल अंत में पता चलता है कि वे विफल रहे, यह नहीं कि कौन सा विशिष्ट कदम गलत था।
"सुपर-हेल्पर" मेंटर (Self-Distillation): आपके पास एक ऐसा प्रशिक्षु संस्करण है जिसके पास एक गुप्त 'चीट शीट' (विशेषाधिकार प्राप्त संदर्भ, जैसे कि नक्शा या कौशल की सूची) है। मेंटर प्रशिक्षु को देखता है और हर एक शब्द जो वे बोलते हैं, उसके लिए फुसफुसाता है, "यहाँ बाएँ मत मुड़ो, दाएँ मुड़ो!" या "बहुत अच्छा काम किया!"
समस्या:
यह शोध पत्र तर्क देता है कि मेंटर को लगातार फुसफुसाने देने का तरीका खतरनाक है।
- विचलन (The Drift): जैसे-जैसे प्रशिक्षु भूलभुलैया में गहराई तक जाता है, वे गलतियाँ करना शुरू कर सकते हैं। यदि मेंटर अपने मूल चीट शीट के आधार पर निर्देश देता रहता है, तो वे गलत सलाह देना शुरू कर सकते हैं क्योंकि स्थिति बदल गई है। प्रशिक्षु भ्रमित हो जाता है, और पूरा प्रशिक्षण विफल हो जाता है।
- बुरी फुसफुसाहट (The Bad Whisper): कभी-कभी मेंटर कहता है, "ऐसा मत करो!" क्योंकि चीट शीट गलत है या उस विशिष्ट मोड़ के लिए अप्रासंगिक है। यदि प्रशिक्षु हर "ऐसा मत करो" को आँख मूंदकर सुनता है, तो वे अच्छी चीजों को करना भी बंद कर सकते हैं क्योंकि मेंटर भ्रमित था।
समाधान: SDAR (Self-Distilled Agentic Reinforcement Learning)
लेखकों ने SDAR नामक एक नया तरीका बनाया है। इसे ऐसे समझें कि आपने मेंटर की आवाज़ के लिए प्रशिक्षु को एक स्मार्ट, एडजस्टेबल वॉल्यूम नॉब दे दिया है।
मेंटर हर एक क्षण में निर्देश चिल्लाने के बजाय, एक "गेट" (एक स्मार्ट फ़िल्टर) का उपयोग करता है ताकि यह तय किया जा सके कि प्रशिक्षु द्वारा बोले गए प्रत्येक शब्द के लिए मेंटर की आवाज़ कितनी तेज़ होनी चाहिए।
- जब मेंटर सही होता है: यदि मेंटर प्रशिक्षु से सहमत होता है और कहता है, "हाँ, यह एक शानदार चाल है!" (एक सकारात्मक संकेत), तो वॉल्यूम नॉब ऊपर की ओर घूम जाता है। प्रशिक्षु ध्यान से सुनता है और उस विशिष्ट क्षण से सीखता है।
- जब मेंटर भ्रमित या गलत होता है: यदि मेंटर कहता है, "नहीं, ऐसा मत करो!" लेकिन प्रशिक्षु वास्तव में सही रास्ते पर है, या यदि मेंटर की चीट शीट इस मोड़ के लिए अव्यवस्थित है, तो वॉल्यूम नॉब को कम करके फुसफुसाहट में बदल दिया जाता है या मेंटर को पूरी तरह से म्यूट कर दिया जाता है। प्रशिक्षु बुरी सलाह को अनदेखा करता है और अपने "गलती से सीखने" वाले कोच की बात सुनता रहता है।
"स्मार्ट फ़िल्टर" की उपमा
कल्पना कीजिए कि मेंटर एक रेडियो स्टेशन है।
- पुराना तरीका (Naive GRPO+OPSD): रेडियो 24/7 बजता रहता है। कभी-कभी यह मददगार संगीत बजाता है, और कभी-कभी शोर (static) या गलत गाने बजाता है। प्रशिक्षु हर चीज़ पर नाचने की कोशिश करता है, चक्कर खा जाता है, और गिर जाता है।
- SDAR: रेडियो में एक सेंसर है। यह संगीत तभी बजाता है जब बीट प्रशिक्षु के डांस मूव्स से पूरी तरह मेल खाती है। यदि संगीत ताल से बाहर है (गलत सलाह), तो सेंसर उसे म्यूट कर देता है। प्रशिक्षु केवल उन क्षणों से सीखता है जब संगीत वास्तव में अच्छा होता है।
शोध में क्या पाया गया
शोधकर्ताओं ने तीन अलग-अलग "भूलभुलैयाओं" (कार्यों) पर इसका परीक्षण किया:
- ALFWorld: एक टेक्स्ट-आधारित गेम जहाँ आपको एक कमरा साफ करना है और चीजों को विशिष्ट स्थानों पर रखना है।
- WebShop: एक ऑनलाइन शॉपिंग सिमुलेशन जहाँ आपको विशिष्ट वस्तुएं ढूँढनी और खरीदनी होती हैं।
- Search-QA: एक कार्य जहाँ आपको कठिन प्रश्नों के उत्तर देने के लिए इंटरनेट पर खोज करनी होती है।
उन्होंने पाया कि:
- SDAR विजेता है: इसने केवल "गलती से सीखने" वाले कोच के मुकाबले तेज़ी से सीखा और बेहतर स्कोर प्राप्त किया, और यह लगातार चिल्लाने वाले मेंटर की तुलना में बहुत अधिक स्थिर था।
- यह खराब मानचित्रों को भी संभाल लेता है: भले ही "चीट शीट" (कौशल) रैंडम या निम्न गुणवत्ता वाली थी, SDAR ने काम किया। स्मार्ट फ़िल्टर ने गलत सलाह को अनदेखा कर दिया और केवल अच्छे हिस्सों को सुना।
- यह छोटे और बड़े दिमागों के लिए काम करता है: उन्होंने विभिन्न आकार के AI मॉडल (छोटे से लेकर बड़े तक) पर इसका परीक्षण किया, और यह सभी के लिए अच्छी तरह काम करता है।
संक्षेप में
SDAR एक प्रशिक्षण पद्धति है जो "करके सीखने" के दृष्टिकोण और "सुनकर सीखने" के दृष्टिकोण को जोड़ती है, लेकिन इसमें एक स्मार्ट फ़िल्टर जोड़ा गया है ताकि यह सुनिश्चित हो सके कि छात्र केवल तभी सुनता है जब शिक्षक वास्तव में सहायक हो। यह छात्र को गलत सलाह से भ्रमित होने से बचाता है और एक अधिक विश्वसनीय, स्मार्ट एजेंट बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।