← नवीनतम पेपर
💬 NLP

Self-Distilled Agentic Reinforcement Learning

यह शोध पत्र SDAR को प्रस्तुत करता है, जो एक नवीन ढांचा (framework) है जो लंबी अवधि के एजेंटिक कार्यों (long-horizon agentic tasks) के लिए स्थिर, सघन टोकन-स्तरीय मार्गदर्शन प्रदान करने हेतु ऑन-पॉलिसी सेल्फ-डिस्टिलेशन (On-Policy Self-Distillation) को एक गेटेड ऑक्जिलरी ऑब्जेक्टिव के रूप में सुदृढीकरण शिक्षण (Reinforcement Learning) में एकीकृत करता है, जो कई बेंचमार्क और मॉडल स्केल्स में मानक RL और नाइव हाइब्रिड बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Zhengxi Lu, Zhiyuan Yao, Zhuowen Han, Zi-Han Wang, Jinyang Wu, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhengxi Lu, Zhiyuan Yao, Zhuowen Han, Zi-Han Wang, Jinyang Wu, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बुद्धिमान लेकिन अनुभवहीन प्रशिक्षु (छात्र) को खजाना खोजने के लिए एक जटिल, बहु-चरणीय भूलभुलैया (maze) में रास्ता दिखाना सिखा रहे हैं। आपके पास उन्हें सिखाने के दो मुख्य तरीके हैं:

  1. "गलती से सीखना" कोच (Reinforcement Learning): आप प्रशिक्षु को भूलभुलैया में भटकने देते हैं। यदि वे दीवार से टकराते हैं, तो उन्हें "आह" का संकेत मिलता है। यदि वे खजाने के करीब पहुँचते हैं, तो उन्हें "बहुत अच्छे" का संकेत मिलता है। यह बड़े चित्र (big picture) को सीखने के लिए बेहतरीन है, लेकिन फीडबैक धीमा और अस्पष्ट है। आपको केवल अंत में पता चलता है कि वे विफल रहे, यह नहीं कि कौन सा विशिष्ट कदम गलत था।

  2. "सुपर-हेल्पर" मेंटर (Self-Distillation): आपके पास एक ऐसा प्रशिक्षु संस्करण है जिसके पास एक गुप्त 'चीट शीट' (विशेषाधिकार प्राप्त संदर्भ, जैसे कि नक्शा या कौशल की सूची) है। मेंटर प्रशिक्षु को देखता है और हर एक शब्द जो वे बोलते हैं, उसके लिए फुसफुसाता है, "यहाँ बाएँ मत मुड़ो, दाएँ मुड़ो!" या "बहुत अच्छा काम किया!"

समस्या:
यह शोध पत्र तर्क देता है कि मेंटर को लगातार फुसफुसाने देने का तरीका खतरनाक है।

  • विचलन (The Drift): जैसे-जैसे प्रशिक्षु भूलभुलैया में गहराई तक जाता है, वे गलतियाँ करना शुरू कर सकते हैं। यदि मेंटर अपने मूल चीट शीट के आधार पर निर्देश देता रहता है, तो वे गलत सलाह देना शुरू कर सकते हैं क्योंकि स्थिति बदल गई है। प्रशिक्षु भ्रमित हो जाता है, और पूरा प्रशिक्षण विफल हो जाता है।
  • बुरी फुसफुसाहट (The Bad Whisper): कभी-कभी मेंटर कहता है, "ऐसा मत करो!" क्योंकि चीट शीट गलत है या उस विशिष्ट मोड़ के लिए अप्रासंगिक है। यदि प्रशिक्षु हर "ऐसा मत करो" को आँख मूंदकर सुनता है, तो वे अच्छी चीजों को करना भी बंद कर सकते हैं क्योंकि मेंटर भ्रमित था।

समाधान: SDAR (Self-Distilled Agentic Reinforcement Learning)
लेखकों ने SDAR नामक एक नया तरीका बनाया है। इसे ऐसे समझें कि आपने मेंटर की आवाज़ के लिए प्रशिक्षु को एक स्मार्ट, एडजस्टेबल वॉल्यूम नॉब दे दिया है।

मेंटर हर एक क्षण में निर्देश चिल्लाने के बजाय, एक "गेट" (एक स्मार्ट फ़िल्टर) का उपयोग करता है ताकि यह तय किया जा सके कि प्रशिक्षु द्वारा बोले गए प्रत्येक शब्द के लिए मेंटर की आवाज़ कितनी तेज़ होनी चाहिए।

  • जब मेंटर सही होता है: यदि मेंटर प्रशिक्षु से सहमत होता है और कहता है, "हाँ, यह एक शानदार चाल है!" (एक सकारात्मक संकेत), तो वॉल्यूम नॉब ऊपर की ओर घूम जाता है। प्रशिक्षु ध्यान से सुनता है और उस विशिष्ट क्षण से सीखता है।
  • जब मेंटर भ्रमित या गलत होता है: यदि मेंटर कहता है, "नहीं, ऐसा मत करो!" लेकिन प्रशिक्षु वास्तव में सही रास्ते पर है, या यदि मेंटर की चीट शीट इस मोड़ के लिए अव्यवस्थित है, तो वॉल्यूम नॉब को कम करके फुसफुसाहट में बदल दिया जाता है या मेंटर को पूरी तरह से म्यूट कर दिया जाता है। प्रशिक्षु बुरी सलाह को अनदेखा करता है और अपने "गलती से सीखने" वाले कोच की बात सुनता रहता है।

"स्मार्ट फ़िल्टर" की उपमा
कल्पना कीजिए कि मेंटर एक रेडियो स्टेशन है।

  • पुराना तरीका (Naive GRPO+OPSD): रेडियो 24/7 बजता रहता है। कभी-कभी यह मददगार संगीत बजाता है, और कभी-कभी शोर (static) या गलत गाने बजाता है। प्रशिक्षु हर चीज़ पर नाचने की कोशिश करता है, चक्कर खा जाता है, और गिर जाता है।
  • SDAR: रेडियो में एक सेंसर है। यह संगीत तभी बजाता है जब बीट प्रशिक्षु के डांस मूव्स से पूरी तरह मेल खाती है। यदि संगीत ताल से बाहर है (गलत सलाह), तो सेंसर उसे म्यूट कर देता है। प्रशिक्षु केवल उन क्षणों से सीखता है जब संगीत वास्तव में अच्छा होता है।

शोध में क्या पाया गया
शोधकर्ताओं ने तीन अलग-अलग "भूलभुलैयाओं" (कार्यों) पर इसका परीक्षण किया:

  1. ALFWorld: एक टेक्स्ट-आधारित गेम जहाँ आपको एक कमरा साफ करना है और चीजों को विशिष्ट स्थानों पर रखना है।
  2. WebShop: एक ऑनलाइन शॉपिंग सिमुलेशन जहाँ आपको विशिष्ट वस्तुएं ढूँढनी और खरीदनी होती हैं।
  3. Search-QA: एक कार्य जहाँ आपको कठिन प्रश्नों के उत्तर देने के लिए इंटरनेट पर खोज करनी होती है।

उन्होंने पाया कि:

  • SDAR विजेता है: इसने केवल "गलती से सीखने" वाले कोच के मुकाबले तेज़ी से सीखा और बेहतर स्कोर प्राप्त किया, और यह लगातार चिल्लाने वाले मेंटर की तुलना में बहुत अधिक स्थिर था।
  • यह खराब मानचित्रों को भी संभाल लेता है: भले ही "चीट शीट" (कौशल) रैंडम या निम्न गुणवत्ता वाली थी, SDAR ने काम किया। स्मार्ट फ़िल्टर ने गलत सलाह को अनदेखा कर दिया और केवल अच्छे हिस्सों को सुना।
  • यह छोटे और बड़े दिमागों के लिए काम करता है: उन्होंने विभिन्न आकार के AI मॉडल (छोटे से लेकर बड़े तक) पर इसका परीक्षण किया, और यह सभी के लिए अच्छी तरह काम करता है।

संक्षेप में
SDAR एक प्रशिक्षण पद्धति है जो "करके सीखने" के दृष्टिकोण और "सुनकर सीखने" के दृष्टिकोण को जोड़ती है, लेकिन इसमें एक स्मार्ट फ़िल्टर जोड़ा गया है ताकि यह सुनिश्चित हो सके कि छात्र केवल तभी सुनता है जब शिक्षक वास्तव में सहायक हो। यह छात्र को गलत सलाह से भ्रमित होने से बचाता है और एक अधिक विश्वसनीय, स्मार्ट एजेंट बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →