← नवीनतम पेपर
🤖 machine learning

Co-Evolving Policy Distillation

यह शोध पत्र को-इवॉल्विंग पॉलिसी डिस्टिलेशन (CoPD) का प्रस्ताव करता है, जो एक नवीन प्रशिक्षण प्रतिमान (training paradigm) है जो क्षमता की हानि और व्यवहार संबंधी अंतराल को दूर करने के लिए समानांतर विशेषज्ञ प्रशिक्षण को द्विदिश ऑनलाइन पॉलिसी डिस्टिलेशन के साथ एकीकृत करता है, जिससे मौजूदा RLVR और डिस्टिलेशन विधियों की तुलना में उत्कृष्ट ऑल-इन-वन टेक्स्ट, इमेज और वीडियो रीजनिंग प्रदर्शन प्राप्त होता है।

मूल लेखक: Naibin Gu, Chenxu Yang, Qingyi Si, Chuanyu Qin, Dingyu Yao, Peng Fu, Zheng Lin, Weiping Wang, Nan Duan, Jiaqi Wang

प्रकाशित 2026-05-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Naibin Gu, Chenxu Yang, Qingyi Si, Chuanyu Qin, Dingyu Yao, Peng Fu, Zheng Lin, Weiping Wang, Nan Duan, Jiaqi Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अकेले, अत्यंत बुद्धिमान छात्र को तीन बहुत ही अलग क्षेत्रों में विशेषज्ञ बनने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं: गणित (Math), कला (Art), और वीडियो विश्लेषण (Video Analysis)

अतीत में, शोधकर्ताओं ने इसे करने के दो मुख्य तरीके आजमाए थे, लेकिन दोनों में एक बड़ी खामी थी। यह पेपर एक नई विधि पेश करता है जिसे Co-Evolving Policy Distillation (CoPD) कहा जाता है, जो इन खामियों को एक अनूठे, "नृत्य जैसे" तालमेल के माध्यम से ठीक करती है।

यहाँ यह पेपर समस्या और समाधान को सरल उपमाओं का उपयोग करके समझाता है:

समस्या: "रस्साकशी" (Tug-of-War) और "बहुत दूर होने का" अंतर (Too-Far-Apart Gap)

1. "रस्साकशी" (Mixed RLVR)
कल्पना कीजिए कि आप अपने छात्र को एक ही समय में, एक ही कक्षा में, एक ही शिक्षक के साथ गणित और कला सिखाने की कोशिश कर रहे हैं।

  • समस्या: गणित के लिए सख्त तर्क और नियमों की आवश्यकता होती है, जबकि कला के लिए रचनात्मकता और नियमों को तोड़ने की आवश्यकता होती है। जब आप इन्हें मिलाते हैं, तो छात्र भ्रमित हो जाता है। पेपर इसे "क्षमता विचलन" (capability divergence) कहता है। यह रस्साकशी की तरह है जहाँ गणित का पाठ छात्र को एक तरफ खींचता है, और कला का पाठ उसे दूसरी ओर। छात्र दोनों में औसत दर्जे का रह जाता है क्योंकि पाठ एक-दूसरे के प्रभाव को खत्म कर देते हैं।

2. "बहुत दूर होने का" अंतर (Static OPD)
तो, शोधकर्ताओं ने एक अलग दृष्टिकोण आजमाया: "पहले एक गणित विशेषज्ञ को प्रशिक्षित करते हैं, फिर अलग से एक कला विशेषज्ञ को प्रशिक्षित करते हैं, और फिर उन्हें एक नए छात्र को सिखाने के लिए कहते हैं।"

  • समस्या: जब तक गणित विशेषज्ञ का प्रशिक्षण पूरा होता है, वे इतना बदल चुके होते हैं कि वे अब नए छात्र की "भाषा" नहीं बोल पाते। छात्र एक नौसिखिया है; विशेषज्ञ एक ग्रैंडमास्टर है।
  • उपमा: कल्पना कीजिए कि एक ग्रैंडमास्टर शतरंज खिलाड़ी एक छोटे बच्चे को सिखाने की कोशिश कर रहा है। ग्रैंडमास्टर ऐसी चालें चलता है जो बच्चे के समझने के लिए बहुत जटिल हैं। बच्चा (छात्र) ग्रैंडमास्टर (शिक्षक) की चालों को देखता है और सोचता है, "मुझे समझ नहीं आ रहा कि आप क्या कर रहे हैं।" ज्ञान खो जाता है क्योंकि उनके सोचने के पैटर्न बहुत अलग हो जाते हैं। पेपर इसे "व्यवहार पैटर्न अंतराल" (behavioral pattern gap) कहता है।

समाधान: "सह-विकसित नृत्य" (Co-Evolving Dance - CoPD)

लेखक CoPD का प्रस्ताव करते हैं, जो प्रशिक्षण कार्यक्रम को पूरी तरह से बदल देता है। एक विशेषज्ञ को पहले प्रशिक्षित करने और फिर बाद में सिखाने के बजाय, वे दो छात्रों को एक साथ प्रशिक्षित करते हैं जो लगातार एक-दूसरे से सीख रहे हैं और एक-दूसरे को सिखा रहे हैं।

यह नृत्य कैसे काम करता है:

चरण 1: एकल अभ्यास (RL_VR चरण)

  • "गणित का छात्र" केवल गणित के प्रश्नों का अभ्यास करता है।
  • "कला का छात्र" केवल कला के प्रश्नों का अभ्यास करता है।
  • क्यों? इससे वे अपने विशिष्ट कौशल में वास्तव में कुशल हो जाते हैं और नई, उन्नत तकनीकों की खोज करते हैं। वे अपने सोचने के तरीके में अलग होने लगते हैं, जो कि अच्छा है क्योंकि इसका मतलब है कि उनके पास एक-दूसरे को सिखाने के लिए कुछ नया है।

चरण 2: डांस पार्टनर का बदलाव (Mutual OPD चरण)

  • इससे पहले कि वे बहुत दूर हो जाएं, वे रुकते हैं और भूमिकाएं बदलते हैं।
  • गणित का छात्र कला के प्रश्नों को हल करने की कोशिश करता है, और कला का छात्र उसे देखता है और फीडबैक देता है।
  • कला का छात्र गणित के प्रश्नों को हल करने की कोशिश करता है, और गणित का छात्र उसे देखता है और फीडबैक देता है।
  • क्यों? क्योंकि उन्होंने अभी-अभी एक साथ अभ्यास किया है, वे अपने सोचने के पैटर्न में अभी भी इतने करीब हैं कि वे एक-दूसरे को समझ सकें। गणित का छात्र कह सकता है, "मैं देख रहा हूँ कि तुम X करने की कोशिश कर रहे हो, लेकिन यहाँ एक बेहतर तरीका है," और कला का छात्र वास्तव में इसे समझ पाता है क्योंकि वे अभी भी एक ही स्तर पर हैं।

चरण 3: दोहराना

  • वे और अधिक उन्नत चालें सीखने के लिए चरण 1 पर वापस जाते हैं, फिर चरण 2 में फिर से भूमिका बदलते हैं।
  • यह चक्र लगातार दोहराया जाता है।

यह बेहतर क्यों काम करता है

पेपर का दावा है कि यह विधि तीन मुख्य कारणों से श्रेष्ठ है:

  1. कोई रस्साकशी नहीं: क्योंकि वे कुछ समय के लिए अपने विशिष्ट कौशल अलग-अलग अभ्यास करते हैं, इसलिए वे गणित और कला के नियमों को मिलाने से भ्रमित नहीं होते।
  2. "बहुत दूर होने का" अंतर नहीं: क्योंकि वे प्रशिक्षण के दौरान भूमिका बदलते हैं (बाद में नहीं), वे कभी भी इतने दूर नहीं होते कि वे एक-दूसरे को समझ न सकें। वे एक "स्वीट स्पॉट" में रहते हैं जहाँ शिक्षक सिखाने के लिए पर्याप्त उन्नत है, लेकिन समझने योग्य होने के लिए पर्याप्त करीब भी है।
  3. पारस्परिक विकास: वे केवल एक शिक्षक और एक छात्र नहीं हैं; वे सह-विकसित (co-evolving) हो रहे हैं। वे एक साथ बढ़ते हैं। पेपर ने पाया कि अंतिम परिणाम एक एकल मॉडल है जो वास्तव में उन व्यक्तिगत "विशेषज्ञों" की तुलना में गणित और कला दोनों में बेहतर है जिनसे इसे बनाया गया था।

परिणाम

शोधकर्ताओं ने इसका परीक्षण एक ऐसे मॉडल पर किया जिसे टेक्स्ट (गणित), इमेज (कला) और वीडियो को संभालने की आवश्यकता थी।

  • पुराने तरीके: मॉडल या तो भ्रमित था (मिश्रित प्रशिक्षण) या ज्ञान खो चुका था (स्थिर शिक्षण)।
  • CoPD: मॉडल ने तीनों में महारत हासिल की। वास्तव में, अंतिम "ऑल-इन-वन" मॉडल उन विशिष्ट विशेषज्ञों से भी बेहतर प्रदर्शन करता है जिनसे इसे बनाया गया था।

सारांश

CoPD को एक ऐसे स्कूल के रूप में न सोचें जहाँ आप एक विषय शुरू करने से पहले दूसरे में स्नातक प्राप्त करते हैं, बल्कि एक ऐसे जिम के रूप में सोचें जहाँ दो एथलीट एक साथ प्रशिक्षण लेते हैं। वे मजबूत होने के लिए अपने स्वयं के अभ्यास करते हैं, फिर तुरंत एक-दूसरे को 'स्पॉट' करते हैं ताकि वे गर्म और तालमेल में रहते हुए सुझाव साझा कर सकें। जब तक वे समाप्त करते हैं, वे दोनों अकेले या अलगाव में प्रशिक्षण लेने की तुलना में अधिक मजबूत होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →