Co-Evolving Policy Distillation
यह शोध पत्र को-इवॉल्विंग पॉलिसी डिस्टिलेशन (CoPD) का प्रस्ताव करता है, जो एक नवीन प्रशिक्षण प्रतिमान (training paradigm) है जो क्षमता की हानि और व्यवहार संबंधी अंतराल को दूर करने के लिए समानांतर विशेषज्ञ प्रशिक्षण को द्विदिश ऑनलाइन पॉलिसी डिस्टिलेशन के साथ एकीकृत करता है, जिससे मौजूदा RLVR और डिस्टिलेशन विधियों की तुलना में उत्कृष्ट ऑल-इन-वन टेक्स्ट, इमेज और वीडियो रीजनिंग प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक अकेले, अत्यंत बुद्धिमान छात्र को तीन बहुत ही अलग क्षेत्रों में विशेषज्ञ बनने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं: गणित (Math), कला (Art), और वीडियो विश्लेषण (Video Analysis)।
अतीत में, शोधकर्ताओं ने इसे करने के दो मुख्य तरीके आजमाए थे, लेकिन दोनों में एक बड़ी खामी थी। यह पेपर एक नई विधि पेश करता है जिसे Co-Evolving Policy Distillation (CoPD) कहा जाता है, जो इन खामियों को एक अनूठे, "नृत्य जैसे" तालमेल के माध्यम से ठीक करती है।
यहाँ यह पेपर समस्या और समाधान को सरल उपमाओं का उपयोग करके समझाता है:
समस्या: "रस्साकशी" (Tug-of-War) और "बहुत दूर होने का" अंतर (Too-Far-Apart Gap)
1. "रस्साकशी" (Mixed RLVR)
कल्पना कीजिए कि आप अपने छात्र को एक ही समय में, एक ही कक्षा में, एक ही शिक्षक के साथ गणित और कला सिखाने की कोशिश कर रहे हैं।
- समस्या: गणित के लिए सख्त तर्क और नियमों की आवश्यकता होती है, जबकि कला के लिए रचनात्मकता और नियमों को तोड़ने की आवश्यकता होती है। जब आप इन्हें मिलाते हैं, तो छात्र भ्रमित हो जाता है। पेपर इसे "क्षमता विचलन" (capability divergence) कहता है। यह रस्साकशी की तरह है जहाँ गणित का पाठ छात्र को एक तरफ खींचता है, और कला का पाठ उसे दूसरी ओर। छात्र दोनों में औसत दर्जे का रह जाता है क्योंकि पाठ एक-दूसरे के प्रभाव को खत्म कर देते हैं।
2. "बहुत दूर होने का" अंतर (Static OPD)
तो, शोधकर्ताओं ने एक अलग दृष्टिकोण आजमाया: "पहले एक गणित विशेषज्ञ को प्रशिक्षित करते हैं, फिर अलग से एक कला विशेषज्ञ को प्रशिक्षित करते हैं, और फिर उन्हें एक नए छात्र को सिखाने के लिए कहते हैं।"
- समस्या: जब तक गणित विशेषज्ञ का प्रशिक्षण पूरा होता है, वे इतना बदल चुके होते हैं कि वे अब नए छात्र की "भाषा" नहीं बोल पाते। छात्र एक नौसिखिया है; विशेषज्ञ एक ग्रैंडमास्टर है।
- उपमा: कल्पना कीजिए कि एक ग्रैंडमास्टर शतरंज खिलाड़ी एक छोटे बच्चे को सिखाने की कोशिश कर रहा है। ग्रैंडमास्टर ऐसी चालें चलता है जो बच्चे के समझने के लिए बहुत जटिल हैं। बच्चा (छात्र) ग्रैंडमास्टर (शिक्षक) की चालों को देखता है और सोचता है, "मुझे समझ नहीं आ रहा कि आप क्या कर रहे हैं।" ज्ञान खो जाता है क्योंकि उनके सोचने के पैटर्न बहुत अलग हो जाते हैं। पेपर इसे "व्यवहार पैटर्न अंतराल" (behavioral pattern gap) कहता है।
समाधान: "सह-विकसित नृत्य" (Co-Evolving Dance - CoPD)
लेखक CoPD का प्रस्ताव करते हैं, जो प्रशिक्षण कार्यक्रम को पूरी तरह से बदल देता है। एक विशेषज्ञ को पहले प्रशिक्षित करने और फिर बाद में सिखाने के बजाय, वे दो छात्रों को एक साथ प्रशिक्षित करते हैं जो लगातार एक-दूसरे से सीख रहे हैं और एक-दूसरे को सिखा रहे हैं।
यह नृत्य कैसे काम करता है:
चरण 1: एकल अभ्यास (RL_VR चरण)
- "गणित का छात्र" केवल गणित के प्रश्नों का अभ्यास करता है।
- "कला का छात्र" केवल कला के प्रश्नों का अभ्यास करता है।
- क्यों? इससे वे अपने विशिष्ट कौशल में वास्तव में कुशल हो जाते हैं और नई, उन्नत तकनीकों की खोज करते हैं। वे अपने सोचने के तरीके में अलग होने लगते हैं, जो कि अच्छा है क्योंकि इसका मतलब है कि उनके पास एक-दूसरे को सिखाने के लिए कुछ नया है।
चरण 2: डांस पार्टनर का बदलाव (Mutual OPD चरण)
- इससे पहले कि वे बहुत दूर हो जाएं, वे रुकते हैं और भूमिकाएं बदलते हैं।
- गणित का छात्र कला के प्रश्नों को हल करने की कोशिश करता है, और कला का छात्र उसे देखता है और फीडबैक देता है।
- कला का छात्र गणित के प्रश्नों को हल करने की कोशिश करता है, और गणित का छात्र उसे देखता है और फीडबैक देता है।
- क्यों? क्योंकि उन्होंने अभी-अभी एक साथ अभ्यास किया है, वे अपने सोचने के पैटर्न में अभी भी इतने करीब हैं कि वे एक-दूसरे को समझ सकें। गणित का छात्र कह सकता है, "मैं देख रहा हूँ कि तुम X करने की कोशिश कर रहे हो, लेकिन यहाँ एक बेहतर तरीका है," और कला का छात्र वास्तव में इसे समझ पाता है क्योंकि वे अभी भी एक ही स्तर पर हैं।
चरण 3: दोहराना
- वे और अधिक उन्नत चालें सीखने के लिए चरण 1 पर वापस जाते हैं, फिर चरण 2 में फिर से भूमिका बदलते हैं।
- यह चक्र लगातार दोहराया जाता है।
यह बेहतर क्यों काम करता है
पेपर का दावा है कि यह विधि तीन मुख्य कारणों से श्रेष्ठ है:
- कोई रस्साकशी नहीं: क्योंकि वे कुछ समय के लिए अपने विशिष्ट कौशल अलग-अलग अभ्यास करते हैं, इसलिए वे गणित और कला के नियमों को मिलाने से भ्रमित नहीं होते।
- "बहुत दूर होने का" अंतर नहीं: क्योंकि वे प्रशिक्षण के दौरान भूमिका बदलते हैं (बाद में नहीं), वे कभी भी इतने दूर नहीं होते कि वे एक-दूसरे को समझ न सकें। वे एक "स्वीट स्पॉट" में रहते हैं जहाँ शिक्षक सिखाने के लिए पर्याप्त उन्नत है, लेकिन समझने योग्य होने के लिए पर्याप्त करीब भी है।
- पारस्परिक विकास: वे केवल एक शिक्षक और एक छात्र नहीं हैं; वे सह-विकसित (co-evolving) हो रहे हैं। वे एक साथ बढ़ते हैं। पेपर ने पाया कि अंतिम परिणाम एक एकल मॉडल है जो वास्तव में उन व्यक्तिगत "विशेषज्ञों" की तुलना में गणित और कला दोनों में बेहतर है जिनसे इसे बनाया गया था।
परिणाम
शोधकर्ताओं ने इसका परीक्षण एक ऐसे मॉडल पर किया जिसे टेक्स्ट (गणित), इमेज (कला) और वीडियो को संभालने की आवश्यकता थी।
- पुराने तरीके: मॉडल या तो भ्रमित था (मिश्रित प्रशिक्षण) या ज्ञान खो चुका था (स्थिर शिक्षण)।
- CoPD: मॉडल ने तीनों में महारत हासिल की। वास्तव में, अंतिम "ऑल-इन-वन" मॉडल उन विशिष्ट विशेषज्ञों से भी बेहतर प्रदर्शन करता है जिनसे इसे बनाया गया था।
सारांश
CoPD को एक ऐसे स्कूल के रूप में न सोचें जहाँ आप एक विषय शुरू करने से पहले दूसरे में स्नातक प्राप्त करते हैं, बल्कि एक ऐसे जिम के रूप में सोचें जहाँ दो एथलीट एक साथ प्रशिक्षण लेते हैं। वे मजबूत होने के लिए अपने स्वयं के अभ्यास करते हैं, फिर तुरंत एक-दूसरे को 'स्पॉट' करते हैं ताकि वे गर्म और तालमेल में रहते हुए सुझाव साझा कर सकें। जब तक वे समाप्त करते हैं, वे दोनों अकेले या अलगाव में प्रशिक्षण लेने की तुलना में अधिक मजबूत होते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।