Learning New Tasks via Reusable Skills: Skill-Compositional Experts for Embodied Continual Learning
यह शोध पत्र SCE, एक स्किल-कंपोजिशनल एक्सपर्ट्स फ्रेमवर्क का प्रस्ताव करता है जो कंपोजिशनल स्किल ग्राउंडिंग के माध्यम से कार्यों को पुन: प्रयोज्य कौशलों में विघटित करके और ड्यूल एक्जीक्यूशन-एंड-ट्रांजिशन एक्सपर्ट्स के माध्यम से उनके निष्पादन और संक्रमणों को समन्वित करके एम्बोडीड कॉन्टिनुअल लर्निंग में कैटास्ट्रोफिक फॉरगेटिंग को कम करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं। पहले, आप उसे दराज खोलना सिखाते हैं। फिर, आप उसे एक कटोरा उठाना सिखाते हैं। अंत में, आप उसे वह कटोरा दराज के अंदर रखना सिखाते हैं।
रोबोटिक्स की दुनिया में, इसे एम्बोडीड कंटीन्यूअल लर्निंग (Embodied Continual Learning) कहा जाता है। रोबोट को पुराने कार्यों को भूलने के बिना नए कार्य सीखना होता है।
समस्या: "ड्रिफ्टिंग" रोबोट (The "Drifting" Robot)
यह पेपर बताता है कि अधिकांश रोबोटों में एक गंभीर मेमोरी समस्या होती है। जब आप उन्हें एक नया करतब सिखाते हैं, तो उनका आंतरिक "मस्तिष्क" (विशेष रूप से, जिस तरह से वे विजुअल और लैंग्वेज डेटा को प्रोसेस करते हैं) नए कार्य के अनुकूल होने के लिए बदलने या "ड्रिफ्ट" (विचलित) होने लगता है।
इसे एक संगीतकार की तरह समझें जो एक नया गाना सीख रहा है। यदि वह उस नए गाने का बहुत अधिक अभ्यास करता है, तो वह पुराने गानों को थोड़ा गलत बजाना शुरू कर सकता है, जिसमें नए गाने की लय मिल सकती है। एक रोबोट में, यह खतरनाक है क्योंकि यह केवल एक गाना नहीं बजा रहा है; यह भौतिक भुजाओं को हिला रहा है। यदि रोबोट का आंतरिक मानचित्र (internal map) विचलित हो जाता है, तो एक चरण में छोटी सी गलती भी बड़ी होती जाएगी क्योंकि वह कार्य पूरा करने की कोशिश करेगा, जिससे अंततः वह पूरी तरह विफल हो जाएगा। इसे कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) कहा जाता है।
समाधान: "लेगो बॉक्स" दृष्टिकोण (The "Lego Box" Approach - SCE)
लेखक एक नया फ्रेमवर्क प्रस्तावित करते हैं जिसे SCE (Skill-Compositional Experts) कहा जाता है। रोबोट को हर नए कार्य को एक पूरी तरह से नए, विशाल निर्देश के रूप में देखने के बजाय, वे उसे छोटे, पुन: प्रयोज्य (reusable) लेगो ब्रिक्स (Lego bricks) (कौशल/skills) में तोड़ने के लिए प्रशिक्षित करते हैं।
यहाँ बताया गया है कि SCE कैसे काम करता है, जिसमें दो मुख्य उपकरण शामिल हैं:
1. "स्किल ऑर्गेनाइज़र" (The "Skill Organizer" - CSG)
कल्पना कीजिए कि आपके पास निर्देशों का एक बॉक्स है। कंपोजिशनल स्किल ग्राउंडिंग (Compositional Skill Grounding - CSG) मॉड्यूल एक स्मार्ट लाइब्रेरियन की तरह है। यह एक जटिल कार्य (जैसे "कटोरे को दराज में रखें") करने के एक लंबे वीडियो को देखता है और उसे छोटे, पुन: प्रयोज्य टुकड़ों में काट देता है:
- टुकड़ा A: "कटोरा पकड़ें।"
- टुकड़ा B: "कटोरा उठाएं।"
- टुकड़ा C: "दराज खोलें।"
- टुकड़ा D: "कटोरा रखें।"
यह इन टुकड़ों को एक स्किल बेस (Skill Base) (एक डिजिटल लाइब्रेरी) में सहेज लेता है। अब, जब रोबोट को एक नया कार्य सीखने की आवश्यकता होती है, तो वह शून्य से शुरुआत नहीं करता है। वह बस लाइब्रेरी से मौजूदा "पकड़ने" (Grab) और "रखने" (Place) वाले ब्रिक्स को उठाता है और उन्हें एक नए क्रम में जोड़ देता है।
2. "डुअल-एक्सपर्ट ब्रेन" (The "Dual-Expert Brain" - DETE)
एक बार जब रोबोट के पास अपने लेगो ब्रिक्स की लाइब्रेरी हो जाती है, तो उसे यह तय करने के लिए एक मस्तिष्क की आवश्यकता होती है कि उनका उपयोग कैसे किया जाए। यह डुअल एक्जीक्यूशन-एंड-ट्रांजिशन एक्सपर्ट्स (Dual Execution-and-Transition Experts - DETE) मॉड्यूल है। इसमें दो विशेष सहायक मिलकर काम करते हैं:
- "करने वाला" (The "Doer" - Execution Expert): यह सहायक एक विशिष्ट कौशल को पूरी तरह से करने में माहिर है। यदि रोबोट को "कटोरा पकड़ने" की आवश्यकता है, तो यह विशेषज्ञ कार्यभार संभालता है और सुनिश्चित करता है कि रोबोट उसे ठीक वैसे ही पकड़े जैसा उसने पहली बार किया था। यह रोबोट को "पकड़ने" का तरीका भूलने से रोकता है।
- "बदलने वाला" (The "Switcher" - Transition Expert): यह सहायक ट्रांजिशन (बदलाव) का मास्टर है। यह जानता है कि "पकड़ने" से "उठाने" की ओर सुचारू रूप से कैसे बढ़ना है। यह उस कठिन मध्य भाग को संभालता है जहाँ एक कौशल समाप्त होता है और दूसरा शुरू होता है।
ये दोनों विशेषज्ञ मिलकर काम करते हैं। "करने वाला" व्यक्तिगत कौशलों को स्थिर रखता है, जबकि "बदलने वाला" यह सुनिश्चित करता है कि एक कार्य से दूसरे कार्य में बदलते समय रोबोट लड़खड़ाए नहीं।
यह क्यों महत्वपूर्ण है
लेखकों ने इसका परीक्षण एक कंप्यूटर सिमुलेशन (LIBORE बेंचमार्क का उपयोग करके) और एक वास्तविक भौतिक रोबोट आर्म पर किया।
- सिमुलेशन में: नया तरीका (SCE) अन्य तरीकों की तुलना में नए कार्य सीखते समय पुराने कार्यों को याद रखने में बहुत बेहतर था। यह बहुत कम भूला।
- वास्तविक दुनिया में: जब उन्होंने इसे एक वास्तविक रोबोट आर्म पर आजमाया, तो यह और भी बेहतर काम कर रहा था। रोबोट उन कार्यों के अनुक्रम को सफलतापूर्वक पूरा कर सका जो उसने समय के साथ सीखे थे, जबकि अन्य तरीकों ने नए कार्य सीखने के बाद पुराने कार्यों में रोबोट को विफल कर दिया।
बड़ी तस्वीर (The Big Picture)
पेपर का दावा है कि रोबोट कार्यों को एक विशाल, अपरिवर्तनीय मेमोरी ब्लॉक के बजाय पुन: प्रयोज्य कौशलों के संयोजन (लेगो से बनाने की तरह) के रूप में मानकर, रोबोट निरंतर सीख सकते हैं और अपना मानसिक संतुलन नहीं खोते। "करने वाला" कौशलों को तेज रखता है, और "बदलने वाला" प्रवाह को सुचारू रखता है, जिससे रोबोट का आंतरिक मानचित्र अपने मार्ग से भटकने से बच जाता है।
संक्षेप में: SCE रोबोट को ऐसे मास्टर शेफ की तरह होना सिखाता है जिनके पास बुनियादी तकनीकों (काटना, तलना, उबालना) का एक सेट होता है। हर बार एक पूरी नई रेसिपी को शुरू से याद करने के बजाय, वे नए व्यंजन बनाने के लिए इन सटीक तकनीकों को मिलाते और जोड़ते हैं, जिससे यह सुनिश्चित होता है कि वे प्याज काटना कभी नहीं भूलते।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।