← नवीनतम पेपर
💻 computer science

LAR-MoE: Latent-Aligned Routing for Mixture of Experts in Robotic Imitation Learning

LAR-MoE एक दो-चरणीय ढांचा है जो अनसुपरवाइज्ड स्किल डिस्कवरी को पॉलिसी लर्निंग से अलग करता है, जो एक्सपर्ट रूटिंग को एक सीखे हुए लेटेंट रिप्रेजेंटेशन के साथ संरेखित करने के लिए रेगुलराइज करता है, जिससे रोबोट्स को बिना किसी मैनुअल स्किल एनोटेशन की आवश्यकता के हेटेरोजीनियस मैनिपुलेशन टास्क में उच्च सफलता दर प्राप्त करने में सक्षम बनाया जा सके।

मूल लेखक: Ariel Rodriguez, Chenpan Li, Lorenzo Mazza, Rayan Younis, Ortrun Hellig, Sebastian Bodenstedt, Martin Wagner, Stefanie Speidel

प्रकाशित 2026-03-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ariel Rodriguez, Chenpan Li, Lorenzo Mazza, Rayan Younis, Ortrun Hellig, Sebastian Bodenstedt, Martin Wagner, Stefanie Speidel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल सर्जरी करना सिखाने की कोशिश कर रहे हैं, जैसे कि बड़ी कोमलता से आंत के एक टुकड़े को खींचना और पकड़ना। यह केवल एक एकल गति नहीं है; यह कई अलग-अलग चरणों वाला एक नृत्य है: सही जगह ढूँढना, उसे पकड़ना, मानव सर्जन द्वारा दूसरे छोर को पकड़ने का इंतज़ार करना, उसे सावधानी से खींचना और उसे स्थिर रखना।

यदि आप एक रोबोट को मानक "एक ही आकार के सभी के लिए" (one-size-fits-all) मस्तिष्क का उपयोग करके सिखाने की कोशिश करते हैं, तो वह अक्सर भ्रमित हो जाता है। वह सब कुछ एक साथ करने की कोशिश करता है, जिससे गतियाँ औसत निकल आती हैं। इसका परिणाम क्या होता है? वह बहुत ज़ोर से पकड़ सकता है, बहुत तेज़ी से खींच सकता है, या बस जम सकता है क्योंकि वह प्रत्येक चरण में विशेषज्ञ होने के बजाय एक साथ सभी चरणों में अच्छा होने की कोशिश कर रहा है।

यह पेपर एक नया तरीका पेश करता है जिससे रोबोट को सिखाया जाता है जिसे LAR-MoE कहा जाता है। इसे एक रोबोट को एक सामान्य रसोइया देने के बजाय विशेषज्ञ शेफ की एक टीम देने के रूप में समझें।

समस्या: "औसत" रोबोट

आज के अधिकांश रोबोट उस छात्र की तरह हैं जो पूरी किताब को हर पेज को एक ही गति से पढ़कर याद करने की कोशिश करता है। जब वे किसी विशिष्ट परीक्षा प्रश्न पर पहुँचते हैं, तो वे एक अस्पष्ट, "औसत" उत्तर देते हैं जो विशिष्ट समस्या के लिए बिल्कुल सही नहीं होता। रोबकी में, यह कार्य के विभिन्न हिस्सों के बीच स्विच करते समय अनाड़ी गतिविधियों की ओर ले जाता है।

समाधान: "विशेषज्ञ टीम" (Mixture of Experts)

लेखक एक Mixture of Experts (MoE) सिस्टम प्रस्तावित करते हैं। कल्पना कीजिए कि एक रेस्टोरेंट की रसोई है जहाँ आपके पास है:

  • शेफ A: केवल सब्जियाँ काटना जानता है।
  • शेफ B: केवल मांस को भूनना (sear) जानता है।
  • शेफ C: केवल डेज़र्ट को सजाना (plate) जानता है।

एक शेफ के सब कुछ करने के बजाय, आपके पास एक मैनेजर (द "रूटर") है जो ऑर्डर को देखता है और तुरंत सही शेफ को बुलाता है। यदि ऑर्डर "प्याज काटना" है, तो मैनेजर शेफ A को बुलाता है। यदि ऑर्डर "स्टीक भूनना" है, तो वह शेफ B को बुलाता है।

पेच: मैनेजर को कैसे पता चलता है कि किसे बुलाना है?

आमतौर पर, आपको मैनेजर को मैन्युअल रूप से बताना पड़ता है, "जब आप चाकू देखें, तो शेफ A को बुलाएं।" लेकिन सर्जरी में, हमारे पास हर संभावित स्थिति के लिए हर एक कदम लिखने का समय नहीं होता। हम चाहते हैं कि रोबोट इसे खुद से समझे।

यहीं LAR-MoE काम आता है। यह एक चतुर दो-चरणीय प्रशिक्षण प्रक्रिया का उपयोग करता है:

चरण 1: "शैडो ट्रेनिंग" (Unsupervised Learning)

इससे पहले कि रोबोट सर्जरी का अभ्यास करना शुरू करे, वह एक "शैडो ट्रेनिंग" चरण से गुजरता है।

  • शिक्षक: एक स्मार्ट AI एक मानव सर्जन के वीडियो और उनके हाथों की गतिविधियों को देखता है। वह यह सीखता है कि सर्जन क्या देखता है और उसके बाद क्या करता है।
  • छात्र: एक सरल AI केवल वीडियो (दृश्य दृश्य) को देखता है और अनुमान लगाने की कोशिश करता है कि शिक्षक क्या जानता है।

"मैं क्या सोच रहा हूँ, इसका अनुमान लगाओ" के इस खेल के माध्यम से, छात्र कार्य का एक गुप्त नक्शा (एक "लेटेंट स्पेस") सीख जाता है। वह चरणों के नाम (जैसे "चरण 1: पकड़ना") नहीं जानता, लेकिन वह कार्य के "अहसास" को समझता है। वह जानता है, "ओह, दृश्य ऐसा है कि हम कुछ पकड़ने वाले हैं," या "दृश्य ऐसा है कि हम खींच रहे हैं।"

चरण 2: "गाइडेड टीम" (Latent-Aligned Routing)

अब, रोबोट अपने विशेषज्ञों (Experts) की टीम के साथ वास्तविक सर्जरी सीखना शुरू करता है।

  • मैनेजर (Router) वर्तमान दृश्य को देखता है।
  • अंदाजे से अनुमान लगाने के बजाय, मैनेजर चरण 1 में सीखे गए गुप्त नक्शे की जाँच करता है।
  • मैनेजर पूछता है: "क्या यह दृश्य नक्शे के 'पकड़ने' वाले हिस्से जैसा दिखता है? यदि हाँ, तो कार्य को 'पकड़ने' वाले शेफ को भेजें।"

जादू यह है कि मैनेजर को नक्शे का पालन करने के लिए मजबूर किया जाता है। यह "एक्सपर्ट कोलैप्स" को रोकता है, जो एक सामान्य समस्या है जहाँ एक आलसी शेफ सब कुछ करने की कोशिश करता है, और अन्य को निकाल दिया जाता है (अनदेखा किया जाता है)। मैनेजर को गुप्त नक्शे से जोड़कर, यह प्रणाली सुनिश्चित करती है कि हर शेफ को अपना प्रदर्शन करने का मौका मिले और वह अपने स्वयं के क्षेत्र में विशेषज्ञ बन सके।

यह एक बड़ी बात क्यों है?

  1. मैन्युअल लेबल की आवश्यकता नहीं: आपको हज़ारों वीडियो के लिए "चरण 1: पकड़ना, चरण 2: प्रतीक्षा करना" लिखने के लिए बैठने की ज़रूरत नहीं है। रोबोट डेटा को देखकर खुद चरणों को समझ लेता है।
  2. छोटा लेकिन शक्तिशाली: यह प्रणाली आश्चर्यजनक रूप से छोटी है (केवल 150 मिलियन पैरामीटर)। इसे संदर्भ में रखने के लिए, यह एक कॉम्पैक्ट स्पोर्ट्स कार की तरह है जो एक विशाल 3.5-बिलियन-पैरामीटर सुपर-टैंक (जैसे प्रसिद्ध π0\pi_0 मॉडल) की तरह तेज़ दौड़ सकती है।
  3. वास्तविक दुनिया में सफलता: उन्होंने एक वास्तविक सर्जिकल रोबोट पर इसका परीक्षण किया।
    • एक नकली बोवेल (फैंटम) पर: यह 95% बार सफल रहा।
    • असली सूअर के ऊतकों (जीरो-शॉट) पर: हालाँकि इसने पहले कभी असली सूअर के ऊतकों को नहीं देखा था, फिर भी यह अपने कौशल को सफलतापूर्वक स्थानांतरित करने में सफल रहा, 45% बार सफलता मिली। यह बहुत बड़ी बात है क्योंकि असली ऊतक फिसलन भरे और अप्रत्याशित होते हैं, जबकि नकली प्लास्टिक मॉडल अलग होते हैं।

निचोड़

LAR-MoE एक रोबोट को एक ऑर्केस्ट्रा के कंडक्टर को सिखाने जैसा है। हर वाद्य यंत्र को एक ही स्वर बजाने के लिए मजबूर करने के बजाय, यह संगीत के मूड (दृश्य दृश्य) को पहचानना सीखता है और सही भाग (विशेषज्ञ) को बजाने के लिए सही अनुभाग को संकेत देता है। यह बिना किसी पूर्व-लिखित संगीत के, रोबोट को जटिल, वास्तविक दुनिया के कौशल सीखने का एक शक्तिशाली, कुशल और अनुकूलनीय तरीका प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →