← नवीनतम पेपर
🤖 machine learning

SPREAD: Subspace Representation Distillation for Lifelong Imitation Learning

यह शोधपत्र SPREAD को प्रस्तुत करता है, जो एक ज्योमेट्री-प्रिजर्विंग (geometry-preserving) फ्रेमवर्क है लाइफलॉन्ग इमिटेशन लर्निंग के लिए, जो लो-रैंक सबस्पेस के भीतर पॉलिसी रिप्रेजेंटेशन को अलाइन करने के लिए सिंगुलर वैल्यू डिकंपोजिशन का उपयोग करता है और LIBERO बेंचमार्क पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करते हुए कैटास्ट्रोफिक फॉरगेटिंग को कम करने के लिए एक कॉन्फिडेंस-गाइडेड डिस्टिलेशन स्ट्रैटेजी का उपयोग करता है।

मूल लेखक: Kaushik Roy, Giovanni D'urso, Nicholas Lawrance, Brendan Tidd, Peyman Moghadam

प्रकाशित 2026-03-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kaushik Roy, Giovanni D'urso, Nicholas Lawrance, Brendan Tidd, Peyman Moghadam

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं। पहले, आप उसे एक कप उठाना सिखाते हैं। फिर, आप उसे कपड़े तह करना सिखाते हैं। फिर, बर्तन धोना सिखाते हैं।

आजकल के अधिकांश रोबोट दिमागों के साथ एक समस्या है, जिसे वे "कैटास्ट्रोफिक फॉरगेटिंग" (Catastrophic Forgetting - विनाशकारी विस्मृति) कहते हैं। यह एक ऐसे छात्र की तरह है जो गणित की परीक्षा के लिए पढ़ता है, पास हो जाता है, लेकिन फिर इतिहास सीखने में इतना व्यस्त हो जाता है कि वह तुरंत जोड़-घटाव करना भूल जाता है। जब तक रोबोट बर्तन धोना सीख लेता है, वह कप उठाना भूल चुका होता है।

यह पेपर SPREAD (सबस्पेस रिप्रेजेंटेशन डिस्टिलेशन) नामक एक नई विधि पेश करता है ताकि इसे ठीक किया जा सके। SPREAD को एक "स्मार्ट मेमोरी कोच" के रूप में सोचें जो रोबलेट को पुराने कौशल खोए बिना नए कौशल सीखने में मदद करता है।

यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "शोर वाला कमरा" बनाम "शांत पुस्तकालय"

वर्तमान विधियाँ रोबोट को उसके कल के "विचारों" (डेटा) की तुलना आज के विचारों से करके सिखाने की कोशिश करती हैं।

  • पुराना तरीका: कल्पना कीजिए कि आप फर्नीचर से भरे दो अस्त-व्यस्त कमरों की तुलना करने की कोशिश कर रहे हैं। यदि आप केवल यह कहते हैं, "नए कमरे को बिल्कुल पुराने कमरे जैसा बनाओ," तो आप गलती से एक ऐसी कुर्सी हिला सकते हैं जो वास्तव में महत्वपूर्ण थी, या आप किसी रैंडम कचरे (शोर/noise) के ढेर से भ्रमित हो सकते हैं जो मायने नहीं रखता। ऐसा तब होता है जब रोबोट कच्चे डेटा से मेल मिलाने की कोशिश करते हैं; वे शोर से भ्रमित हो जाते हैं और महत्वपूर्ण चीजों को भूल जाते हैं।
  • SPREAD का तरीका: बिखरे हुए कमरे को देखने के बजाय, SPREAD कमरे के ब्लूप्रिंट (खाके) को देखता है। यह पूछता है: "मुख्य संरचना क्या है? दीवारें और फर्श क्या हैं?"
    • यह शोर को हटाने और ज्ञान के मूल आकार (core shape) को खोजने के लिए एक गणितीय ट्रिक (जिसे सिंगुलर वैल्यू डिकंपोजिशन कहा जाता है) का उपयोग करता है।
    • उपमा: यदि रोबोट ने "कप पकड़ना" सीखा है, तो उस ज्ञान का आकार "पकड़ना" है। विशिष्ट कप (लाल, नीला, कांच का, प्लास्टिक का) केवल शोर है। SPREAD यह सुनिश्चित करता है कि रोबोट नए कपों के लिए नए आकार सीखने के दौरान भी "पकड़ने" के ब्लूप्रिंट को बरकरार रखे।

2. "सबस्पेस" का कमाल: लचीला बैकपैक

लेखक "लो-रैंक सबस्पेस" की बात करते हैं। आइए कल्पना करें कि रोबोट का दिमाग एक बैकपैक है।

  • पुराना तरीका: बैकपैक भारी, कठोर ईंटों से भरा हुआ है। जब आप एक नई किताब (एक नया कौशल) जोड़ने की कोशिश करते हैं, तो आपको जगह बनाने के लिए ईंटों को तोड़ना पड़ता है, जिससे अंदर की पुरानी किताबें टूट जाती हैं।
  • SPREAD का तरीका: SPREAD बैकपैक को लचीले कंपार्टमेंट (हिस्सों) में व्यवस्थित करता है।
    • यह "मुख्य कंपार्टमेंट्स" (ज्यामिति) को एक ही स्थान पर बनाए रखता है ताकि वे अपनी जगह न बदलें। यह पुराने कौशलों को सुरक्षित रखता है।
    • लेकिन यह "साइड पॉकेट" को खुला और लचीला छोड़ देता है। यह रोबोट को पुराने को कुचले बिना खाली जगह में नए कौशल भरने की अनुमति देता है।
    • परिणाम: रोबोट अपने बैकपैक को फटने या उसकी सामग्री खोने के डर के बिना जीवन भर के कौशल ले जा सकता है।

3. "कॉन्फिडेंस कोच": केवल विशेषज्ञों की बात सुनना

जब रोबोट किसी पुराने कार्य को याद करने की कोशिश करता है, तो वह कभी-कभी भ्रमित हो जाता है और बेतरतीब ढंग से अनुमान लगाने लगता है।

  • पुराना तरीका: शिक्षक (पुराना रोबोट मॉडल) कहता है, "शर्ट कैसे मोड़नी है, याद है?" और छात्र (नया रोबोट) अनुमान लगाने की कोशिश करता है, यहाँ तक कि उन हिस्सों पर भी जहाँ शिक्षक अनिश्चित है। इससे बुरी आदतें विकसित होती हैं।
  • SPREAD का तरीका: SPREAD एक कॉन्फिडेंस फिल्टर पेश करता है।
    • यह छात्र को बताता है: "शिक्षक की बात तभी सुनो जब शिक्षक 100% निश्चित हो कि वह सही है।"
    • यदि शिक्षक किसी विशिष्ट गतिविधि के बारे में हिचकिचा रहा है, तो SPREAD उस हिस्से को अनदेखा कर देता है। यह केवल उन "उच्च-विश्वास" वाले मूव्स पर ध्यान केंद्रित करता है जहाँ रोबोट विशेषज्ञ है।
    • उपमा: यह परीक्षा की तैयारी करने जैसा है। आप उन पन्नों को दोबारा पढ़ने में समय बर्बाद नहीं करते जिन्हें आप पहले से ही पूरी तरह जानते हैं, और आप निश्चित रूप से शिक्षक की बात नहीं सुनते जब वे हकला रहे हों या अनुमान लगा रहे हों। आप अपनी याददाश्त को मजबूत करने के लिए स्पष्ट, आत्मविश्वासी स्पष्टीकरणों पर ध्यान केंद्रित करते हैं।

यह एक बड़ी बात क्यों है?

शोधकर्ताओं ने LIBERO नामक एक प्रसिद्ध रोबोट बेंचमार्क पर इसका परीक्षण किया (जिसमें रोबोट वस्तुओं को उठाने, चीजों को विशिष्ट स्थानों पर ले जाने और निर्देशों का पालन करने जैसे कार्य करते हैं)।

  • परिणाम: SPREAD का उपयोग करने वाले रोबोटों ने न केवल नए कार्य सीखे; उन्होंने अपने पुराने कौशल भी पूरी तरह से बनाए रखे। वे लगभग कुछ भी नहीं भूले।
  • तुलना: अन्य विधियाँ उन छात्रों की तरह थीं जिन्होंने पहली परीक्षा पास की लेकिन दूसरी में फेल हो गए। SPREAD उस छात्र की तरह था जिसने पहली परीक्षा में A प्राप्त किया, दूसरी में A प्राप्त किया, और दसवीं में भी A प्राप्त किया, और सब कुछ पूरी तरह से याद रखा।

सारांश

SPREAD रोबोट को सिखाने का एक नया तरीका है जो कहता है:

  1. शोर को याद न करें; संरचना को याद करें। (कौशल के ज्यामितीय "ब्लूप्रिंट" को खोजें)।
  2. मुख्य संरचना को स्थिर रखें, लेकिन नई चीजों के लिए जगह छोड़ें। (लचीले सबस्पेस का उपयोग करें)।
  3. केवल उन्हीं क्षणों से सीखें जब आप सुनिश्चित हों कि आप सही हैं। (कॉन्फिडेंस-गाइडेड फिल्टरिंग का उपयोग करें)।

यह रोबोटों को वास्तविक "लाइफलॉन्ग लर्नर्स" (जीवनभर सीखने वाले) बनने की अनुमति देता है, जो बुनियादी चीजों को भूले बिना अपने कौशल में लगातार नए कौशल जोड़ते रहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →