← नवीनतम पेपर
🤖 AI

Flexible Multitask Learning with Factorized Diffusion Policy

यह शोध पत्र एक नवीन मॉड्यूलर डिफ्यूजन पॉलिसी फ्रेमवर्क प्रस्तुत करता है जो जटिल, मल्टीमॉडल रोबोट एक्शन डिस्ट्रीब्यूशन को विशिष्ट घटकों में विभाजित करता है, जिससे पॉलिसी फिटिंग में सुधार होता है, नए कार्यों के लिए लचीला अनुकूलन सक्षम होता है, और कैटास्ट्रोफिक फॉरगेटिंग को कम किया जाता है, साथ ही यह सिमुलेशन और वास्तविक दुनिया दोनों परिवेशों में मौजूदा मोनोलिथिक और मॉड्यूलर बेसलाइन्स से बेहतर प्रदर्शन करता है।

मूल लेखक: Chaoqi Liu, Haonan Chen, Sigmund H. Høeg, Shaoxiong Yao, Yunzhu Li, Kris Hauser, Yilun Du

प्रकाशित 2026-04-27
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Chaoqi Liu, Haonan Chen, Sigmund H. Høeg, Shaoxiong Yao, Yunzhu Li, Kris Hauser, Yilun Du

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कई अलग-अलग काम करना सिखाने की कोशिश कर रहे हैं: दराज खोलना, लाल घन (cube) उठाना, एक विशिष्ट हुक पर मग लटकाना और कील ठोकना।

समस्या: "स्विस आर्मी नाइफ" का संघर्ष
पारंपरिक रोबोट दिमाग (जिन्हें "मोनोलिथिक पॉलिसीज़" कहा जाता है) एक विशाल स्विस आर्मी नाइफ की तरह होने की कोशिश करते हैं। वे एक ही बड़े, उलझे हुए दिमाग में ये सभी अलग-अलग कौशल सीखने का प्रयास करते हैं। यह कठिन है क्योंकि रोबोट के कार्य बहुत विविध होते हैं। यह एक ही छात्र को एक साथ मास्टर शेफ, एक पेशेवर पियानो वादक और एक रेस कार ड्राइवर बनने के लिए सिखाने जैसा है। छात्र भ्रमित हो जाता है, सब कुछ एक साथ करने की कोशिश करता है, और अंत में उनमें से कोई भी काम ठीक से नहीं कर पाता। वे शायद हथौड़े को चम्मच की तरह "पकड़ने" की कोशिश करेंगे, या दराज को दरवाजे की तरह "खोलने" की कोशिश करेंगे।

समाधान: "विशेषज्ञों की टीम" (FDP)
लेखक एक नई विधि प्रस्तावित करते हैं जिसे फैक्टरइज़्ड डिफ्यूजन पॉलिसी (FDP) कहा जाता है। एक विशाल दिमाग के बजाय, एक विशेषज्ञों की विशेष टीम की कल्पना करें।

  1. विशेषज्ञ (डिफ्यूजन कंपोनेंट्स): रोबोट के पास कई छोटे, विशिष्ट "विशेषज्ञ" हैं।

    • विशेषज्ञ A वस्तुओं के पास जाने ("approach") में माहिर है।
    • विशेषज्ञ B चीजों को कोमलता से पकड़ने ("grasp") में माहिर है।
    • विशेषज्ञ C चीजों को ठोकने ("hammering") या लटकाने ("hanging") में माहिर है।
    • विशेषज्ञ D वस्तुओं को संरेखित ("aligning") करने में माहिर है।
    • प्रत्येक विशेषज्ञ केवल एक विशिष्ट प्रकार की गति या "उप-कौशल" पर ध्यान केंद्रित करता है।
  2. मैनेजर (द राउटर): जब रोबोट किसी कार्य को देखता है (जैसे, "मग लटकाना"), तो एक स्मार्ट मैनेजर (जिसे "राउटर" कहा जाता है) स्थिति को देखता है। केवल एक विशेषज्ञ को पूरा काम करने के लिए चुनने के बजाय, मैनेजर सभी विशेषज्ञों से सलाह मांगता है।

    • मैनेजर कहता है, "विशेषज्ञ A, करीब आने के तरीके के बारे में आप 80% सही हैं। विशेषज्ञ B, पकड़ने के बारे में आप 90% सही हैं। विशेषज्ञ C, कोण के बारे में आप 10% सही हैं।"
    • मैनेजर इन सभी सलाहों के टुकड़ों को एक आदर्श अंतिम क्रिया बनाने के लिए मिलाता (mix) है। यह एक कंडक्टर की तरह है जो एक वाद्य यंत्र को पूरा गाना बजाने के लिए कहने के बजाय, विभिन्न वाद्य यंत्रों के मेल से एक सिम्फनी बनाता है।

यह बेहतर क्यों है

  • स्थिरता (Stability): क्योंकि मैनेजर सभी की सलाह को सुचारू रूप से मिलाता है (एक को चुनकर बाकी को अनदेखा करने के बजाय), रोबोट बहुत तेज़ी से सीखता है और भ्रमित नहीं होता है। यह एक ऐसी टीम की तरह है जहाँ हर कोई योगदान देता है, न कि एक ऐसी टीम की तरह जहाँ एक व्यक्ति दूसरों पर चिल्ला रहा हो।
  • "भूलने" का कोई डर नहीं (No "Forgetting"): यह इस पेपर की बड़ी जीत है। यदि आप रोबोट को एक नया कौशल सिखाना चाहते हैं (जैसे, "लाइट बल्ब कसना"), तो आपको पूरी टीम को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। आप बस उस विशिष्ट कार्य के लिए एक नया विशेषज्ञ नियुक्त करते हैं और उन्हें टीम में शामिल होने देते हैं। पुराने विशेषज्ञ (जो दराज खोलना या मग लटकाना जानते हैं) बिल्कुल वैसे ही रहते हैं। इसका मतलब है कि रोबोट अपने पुराने कौशल को भूले बिना नया कौशल सीख लेता है—यह "कैटास्ट्रोफिक फॉरगेटिंग" नामक समस्या है जिससे अन्य विधियाँ जूझती हैं।
  • लचीलापन (Flexibility): यदि रोबोट को बहुत जटिल कार्य करने की आवश्यकता है, तो मैनेजर अधिक विशेषज्ञों से अधिक सलाह मांग सकता है। यदि कार्य सरल है, तो वह केवल कुछ विशेषज्ञों पर भरोसा कर सकता है।

वास्तविक दुनिया का प्रमाण
लेखकों ने कंप्यूटर सिमुलेशन और वास्तविक दुनिया दोनों में रोबोट पर इसका परीक्षण किया।

  • सिमुलेशन में: रोबोट टीम (FDP) ने दराज खोलने, पेग असेंबल करने और छतरियां उठाने जैसे कार्यों में "एकल मस्तिष्क" वाले रोबोट और अन्य "टीम" वाले रोबोटों को पछाड़ दिया।
  • वास्तविक दुनिया में: उन्होंने एक वास्तविक रोबोट आर्म के साथ इसका परीक्षण किया। जब रोबोट को लाल घन उठाने या मग लटकाने के लिए कहा गया, तो FDP रोबोट अन्य रोबots की तुलना में अधिक सफल और सटीक था। अन्य रोबोट अक्सर चीजों को संभालने में विफल रहे या उन्हें गिरा दिया क्योंकि वे कार्य की जटिलता को नहीं संभाल सके।

मुख्य बात (The Bottom Line)
पेपर का दावा है कि एक जटिल रोबोट मस्तिष्क को विशेषज्ञों की एक मिक्स-एंड-मैच टीम में तोड़कर, रोबोट कई अलग-अलग कार्य तेज़ी से सीख सकते हैं, अपने पुराने कौशल को बेहतर ढंग से याद रख सकते हैं, और पूरे सिस्टम को बदलने की आवश्यकता के बिना नए कार्यों के अनुकूल हो सकते हैं। यह रोबोट को एक भ्रमित सामान्य विशेषज्ञ से एक अत्यधिक कुशल, अनुकूलन योग्य विशेषज्ञ टीम में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →