MemCorr-DP: Counterfactual Correspondence Conditioning for a Diffusion Policy Guided by a Reference
MemCorr-DP एक डिफ्यूजन पॉलिसी है जो 2D फीचर मैचेस को एक रेफरेंस ट्रजेक्टरी के साथ स्पष्ट 3D संबंधों में ऊपर उठाकर और वर्तमान दृश्य के साथ ज्यामिति (जियोमेट्री) को संरेखित करने के लिए काउंटरफैक्चुअल कंडीशनिंग का उपयोग करके, संचयी स्थानिक और दृश्य दृष्टिकोण परिवर्तनों (स्पेशियल और व्यूपॉइंट शिफ्ट्स) के तहत विसुओमोटर मजबूती को बढ़ाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
इंसानों को कार्य करते हुए देखकर सीखने वाले रोबोट तेजी से आम होते जा रहे हैं, लेकिन वे एक जिद्दी सीमा का सामना करते हैं: जब दुनिया थोड़ी सी भी बदलती है, तो वे अक्सर विफल हो जाते हैं। यदि एक रोबोट एक ही स्थान पर खड़े होकर दरवाजा खोलना सीखता है, तो यदि दरवाजे को कुछ इंच भी खिसका दिया जाए या दृश्य को देख रहे कैमरे का कोण बदल दिया जाए, तो वह भ्रमित हो सकता है। ऐसा इसलिए होता है क्योंकि कई रोबोट नियंत्रक (कंट्रोलर) अंतर्निहित ज्यामिति (जियोमेट्री) को समझने के बजाय विशिष्ट दृश्य पैटर्न को याद करने पर निर्भर करते हैं, जैसे कि छवि के एक विशिष्ट कोने में दरवाजे के हैंडल का सटीक आकार। जब दृश्य बदलता है, तो परिचित पैटर्न गायब हो जाता है, और रोबोट की योजना विफल हो जाती है। मशीनों को वास्तव में अनुकूलन योग्य बनाने के लिए, शोधकर्ता रोबोटों को स्क्रीन पर पिक्सेल के बजाय वस्तुओं और उनकी अपनी गतिविधियों के बीच स्थानिक संबंध (स्पेशियल रिलेशनशिप) पर ध्यान केंद्रित करना सिखाने के तरीकों की खोज कर रहे हैं। इस दृष्टिकोण का उद्देश्य एक प्रकार की "मसल मेमोरी" बनाना है जो यह समझ सके कि ग्रिपर को किसी वस्तु के सापेक्ष कैसे हिलना चाहिए, चाहे वह वस्तु कहीं भी रखी हो या कैमरा किस तरह से देख रहा हो।
एक नए अध्ययन में, शोधकर्ताओं ने MemCorr-DP नामक एक प्रणाली विकसित की है जो इस समस्या से निपटने के लिए रोबोट को एक सफल उदाहरण के साथ अपने कार्यों को संरेखित करना सिखाती है, भले ही दृश्य बहुत अलग क्यों न दिखे। मूल विचार सरल लेकिन शक्तिशाली है: एक सफल प्रयास के रूप में दिखने वाली चीज़ को याद करने के बजाय, रोबोट अपनी वर्तमान स्थिति की भौतिक ज्यामिति को एक सहेजे गए, सफल प्रक्षेपवक्र (ट्रैजेक्टरी) की ज्यामिति से मिलाना सीखता है। कल्पना कीजिए कि एक रोबोट दरवाजा खोलने की कोशिश कर रहा है। शोधकर्ता उसे एक सफल ओपनिंग का वीडियो रिकॉर्डिंग प्रदान करते हैं। जैसे ही रोबोट एक नए स्थान पर और अलग कैमरा कोण के साथ कार्य करने का प्रयास करता है, वह लाइव दृश्य और रिकॉर्ड किए गए वीडियो दोनों में दरवाजे और रोबोट के हाथ पर संगत बिंदुओं (कोरेस्पोंडिंग पॉइंट्स) को खोजने के लिए एक विजुअल मैचिंग सिस्टम का उपयोग करता है। इसके बाद वह इन मिलान करने वाले बिंदुओं को एक साझा तीन-आयामी (3D) स्थान में उठाता है, जिससे संबंधों का एक सेट बनता है जो बताता है कि दरवाजे के सापेक्ष रोबोट का हाथ कहाँ है, और रिकॉर्डिंग में हाथ उसी क्षण दरवाजे के सापेक्ष कहाँ था। यह रोबोट को यह देखने की अनुमति देता है कि, भले ही दरवाजा एक अलग स्थान पर है, हाथ और हैंडल के बीच का भौतिक संबंध वही है, और वह सही गति के साथ आगे बढ़ सकता है।
शोधकर्ताओं ने इस प्रणाली का परीक्षण एक सिम्युलेटेड कार्य पर किया जहाँ एक रोबोट को दरवाजा खोलना और बंद करना होता है। उन्होंने जानबूझकर कार्य को कठिन बनाया, जैसे दरवाजे को उस सीमा से बहुत दूर स्थित करना जो रोबोट ने प्रशिक्षण के दौरान देखी थी और कैमरा कोण को पंद्रह डिग्री तक घुमा दिया। इन चुनौतीपूर्ण स्थितियों में, नई प्रणाली 96.67% प्रयासों में सफल रही। इसकी तुलना में, एक मानक रोबोट कंट्रोलर जो केवल विजुअल इमेज पर निर्भर था, बिना इस ज्यामितीय मिलान के, केवल 88% बार सफल हुआ। यह अंतर छोटा लग सकता है, लेकिन रोबोटिक्स की दुनिया में, 12% की विफलता दर बनाम 3% की विफलता दर विश्वसनीयता का एक बड़ा अंतर है। अध्ययन ने दिखाया कि प्रणाली की सफलता काफी हद तक बिंदुओं के बीच पूर्ण तीन-आयामी संबंधों का उपयोग करने पर निर्भर थी। जब शोधकर्ताओं ने विस्तृत पॉइंट-टू-पॉइंट मैचिंग को हटा दिया और इसे सरल जानकारी, जैसे कि दरवाजे के केंद्र या गति की सामान्य दिशा से बदल दिया, तो सफलता दर काफी गिर गई। इसने सिद्ध किया कि कठिन बदलावों के माध्यम से नेविगेट करने के लिए रोबोट को मिलान प्रणाली द्वारा प्रदान किए गए सटीक स्थानिक मानचित्र (स्पेशियल मैप) की आवश्यकता थी।
यह सुनिश्चित करने के लिए कि रोबोट वास्तव में संदर्भ वीडियो के निर्देशों का पालन कर रहा है और केवल अनुमान नहीं लगा रहा है, शोधकर्ताओं ने एक चतुर प्रशिक्षण पद्धति पेश की। उन्होंने रोबोट को दरवाजा खोलने और बंद करने के बीच अंतर करना सिखाया, जिसमें उसे बिल्कुल समान शुरुआती स्थिति और समान शोर युक्त, अनिश्चित इनपुट दिया गया, लेकिन दो अलग-अलग संदर्भ वीडियो के आधार पर दो अलग-अलग परिणामों के लिए क्रिया की भविष्यवाणी करने को कहा गया। यदि रोबोट संदर्भ बदलने पर खोलने और बंद करने के बीच अंतर नहीं कर सका, तो इसका मतलब था कि वह सही सबक नहीं सीख रहा था। इस "काउंटरफैक्टुअल" प्रशिक्षण ने सिस्टम को संदर्भ प्रक्षेपवक्र के विशिष्ट विवरणों पर बारीकी से ध्यान देने के लिए मजबूर किया। परिणामों ने दिखाया कि जब रोब सहित गलत संदर्भ वीडियो दिया गया, तो वह गलत क्रिया करने का प्रयास करता था, जिससे यह सिद्ध हुआ कि वह केवल एक पूर्व-सीखे गए व्यवहार पर निर्भर रहने के बजाय वास्तव में दिए गए मार्गदर्शन के प्रति प्रतिक्रिया दे रहा था।
अध्ययन ने यह भी जांचा कि सिस्टम विजुअल मैचिंग प्रक्रिया में त्रुटियों को कितनी अच्छी तरह संभालता है। वास्तविक दुनिया में, दो अलग-अलग छवियों के बीच बिंदुओं को मिलाना कभी भी पूर्ण नहीं होता; हमेशा कुछ छोटी त्रुटि होती है। शोधकर्ताओं ने पाया कि उनका सिस्टम तब भी मजबूत बना रहा जब मिलान अपूर्ण था, और उच्च सफलता दर बनाए रखी जब गणना की गई स्थितियाँ कई सेंटीमीटर तक गलत थीं। यह लचीलापन बताता है कि सिस्टम को कार्य करने के लिए पिक्सेल-परफेक्ट संरेखण की आवश्यकता नहीं है; इसे रोबोट की क्रियाओं को निर्देशित करने के लिए केवल तीन-आयामी संबंधों के एक अच्छे अनुमान की आवश्यकता है। शोधकर्ताओं ने उल्लेख किया कि हालांकि सिस्टम उनके सिमुलेशन में अच्छा काम करता था, लेकिन अभी तक इसका परीक्षण भौतिक रोबोटों या विभिन्न प्रकार के कार्यों पर नहीं किया गया है। मूल्यांकन एक एकल दरवाजे के उदाहरण और विशिष्ट प्रकार की गतिविधियों और कैमरा शिफ्ट तक सीमित था। हालांकि, परिणाम इस बात का पुख्ता प्रमाण देते हैं कि रोबोट, वस्तु और एक संदर्भ उदाहरण के बीच तीन-आयामी संबंधों को स्पष्ट रूप से मॉडल करना, रोबोटों को नए और अप्रत्याशित वातावरण में अपने कौशल को सामान्य (जनरलाइज) करने के योग्य बनाने की दिशा में एक आशाजनक मार्ग है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।