Vision-Force Admittance Learning for Peg Insertion into a Movable Hole
यह शोध पत्र एक विजन-फोर्स एडमिटेंस लर्निंग (VFAL) ढांचे का प्रस्ताव करता है जो गतिशील वातावरण में चलते हुए छेदों में मिलीमीटर-सटीक पेग-इन-होल इंसर्शन को सक्षम करने के लिए फाउंडेशन मॉडल से एसिंक्रोनस विजुअल फीडबैक को हाई-फ्रीक्वेंसी फोर्स कंट्रोल के साथ फ्यूज करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक कारखाने के फर्श की शांत, नियंत्रित दुनिया में, एक रोबोटिक हाथ सटीकता का एक चमत्कार हो सकता है। यह एक पेंच (screw) को उठा सकता है और उसे एक छेद में इतनी स्थिरता के साथ लगा सकता है जो किसी मानव हाथ के बस की बात नहीं है, बशर्ते कि वह छेद स्थिर रहे। यह 'स्टैटिक मैनिपुलेशन' (स्थिर हेरफेर) का क्षेत्र है, जहाँ लक्ष्य स्थिर रहता है, और रोबोट की चुनौती केवल एक निश्चित बिंदु तक पहुँचने की होती है। लेकिन वास्तविक दुनिया शायद ही कभी इतनी स्थिर होती है। कल्पना कीजिए कि एक कार का हिस्सा कन्वेयर बेल्ट पर चल रहा है, या एक वाहन पर लगा रोबोट ऊबड़-खाबड़ जमीन पर चल रहा है। इन गतिशील वातावरणों में, लक्ष्य गतिमान होता है, और रोबोट को न केवल छेद को खोजना होता है, बल्कि उसका पीछा भी करना होता है, और वह भी एक तंग जगह में पेग (peg) को फिट करने के लिए आवश्यक मिलीमीटर-स्तर की सटीकता बनाए रखते हुए। यह एक मौलिक संघर्ष है: अत्यधिक सटीकता की आवश्यकता और चलते हुए लक्ष्य की अराजकता के बीच टकराव। पारंपरिक रोबट यहाँ संघर्ष करते हैं क्योंकि वे या तो छेद कहाँ है यह देखने के लिए धीमी, उच्च-स्तरीय दृष्टि (vision) पर निर्भर करते हैं, या संपर्क के क्षण को महसूस करने के लिए तेज़, स्थानीय स्पर्श सेंसर (touch sensors) पर। दृष्टि अचानक बदलावों पर प्रतिक्रिया देने के लिए बहुत धीमी है, जबकि केवल स्पर्श ही सुचारू पथ की योजना बनाने के लिए पर्याप्त दूर तक नहीं देख सकता।
न्यूयॉर्क यूनिवर्सिटी और जनरल मोटर्स के शोधकर्ताओं ने इस समस्या को हल करने का एक नया तरीका विकसित किया है, जिससे एक ऐसा सिस्टम बनाया गया है जो रोबट को उल्लेखनीय सफलता के साथ एक चलते हुए छेद में पेग डालने की अनुमति देता है। वे अपनी विधि को 'विज़न-फोर्स एडमिटेंस लर्निंग' (Vision-Force Admittance Learning) कहते हैं। रोबोट को देखने और महसूस करने के बीच चयन करने के लिए मजबूर करने के बजाय, यह सिस्टम इन दोनों इंद्रियों को एक विशिष्ट, असिंक्रोनस (asynchronous) लय में मिलकर काम करने देता है। रोबोट कैमरा का उपयोग यह अनुमान लगाने के लिए करता है कि छेद कहाँ है, लेकिन क्योंकि कैमरे धीमे होते हैं, इस जानकारी को एक सख्त कमांड के बजाय एक सामान्य मार्गदर्शक के रूप में माना जाता है। साथ ही, रोबोट अपनी कलाई पर एक फोर्स सेंसर (बल सेंसर) पर निर्भर करता है, जो छेद में पेग के टकराने के भौतिक दबाव पर प्रति सेकंड सैकड़ों बार प्रतिक्रिया देता है। नवाचार इस बात में निहित है कि इन दो डेटा स्ट्रीम को कैसे जोड़ा जाता है। तेज़ फोर्स सेंसर तत्काल, क्षणिक समायोजन करता है जो पेग को संरेखित रखने के लिए आवश्यक है, जबकि धीमा कैमरा छेद की समग्र स्थिति के बारे में रोबोट की समझ को अपडेट करता है। यह विज़ुअल अपडेट एक कोमल सुधार, या 'रेगुलराइज़र' (regularizer) के रूप में कार्य करता है, जो रोबोट को पथ से भटकने से रोकता है, भले ही फोर्स सेंसर सम्मिलन (insertion) के दौरान होने वाले तीव्र, अराजक कंपन को संभाल रहा हो।
इसका परीक्षण करने के लिए, टीम ने एक वास्तविक दुनिया का प्रयोग बनाया जिसमें एक रोबोटिक आर्म शामिल थी जो एक पेग पकड़े हुए थी और एक बेस था जिसमें एक छेद था जो हिल सकता था। उन्होंने एक विशेष प्रकार के फास्टनर का उपयोग किया, एक 'पुशनट' (pushnut) जिसमें लचीली पंखुड़ियाँ (fins) थीं, जो औद्योगिक असेंबली में आम है। सेटअप में दृश्य को देखने के लिए एक कैमरा और संपर्क को महसूस करने के लिए एक फोर्स सेंसर शामिल था। उन्होंने रोबोट का तीन अलग-अलग परिदृश्यों में परीक्षण किया: एक छेद जो स्थिर था, एक छेद जो सीधी रेखा में चल रहा था, और एक छेद जो एक मोटर चालित स्लाइडर पर तीन आयामों (3D) में चल रहा था। परिणाम चौंकाने वाले थे। जब छेद चल रहा था, तो केवल दृष्टि पर निर्भर रहने वाला रोबोट अधिकांश समय पेग डालने में विफल रहा, जबकि केवल फोर्स सेंसर पर निर्भर रहने वाला रोबोट भी संघर्ष कर रहा था, अक्सर रास्ता भटक जाता था या बहुत अधिक बल लगा देता था। हालाँकि, नया सिस्टम, जिसने दोनों इंद्रियों को मिलाया था, सबसे कठिन तीन-आयामी गतिशील परिदृश्य में 80 प्रतिशत सफलता दर प्राप्त की। सीधी रेखा में चलने वाले परिदृश्य में, इसने हर बार सफलता प्राप्त की।
शोधकर्ताओं ने पाया कि इस सफलता की कुंजी केवल दोनों सेंसरों का होना नहीं था, बल्कि यह था कि उन्हें कैसे समयबद्ध (timed) किया गया था। उन्होंने अपनी विधि की तुलना उस संस्करण से की जहाँ विज़न और फोर्स डेटा को एक-दूसरे का इंतज़ार करने के लिए मजबूर किया गया था, एक ऐसी प्रक्रिया जिसने सब कुछ धीमा कर दिया था। तेज़ फोर्स सेंसर को गति संचालित करने देने और धीमे विज़न सिस्टम को बैकग्राउंड में लक्ष्य को अपडेट करने देने से, रोबोट भौतिक संपर्क के प्रति तुरंत प्रतिक्रिया दे सका बिना अपनी वैश्विक दिशा की समझ खोए। उन्होंने यह भी खोजा कि सिस्टम गलतियों से उबर सकता था। यदि कैमरे ने छेद का पीछा करना छोड़ दिया, तो रोबोट सुरक्षित रूप से पीछे हट जाता और विज़न के वापस आने तक प्रतीक्षा करता। यदि पेग फंस गया या फोर्स रीडिंग ने खराब कोण का संकेत दिया, तो रोबोट पेग को उठाकर फिर से प्रयास कर सकता था। उबरने की इस क्षमता ने सिस्टम को चलते हुए लक्ष्य की अप्रत्याशित प्रकृति को संभालने के लिए पर्याप्त मजबूत बना दिया।
अध्ययन ने यह भी पता लगाया कि विभिन्न सेटिंग्स ने परिणाम को कैसे प्रभावित किया। उन्होंने पाया कि कैमरे की स्थिति और फोर्स सेंसर के फीडबैक पर भरोसा करने के बीच का संतुलन महत्वपूर्ण था। यदि रोबोट कैमरे पर बहुत अधिक भरोसा करता, तो वह पेग के छेद के किनारे टकराने की भौतिक वास्तविकता को अनदेखा कर देता। यदि वह फोर्स सेंसर पर बहुत अधिक भरोसा करता, तो छेद के हिलने पर वह बिना किसी दिशा के भटक जाता। एक मध्य मार्ग खोजकर, रोबंत ने सीखा कि कैमरे का उपयोग सही पथ पर रहने के लिए और फोर्स सेंसर का उपयोग पेग को अंदर खिसकाने के लिए आवश्यक सूक्ष्म समायोजन करने के लिए कैसे किया जाए। यह दृष्टिकोण तब भी काम आया जब लक्ष्य जटिल, गैर-रैखिक (non-linear) तरीकों से चल रहा था, जिससे सिद्ध हुआ कि सिस्टम सरल, अनुमानित गति से कहीं अधिक संभाल सकता है।
अंततः, यह कार्य प्रदर्शित करता है कि रोबोट को ऐसे वातावरण में नाजुक कार्य करने के लिए सिखाया जा सकता है जो पूरी तरह से स्थिर नहीं हैं। कैमरे के धीमे, व्यापक दृश्य को फोर्स सेंसर के तेज़, संवेदनशील स्पर्श के साथ जोड़कर, शोधकर्ताओं ने एक ऐसी विधि बनाई है जो इस तरह नकल करती है जैसे मनुष्य किसी चलती हुई वस्तु को संभालते हैं: जाने के लिए अपनी आँखों का उपयोग करना और महसूस करने के लिए अपने हाथों का। यह सिस्टम यह नहीं मानता कि रोबोट शुरुआत से ही पूर्ण है; यह त्रुटियों की अनुमति देता है और उन्हें वास्तविक समय में सुधारता है। हालाँकि वर्तमान सिस्टम यह मान लेता है कि रोबोट पहले से ही पेग उठा चुका है, लेकिन चलते हुए छेद में इसे डालने की क्षमता गतिशील, वास्तविक दुनिया के परिवेश में—असेंबली लाइनों से लेकर मोबाइल वाहनों तक—मानव के साथ काम करने वाले रोबोटों की दिशा में एक महत्वपूर्ण कदम है, बिना वातावरण के उनके लिए रुकने की प्रतीक्षा किए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।