← नवीनतम पेपर
⚡ electrical engineering

From Perception to Assistance: Open-Vocabulary Shared Autonomy for Robotic Manipulation

यह शोध पत्र रोबोटिक मैनिपुलेशन के लिए एक ओपन-वोकैबुलरी शेयर्ड ऑटोनॉमी फ्रेमवर्क प्रस्तुत करता है जो पहनने योग्य उपकरणों के बिना जेस्चर कंट्रोल, विजन-लैंग्वेज टारगेट ग्राउंडिंग, और जीपीयू-एक्सेलेरेटेड मॉडल-प्रेडिक्टिव कंट्रोल को जोड़ता है ताकि ऑपरेटरों को अव्यवस्थित औद्योगिक वातावरण में सटीक, टकराव-मुक्त ग्रैस्प प्राप्त करने में सहायता मिल सके।

मूल लेखक: Murilo Vinicius da Silva, Ricardo V. Godoy, Juliano Negri, Gustavo J. G. Lahr, Ranulfo Bezerra, Marcelo Becker

प्रकाशित 2026-07-21
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Murilo Vinicius da Silva, Ricardo V. Godoy, Juliano Negri, Gustavo J. G. Lahr, Ranulfo Bezerra, Marcelo Becker

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप मोटे सर्दियों के दस्ताने पहनकर, एक डगमगाती सीढ़ी पर खड़े होकर, और एक धुंधली खिड़की से सुई में धागा पिरोने की कोशिश कर रहे हैं। दूर से एक विशाल रोबोटिक हाथ को नियंत्रित करना लगभग ऐसा ही महसूस होता है। यह टेलीऑपरेशन (teleoperation) की दुनिया है, जहाँ एक मानव ऑपरेटर कैमरों और जॉयस्टिक्स का उपयोग करके एक मशीन का मार्गदर्शन करता है। समस्या यह है कि हमारी आँखें और मस्तिष्क स्क्रीन के माध्यम से गहराई (depth) का सटीक अंदाजा लगाने में बहुत अच्छे नहीं होते, और औद्योगिक वातावरण अक्सर पाइपों, दीवारों और अन्य बाधाओं से भरा होता है जिनसे टकराने का खतरा बना रहता है।

इसे ठीक करने के लिए, वैज्ञानिकों ने शेयर्ड ऑटोनॉमी (shared autonomy) विकसित की है। इसे एक "को-पायलट" के रूप में सोचें। इसमें इंसान अकेले सब कुछ करने के बजाय, रोबोट का कंप्यूटर चिप मदद के लिए बीच में आता है। यह हाथ को दीवार से दूर ले जाने या लक्ष्य की ओर धकेलने में मदद कर सकता है, लेकिन नियंत्रण अभी भी इंसान के हाथ में ही रहता है। यह शोध पत्र इस को-पायलट सिस्टम के एक नए, स्मार्ट संस्करण के बारे में है, जिसे विशेष रूप से उन रोबोटों के लिए डिज़ाइन किया गया है जो चल-फिर सकते हैं (जैसे चार पैरों वाले कुत्ते) और वास्तविक दुनिया के अस्त-व्यस्त कारखानों में नाजुक कार्य कर सकते हैं।


रोबोट कुत्तों के लिए "स्मार्ट को-पायलट"

इस रोबोट से मिलिए: एक चार पैरों वाली मशीन (जैसे बोस्टन डायनेमिक्स स्पॉट) जिसकी पीठ पर एक लंबा, कुशल हाथ लगा हुआ है। इसका काम क्या है? एक अव्यवस्थित औद्योगिक स्थल में चलना, एक विशिष्ट वाल्व या उपकरण को ढूँढना, और उसे घुमाना या उठाना। चुनौती क्या है? ऑपरेटर दूर बैठा है, और वह कैमरा फीड के माध्यम से रोबلة को देख रहा है जो गहराई का बोध (depth perception) कठिन बना देता है। यदि ऑपरेटर एक वाल्व घुमाने की कोशिश करता है, तो वह अनजाने में रोबोट के हाथ को पास के पाइप से टकरा सकता है क्योंकि वह देख नहीं पाता कि वह वास्तव में कितना करीब है।

यह शोध पत्र एक ऐसे सिस्टम को पेश करता है जो रोबोट के हाथ के लिए एक सहायक, अदृश्य मार्गदर्शक के रूप में कार्य करता है। यह तीन महाशक्तियों को जोड़ता है: बिना मार्कर के देखना, भाषा को समझना, और कोमल स्टीयरिंग (gentle steering)

1. कोई दस्ताने नहीं, कोई कैलिब्रेशन नहीं, बस आप

आमतौर पर, अपने शरीर से रोबोट को नियंत्रित करने के लिए, आपको सेंसर वाले विशेष सूट पहनने पड़ते हैं या एक ऐसे कैमरे के सामने खड़ा होना पड़ता है जिसे आपकी ऊंचाई के अनुसार सेट (calibrate) किया गया हो। यह नया सिस्टम कहता है, "शुक्रिया, इसकी ज़रूरत नहीं।" यह ऑपरेटर की स्वाभाविक गतिविधियों को देखने के लिए एक मानक 3D कैमरा (RGB-D) का उपयोग करता है।

कल्पना कीजिए कि कैमरा एक बहुत ही चौकस दोस्त है जो आपके कंधों, कूल्हों और कलाइयों पर नज़र रखता है। यह वास्तविक समय में आपके शरीर का एक मानसिक मानचित्र बनाता है। यदि आप अपना दाहिना हाथ आगे बढ़ाते हैं, तो रोबोट का हाथ भी आगे बढ़ता है। यदि आप अपनी कलाई घुमाते हैं, तो रोबोट का ग्रिपर भी घूमता है। यह सिस्टम आपके हाथ की लंबाई का भी तुरंत पता लगा लेता है, ताकि यह जान सके कि रोबोट के आकार के अनुरूप आपकी गतिविधियों को कितना स्केल करना है। कोई सेटअप नहीं, कोई मार्कर नहीं, बस आप और रोबोट तालमेल में चलते हैं।

2. "हे रोबोट, उस व्हील वाल्व को पकड़ो"

अतीत में, रोबोट को यह बताना कि क्या पकड़ना है, कठिन था। आपको किसी विशिष्ट वस्तु की ओर इशारा करना पड़ता था या किसी कोड का उपयोग करना पड़ता था। यह सिस्टम आपको प्राकृतिक भाषा (natural language) का उपयोग करने की अनुमति देता है। ऑपरेटर बस कह सकता है (या टाइप कर सकता है), "व्हील वाल्व (Wheel valve)"।

यहाँ जादू शुरू होता है: रोबोट एक "विज़न-लैंग्वेज मॉडल" (सोचिए एक ऐसा रोबोट दिमाग जो एक साथ पढ़ और देख सकता है) का उपयोग करता है ताकि कैमरा फीड को देखकर "व्हील वाल्व" को ढूँढा जा सके। एक बार जब वह इसे पहचान लेता है, तो वह केवल यह नहीं कहता कि "मैंने इसे देख लिया," बल्कि वह स्थान पर एक सटीक 3D लक्ष्य बिंदु बनाता है, जैसे कि एक डिजिटल बुल्सआई (bullseye)। इससे भी बेहतर, यह उस वाल्व को ट्रैक करता रहता है, जिससे यह सुनिश्चित होता है कि रोबोट के हिलने-डुलने पर भी वह लक्ष्य से न भटके, भले ही ऑपरेटर का दृश्य बाधित हो जाए।

3. अदृश्य चुंबकीय क्षेत्र

यह इस शोध पत्र की सबसे शानदार तकनीक है। जैसे ही रोबोट का हाथ लक्ष्य के करीब आता है, एक अदृश्य "पोटेंशियल फील्ड" (एक कोमल चुंबकीय बल की तरह) सक्रिय हो जाता है।

कल्पित कीजिए कि आप पार्किंग की जगह की ओर कार चला रहे हैं। आप स्टीयरिंग चला रहे हैं, लेकिन एक हल्का सा हवा का झोंका आपकी कार को पार्किंग के केंद्र की ओर धकेल रहा है ताकि आप उसे बिल्कुल सही ढंग से पार्क कर सकें। यह सिस्टम यही करता है।

  • नियंत्रण अभी भी आपके पास है: यदि आप बाईं ओर जाना चाहते हैं, तो रोबोट बाईं ओर जाएगा। सिस्टम कभी भी आपसे स्टीयरिंग नहीं छीनता।
  • मदद सूक्ष्म है: जैसे ही आप लक्ष्य के 0.4 मीटर (लगभग 1.3 फीट) के भीतर आते हैं, सिस्टम आपके कमांड को "व्हील वाल्व" के बिल्कुल केंद्र की ओर धीरे से खींचता है। यह धुंधले कैमरा दृश्य के कारण होने वाली छोटी-मोटी गलतियों को सुधारता है।
  • परिणाम: आप अनुमानित दिशा में लक्ष्य साध सकते हैं, और रोबोट का "को-पायलट" अंतिम पहुंच को सुचारू बनाता है, जिससे यह सुनिश्चित होता है कि ग्रिपर ठीक वहीं पहुंचे जहाँ उसे होना चाहिए।

4. "टकराव से बचाव" वाला कवच

जब रोबोट चल रहा होता है, तो वह अपने कैमरों का उपयोग करके कमरे का लगातार 3D मानचित्र बनाता रहता है। उसे पता होता है कि दीवारें, पाइप और ट्रैफिक कोन कहाँ हैं। इस शोध पत्र ने इसका परीक्षण तब किया जब ऑपरेटर ने जानबूझकर रोबोट के हाथ को एक ट्रैफिक कोन से टकराने की कोशिश की।

परिणाम? ऑपरेटर का कमांड सीधे कोन की ओर गया, लेकिन रोबोट का हाथ उससे 18 सेमी (लगभग 7 इंच) दूर रुक गया। सिस्टम ने एक 'फोर्सफील्ड' की तरह काम किया, जो बाधा के चारों ओर रास्ता मोड़ देता है जबकि अभी भी ऑपरेटर की सामान्य दिशा का पालन करने की कोशिश करता है। इसने साबित किया कि भले ही इंसान गलती करे, रोबोट का सुरक्षा मस्तिष्क दुर्घटना को रोकता है।

5. "ऑटो-पायलट" बटन

कभी-कभी, ऑपरेटर स्टीयरिंग करते-करते थक जाता है। एक बार जब वे लक्ष्य को पा लेते हैं और उसकी पुष्टि कर लेते हैं, तो वे ऑटोनॉमस मोड (autonomous mode) पर स्विच करने के लिए दो उंगलियां उठा सकते हैं। इसके बाद रोबोट पूरी तरह से नियंत्रण ले लेता है, और काम को पूरा करने के लिए (जैसे वाल्व को पकड़ना) उन्हीं सुरक्षा नियमों और उसी 3D लक्ष्य का उपयोग करता है। यदि ऑपरेटर वापस नियंत्रण लेना चाहता है, तो वह बस एक उंगली उठाता है।

हमने क्या पाया?

शोधकर्ताओं ने इस सिस्टम का परीक्षण एक वास्तविक रोबोट पर एक अव्यवस्थित औद्योगिक सेटिंग में दो मुख्य कार्यों के साथ किया: एक बड़े औद्योगिक वाल्व को घुमाना और एक पावर ड्रिल को उठाना।

  • "पूरी टीम" की जीत: जब उन्होंने पूरे सिस्टम (भाषा लक्ष्य + कोमल स्टीयरिंग + टकराव कवच) का उपयोग किया, तो रोबोट दोनों कार्यों में 100% सफल रहा (दोनों कार्यों के लिए 5 में से 5 बार)।
  • "आधी टीम" की विफलता: जब उन्होंने टकराव कवच (crash shield) को हटाया, तो रोबोट बाधाओं से टकरा गया। जब उन्होंने कोमल स्टीयरिंग को हटाया, तो कैमरा दृश्य सटीक न होने के कारण रोबोट लक्ष्य से चूक गया। इससे पता चला कि दोनों हिस्से आवश्यक हैं; वे अलग-अलग समस्याओं को ठीक करते हैं।
  • आंकड़े: सिस्टम बहुत सटीक था। रोबोट के हाथ ने मानव हाथ का अनुसरण किया और औसत त्रुटि केवल 59 मिमी (लगभग 2.3 इंच) रही। टकराव परीक्षणों में, ऑपरेटर ने हाथ को बाधा में 6 सेमी धकेलने की कोशिश की, लेकिन रोबोट ने हाथ को खतरे से कम से कम 18 सेमी दूर रखा।

निष्कर्ष

यह शोध पत्र यह दावा नहीं करता कि इसने रोबोटिक्स की हर समस्या को हल कर दिया है। यह दिखाता है कि एक सरल, बिना मार्कर वाले कैमरा इंटरफ़ेस को भाषा समझने वाले और गलतियों को सुधारने वाले स्मार्ट "को-पायलट" के साथ जोड़कर, हम रोबोटों को वास्तविक दुनिया के कारखानों में बेहतर काम करने के योग्य बना सकते हैं। यह ऐसा रोबोट नहीं है जो पूरी तरह से अपने आप सोचता है, और न ही ऐसा रोबोट है जो केवल आदेशों का अंधाधुंध पालन करता है। यह एक साझेदारी है जहाँ इंसान इरादा प्रदान करता है ("जाओ उस वाल्व को पकड़ो"), और रोबोट टकराने से बचने और सटीक रूप से पहुंचने जैसे कठिन विवरणों को संभालता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →