← नवीनतम पेपर
💻 computer science

GUIDER: Evaluating Goal-Free Human Intent Inference for Teleoperated Manipulation on Real-Robot Data

यह शोध पत्र GUIDER का मूल्यांकन प्रस्तुत करता है, जो टेलीऑपरेटेड रोबोटिक मैनिपुलेशन में मानव इरादे के अनुमान के लिए एक लक्ष्य-मुक्त संभाव्य ढांचा (goal-free probabilistic framework) है, जिसने वास्तविक-रोबोट डेटा का उपयोग करके विविध सहायता परिदृश्यों में उच्च भविष्यवाणी सटीकता, स्थिरता और वास्तविक समय प्रदर्शन का सफलतापूर्वक प्रदर्शन किया है।

मूल लेखक: Nicholas Kenny, Cesar Alan Contreras, Basile Ouedraogo, Rustam Stolkin, Manolis Chiou, Maria Kyrarini

प्रकाशित 2026-08-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nicholas Kenny, Cesar Alan Contreras, Basile Ouedraogo, Rustam Stolkin, Manolis Chiou, Maria Kyrarini

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक मानव ऑपरेटर एक सुरक्षित कमरे में बैठा है, जो एक खतरनाक या कठिन वातावरण से दूर है, और एक रोबोटिक हाथ को एक नाजुक कार्य करने के लिए नियंत्रित करने की कोशिश कर रहा है। ऑपरेटर सीधे रोबोट को नहीं देख सकता; वह केवल स्क्रीन पर वीडियो फीड देख सकता है। रोबोट को चलाने के लिए, उसे लगातार अपने उच्च-स्तरीय इरादे—जैसे कि "वह दवा की बोतल उठाओ"—को निम्न-स्तरीय जॉयस्टिक कमांड में बदलना पड़ता है, और इस दौरान उसे यह भी ध्यान रखना होता है कि रोबोट कहाँ है और वह क्या कर रहा है। यह मानसिक तालमेल बिठाने का प्रयास थका देने वाला हो सकता है और काम को धीमा कर सकता है, विशेष रूप से परमाणु सफाई या चिकित्सा सहायता जैसी उच्च-जोखिम वाली स्थितियों में। वैज्ञानिकों ने लंबे समय से एक तरीका खोजने की कोशिश की है जिससे बोझ साझा किया जा सके: एक ऐसा सिस्टम जो यह अनुमान लगा सके कि इंसान का अगला इरादा क्या है और मदद की पेशकश कर सके, लेकिन केवल तभी जब वह सुरक्षित होने के लिए पर्याप्त आश्वस्त हो। मुख्य चुनौती मशीन को इंसान का मन पढ़ने के लिए सिखाना है, बिना उसे पहले से लक्ष्य बताए, केवल रोबोट के हाथ की गति और उसके कैमरे के दृश्य का उपयोग करके यह पता लगाना कि वह किस वस्तु की ओर बढ़ रहा है।

शोधकर्ताओं की एक टीम ने एक वास्तविक भौतिक रोबोट पर GUIDER नामक सिस्टम का परीक्षण करके इस साझा नियंत्रण (shared control) को वास्तविकता बनाने की दिशा में एक महत्वपूर्ण कदम उठाया है। हालांकि इस सिस्टम का परीक्षण पहले कंप्यूटर सिमुलेशन में किया गया था, लेकिन यह अध्ययन वास्तविक हार्डवेयर पर इसका पहला मूल्यांकन है, जिसमें चाय बनाना, दवा लाना और विभिन्न घरेलू वस्तुओं को संभालने जैसे रोजमर्रा के कार्यों को करने के लिए एक मानव ऑपरेटर द्वारा नियंत्रित रोबोटिक हाथ के रिकॉर्ड किए गए डेटा का उपयोग किया गया है। शोधकर्ता यह जानना चाहते थे कि क्या सिस्टम की इरादा समझने की क्षमता वास्तविक दुनिया की अव्यवस्थित और अप्रत्याशित प्रकृति का सामना कर पाएगी, जहाँ कैमरों में शोर (noise) होता है और वस्तुएं एक आदर्श डिजिटल मॉडल की तुलना में अलग दिखती हैं। उन्होंने इस सिस्टम को एक फ्रैंका एमिका पांडा (Franka Emika Panda) रोबोटिक आर्म पर तैनात किया, जो एक स्टीरियो डेप्थ कैमरा से लैस है जो दुनिया को तीन आयामों में देखता है, और एक मानव ऑपरेटर को बिना किसी स्वचालित सहायता के कुछ हेरफेर कार्यों को पूरा करने के लिए कहा। रोबोट ने बस हर हरकत और वीडियो के हर फ्रेम को देखा और रिकॉर्ड किया।

एक बार डेटा एकत्र हो जाने के बाद, शोधकर्ताओं ने इसे GUIDER सिस्टम के माध्यम से फिर से चलाया, जिससे मूल गतिविधियों का सटीक समय बना रहा। सिस्टम का काम वीडियो और रोबोट के मोशन इतिहास को देखकर यह अनुमान लगाना था कि इंसान किस वस्तु को पकड़ने की कोशिश कर रहा है। वास्तविक दुनिया में इसे सफल बनाने के लिए, टीम ने कई व्यावहारिक सुधार किए। उन्होंने सिस्टम को मेज की सतह को अनदेखा करना सिखाया, और केवल उन वस्तुओं पर ध्यान केंद्रित किया जो वास्तव में उसके ऊपर रखी थीं। उन्होंने एक "ग्रैस्पिंग मोड" (पकड़ने का मोड) भी पेश किया, जिसने सिस्टम का ध्यान केवल एक वस्तु की पहचान करने से हटाकर उस विशिष्ट स्थान को खोजने पर केंद्रित कर दिया जहाँ रोबोट का हाथ वास्तव में पकड़ बना सके। चाय की थैली के केंद्र का अनुमान लगाने के बजाय, सिस्टम ने यह सीखना शुरू किया कि ग्रिपर कहाँ से पकड़ बना सकता है। यह अंतर महत्वपूर्ण है क्योंकि यह जानना कि वस्तु क्या है, हमेशा रोबोट को यह नहीं बताता कि उसके साथ कैसे इंटरैक्ट करना है।

परिणामों ने दिखाया कि सिस्टम मानव मन को पढ़ने में उल्लेखनीय रूप से प्रभावी था। बीस अलग-अलग चरणों में तीन विशिष्ट परिदृश्यों के दौरान, सिस्टम ने हर एक मामले में लक्षित वस्तु की सही पहचान की। इससे भी महत्वपूर्ण बात यह है कि इसने उपयोगी होने के लिए पर्याप्त समय के साथ ऐसा किया। औसतन, सिस्टम ने गति शुरू होने के 3.7 सेकंड के भीतर एक आत्मविश्वासपूर्ण भविष्यवाणी की। कई मामलों में, यह मानव द्वारा वस्तु को पकड़ने के प्रयास से लगभग पचास सेकंड पहले ही हो गया। यह समय का अंतर अत्यंत महत्वपूर्ण है; इसका अर्थ है कि यदि एक साझा-स्वायत्तता (shared-autonomy) प्रणाली सक्रिय होती, तो वह वस्तु तक पहुँचने से बहुत पहले ही सहायता प्रदान कर सकती थी या रोबोट की गति को स्थिर कर सकती थी। सिस्टम अपनी भविष्यवाणियों में स्थिर रहा, और पहली बार एक आत्मविश्वासपूर्ण अनुमान लगाने के बाद 96.4% समय तक सही रहा। सबसे कठिन परिदृश्य में भी, जहाँ रोबोट को छोटी, दिखने में समान चाय की थैलियों को उठाना था, सिस्टम ने सही लक्ष्य को अपनी संभावनाओं की सूची में बनाए रखा, हालांकि अंतिम उत्तर पर बैठने में थोड़ा अधिक समय लगा।

अध्ययन ने यह भी उजागर किया कि सिस्टम कहाँ संघर्ष करता है और कहाँ उत्कृष्ट प्रदर्शन करता है। जब वस्तुएं बड़ी और स्पष्ट थीं, जैसे कि पानी का जग या दवा की बोतल, तो सिस्टम तेज़ और आत्मविश्वासी था। हालाँकि, जब वस्तुएं छोटी, बिखरी हुई या एक जैसी दिखने वाली थीं, तो सिस्टम को दृश्य जानकारी को संसाधित करने में अधिक समय लगा। सबसे समय लेने वाला हिस्सा इरादे का अनुमान लगाने के लिए उपयोग की जाने वाली गणितीय गणना नहीं थी, बल्कि वस्तुओं और उनके आकार को पहचानने के लिए आवश्यक कंप्यूटर विजन का कार्य था। सिस्टम ने वस्तुओं को पृष्ठभूमि से अलग करने के लिए कैमरा फीड का विश्लेषण करने में सबसे अधिक समय बिताया, जो कि एक कठिन कार्य है जब वस्तुएं एक-दूसरे के करीब हों या उनके रंग समान हों। इन चुनौतियों के बावजूद, सिस्टम ने कभी भी सही लक्ष्य को नहीं खोया, जिससे यह सिद्ध हुआ कि अंतर्निहित तर्क एक स्वच्छ सिमुलेशन से शोर वाले वास्तविक वातावरण में भी जीवित रह सकता है।

यह कार्य यह प्रदर्शित करता है कि एक ऐसा रोबोट बनाना संभव है जो बिना किसी स्पष्ट लक्ष्य के बताए, वास्तविक समय में मानव इरादे को समझ सके। रोबोट के देखने और इंसान के हाथ की गति को मिलाकर, सिस्टम उच्च सटीकता के साथ अगले कदम की भविष्यवाणी कर सकता है। शोधकर्ताओं ने पाया कि सिस्टम विश्वसनीय रूप से भौतिक हार्डवेयर पर काम कर सकता है, बशर्ते कैमरा सावधानीपूर्वक कैलिब्रेटेड हो और रोबोट को सुरक्षित गति से चलाया जाए। हालांकि इस अध्ययन में एक सक्रिय रूप से मदद करने वाले सिस्टम का परीक्षण नहीं किया गया, लेकिन डेटा सुझाव देता है कि ऐसा सिस्टम बनाया जा सकता है। देखे गए समय अंतराल—कुछ मामलों में लगभग पचास सेकंड—यह संकेत देते हैं कि एक रोबोट काम को आसान या सुरक्षित बनाने के लिए हस्तक्षेप कर सकता है, बिना कभी भी इंसान से नियंत्रण छीने। आगे का रास्ता इस भविष्य कहने की क्षमता को वास्तविक सहायता व्यवहारों से जोड़ने में है, यह सुनिश्चित करना कि जब रोबोट अनुमान लगाए कि इंसान क्या चाहता है, तो वह उस अनुमान पर कार्य कर सके ताकि कुर्सी पर बैठे व्यक्ति के लिए काम सहज और कम थकाऊ हो सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →