Attune: A Self-Annotation Tool for Understanding Robot Operator Attention Profiles
यह शोध पत्र Attune को प्रस्तुत करता है, जो एक स्व-एनोटेशन टूल है जो ऑपरेटर की दृष्टि (आई गेज़) का विश्लेषण करने और अटेंशन प्रोफाइल उत्पन्न करने के लिए एआई का लाभ उठाता है, जिससे मल्टी-रोबोट पर्यवेक्षण परिदृश्यों में मानव ध्यान को प्रभावी ढंग से प्रबंधित करने के लिए रोबोट व्यवहारों को कैलिब्रेट करने हेतु अनुभवजन्य मार्गदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक अंतरिक्ष यान के कप्तान हैं, लेकिन आप केवल एक जहाज का संचालन नहीं कर रहे हैं, बल्कि व्यस्त शहर में पिज्जा डिलीवर करने वाले छोटे, स्वायत्त ड्रोन के एक पूरे बेड़े की निगरानी कर रहे हैं। आपका काम नियंत्रण कक्ष में स्क्रीनों की एक दीवार के सामने बैठना है, जिनमें से प्रत्येक एक अलग ड्रोन का दृश्य दिखा रहा है। यदि कोई ड्रोन कहीं फंस जाता है या उसे कोई अजीब बाधा दिखाई देती है, तो आपको तुरंत इसे नोटिस करना होगा और उसे बताना होगा कि उसे क्या करना है। यह मल्टी-रोबोट सुपरविज़न (बहु-रोबोट पर्यवेक्षण) की दुनिया है। लेकिन पेचीदा हिस्सा यह है कि आपके मस्तिष्क की ध्यान केंद्रित करने की क्षमता सीमित है। यदि आप बहुत देर तक किसी उबाऊ ड्रोन को देखते रहते हैं, तो आप किसी दूसरी स्क्रीन पर हो रही संकट की स्थिति को मिस कर सकते हैं। यदि आप बहुत अधिक इधर-उधर कूदते हैं, तो आप थक जाएंगे और भ्रमित हो जाएंगे। वैज्ञानिक इसे "ऑपरेटर अटेंशन" (संचालक का ध्यान) कहते हैं, और वे यह पता लगाने की कोशिश कर रहे हैं कि विभिन्न लोग इन स्क्रीनों को कैसे देखते हैं ताकि वे बेहतर नियंत्रण कक्ष बना सकें। बड़ा सवाल यह है: हम ऐसे रोबोट व्यवहारों को कैसे डिजाइन करें जो जरूरत पड़ने पर आपका ध्यान खींचें, लेकिन चीजें शांत होने पर आपको आराम करने दें?
यहाँ आता है Attune, जॉर्ज मेसन यूनिवर्सिटी के शोधकर्ताओं द्वारा बनाया गया एक नया टूल। Attune को एक "माइंड-रीडिंग मिरर" (मन पढ़ने वाला दर्पण) के रूप में समझें। केवल यह अनुमान लगाने के बजाय कि एक रोबोट ऑपरेटर किसी विशिष्ट स्क्रीन को क्यों देखता है, Attune ऑपरेटर को खुद को रोबोट देखते हुए देखने वाला एक वीडियो दिखाता है, और फिर पूछता है, "हे, तुम्हारी आँखें अभी उस स्क्रीन पर क्यों गईं?" यह एक स्पोर्ट्स गेम के रीप्ले को देखने जैसा है, लेकिन यहाँ आप खिलाड़ियों की चालों का विश्लेषण करने के बजाय, अपनी ही आदतों को समझने के लिए अपनी आँखों का विश्लेषण कर रहे हैं। शोधकर्ताओं ने इस टूल को यह समझने के लिए बनाया है कि हर ऑपरेटर अलग होता है; जो चीज़ एक व्यक्ति को किसी रोबोट की ओर देखने के लिए प्रेरित करती है, वह दूसरे व्यक्ति को उसे अनदेखा करने पर मजबूर कर सकती है। इन व्यक्तिगत "अटेंशन प्रोफाइल्स" (ध्यान प्रोफाइल) को जानकर, डिजाइनर अंततः रोबोट के व्यवहार को उस विशिष्ट व्यक्ति के अनुरूप ढाल सकते हैं जो कंट्रोल चेयर पर बैठा है, जिससे पूरा सिस्टम अधिक सुरक्षित और कम तनावपूर्ण बन जाएगा।
समस्या: "बहुत सारी स्क्रीन्स" वाली दुविधा
कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं जहाँ आपको एक साथ छह अलग-अलग कैमरों को देखना है। एक कैमरा रोबोट का सिर दिखाता है, दूसरा उसके ग्रिपर (उसका हाथ) को, और तीसरा छत को। यदि रोबोट एक डिब्बा गिरा देता है, तो आपको इसे तुरंत देखना होगा। लेकिन यदि रोबोट बस धीरे-धीरे चल रहा है, तो आपको उस पर घूरने की आवश्यकता नहीं है। समस्या यह है कि हमें वास्तव में यह नहीं पता कि एक मानव ऑपरेटर यह क्यों तय करता है कि उसे एक कैमरे को देखना है और फिर अचानक दूसरे पर स्विच करना है। क्या यह इसलिए है क्योंकि रोबोट ने कुछ दिलचस्प किया? क्या यह इसलिए है क्योंकि किसी चमकती चीज़ ने उनका ध्यान खींचा? या क्या वे बस बोर हो गए थे?
वर्तमान में, रोबोट डिजाइनरों को अनुमान लगाना पड़ता है। वे शायद ध्यान आकर्षित करने के लिए रोबोट को जोर से बीप करा सकते हैं, लेकिन इससे ऑपरेटर परेशान हो सकता है या बाद में रोबोट को अनदेखा कर सकता है। शोधकर्ता अनुमान लगाने से आगे बढ़ना चाहते थे। वे एक तरीका चाहते थे जिससे ऑपरेटर से पूछा जा सके, "तुमने वहाँ क्यों देखा?" और उसका वास्तविक उत्तर मिल सके। लेकिन यदि आप उनसे जबकि वे रोबोट देख रहे हैं, तब पूछते हैं, तो वे विचलित हो सकते हैं और अपना काम स्वाभाविक रूप से करना बंद कर सकते हैं। इसलिए, उन्हें एक चतुर तरीका चाहिए था जिससे काम को खराब किए बिना बाद में पूछा जा सके।
समाधान: Attune, द "आई-ट्रेस" डिटेक्टिव
शोधकर्ताओं ने Attune नामक एक टूल बनाया है। यह कैसे काम करता है, इसके चरण यहाँ दिए गए हैं:
चरण 1: मूवी नाइट
सबसे पहले, ऑपरेटर दो रोबोटों को कार्य करते हुए (जैसे रसोई साफ करना या गलियारे में खोज करना) देखने के लिए बैठता है। देखते समय, Attune एक आई-ट्रैकिंग कैमरा का उपयोग करके रिकॉर्ड करता है कि उनकी आँखें मिलीसेकंड दर मिलीसेकंड कहाँ देख रही हैं। यह एक हाई-टेक मूवी कैमरा की तरह है जो केवल ऑपरेटर की पुतलियों को फिल्माता है। सिस्टम रिकॉर्ड करता है कि आँखें एक स्क्रीन से दूसरी स्क्रीन पर कब कूदती हैं। इन उछालों को "गेज़ शिफ्ट्स" (दृष्टि परिवर्तन) कहा जाता है।
चरण 2: रीप्ले और "क्यों?"
मूवी खत्म होने के बाद, ऑपरेटर एक विशेष "एनोटेशन" (टिप्पणी) कमरे में जाता है। Attune उन्हें उनके आँखों के उछलने की एक सूची दिखाता है। यह उनके अपने ध्यान का एक 'हाइलाइट रील' जैसा है। ऑपरेटर एक उछाल चुनता है और "रीप्ले" बटन दबाता है। सिस्टम ज़ूम इन करता है, और आँख के उछलने से ठीक पहले और बाद के वीडियो फीड और रोबोट की क्रियाओं को दिखाता है।
फिर, ऑपरेटर को खुद का स्पष्टीकरण देना होता है। Attune दो सरल प्रश्न पूछता है:
- आपने पुराने स्क्रीन को क्यों छोड़ा? (क्या रोबोट रुक गया था? क्या आप बोर हो गए थे?)
- आप नई स्क्रीन पर क्यों पहुँचे? (क्या आपने किसी व्यक्ति को देखा? क्या रोबोट मुसीबत में लग रहा था?)
ऑपरेटर यह भी बता सकता है कि उछाल रिएक्टिव (प्रतिक्रियात्मक - जैसे कुछ अचानक और तेज़ हुआ, एक "बॉटम-अप" खिंचाव) था या प्रोएक्टिव (सक्रिय - उन्होंने जिज्ञासावश चेक करने का निर्णय लिया, एक "टॉप-डाउन" चुनाव)।
चरण 3: पैटर्न डिटेक्टिव (AI की मदद से)
एक बार जब ऑपरेटर कुछ उछालों की व्याख्या कर लेता है, तो Attune एक स्मार्ट कंप्यूटर दिमाग (AI) का उपयोग करके पैटर्न ढूंढता है। यह एक जासूस की तरह है जो नोटिस करता है कि हर बार जब रोबोट एक कप गिराता है, तो ऑपरेटर ग्रिपर कैमरे की ओर देखता है। या शायद हर बार जब रोबोट रुक जाता है, तो वे छत वाले कैमरे को देखते हैं। AI इन स्पष्टीकरणों को एक साथ समूहबद्ध करता है और कहता है, "हे, ऐसा लगता है कि जब भी रोबोट किसी व्यक्ति के पास चलता है, तो आप हेड कैमरा देखते हैं।"
चरण 4: ऑटो-एनोटेशन
अब, टूल और भी शानदार हो जाता है। यह पहले कुछ उछालों से सीखे गए पैटर्न को बाकी वीडियो पर लागू करता है। यह कहता है, "मुझे लगता है कि आपने इस स्क्रीन को इसलिए देखा क्योंकि रोबलेट एक व्यक्ति के पास चल रहा था। क्या यह सही है?" ऑपरेटर को बस "हाँ" या "नहीं" कहना होता है और शायद उत्तर में थोड़ा बदलाव करना होता है। यह इस प्रक्रिया को बहुत तेज़ बना देता है, जिससे एक लंबा, उबाऊ कार्य "पैटर्न पहचानने" के एक त्वरित खेल में बदल जाता है।
चरण 5: पर्सनल प्रोफाइल
अंत में, Attune ऑपरेटर को उनके अपने "अटेंशन प्रोफाइल" का सारांश देता है। यह एक रिपोर्ट कार्ड की तरह है जो कहता है, "आप तब रोबोट के हाथों को देखते हैं जब वह कुछ भारी पकड़े होता है, लेकिन जब रोबोट बस चल रहा होता है, तो आप छत को देखते हैं।" यह प्रोफाइल फिर रोबोट डिजाइनरों को दी जाती है। वे इसका उपयोग ऐसे रोबोट बनाने के लिए कर सकते हैं जो उस विशिष्ट व्यक्ति के सोचने के तरीके से मेल खाते हों।
हमने क्या पाया?
शोधकर्ताओं ने Attune का परीक्षण 12 लोगों के साथ किया जिन्होंने कभी ऐसा टूल इस्तेमाल नहीं किया था। उन्होंने तीन अलग-अलग सेटिंग्स (लिविंग रूम, किचन और हॉलवे) में रोबोट के वीडियो देखे। यहाँ उनकी खोजें हैं:
- हर कोई अलग है: सबसे बड़ी खोज यह है कि कोई भी दो लोग एक जैसे नहीं होते। कुछ लोगों ने सभी छह कैमरा व्यू समान रूप से देखे, जबकि अन्य ने केवल दो या तीन देखे। कुछ लोग बहुत रिएक्टिव थे, जो कुछ भी हिलने पर स्क्रीन की ओर कूद जाते थे। अन्य प्रोएक्टिव थे, जो एक विशिष्ट क्रम में स्क्रीन चेक करते थे। यह सुझाव देता है कि कोई एक "परफेक्ट" रोबोट इंटरफ़ेस मौजूद नहीं है; इसे व्यक्ति के अनुसार कस्टमाइज़ करने की आवश्यकता है।
- रोबोट आँखों को नियंत्रित करते हैं: अध्ययन में पाया गया कि रोबोट का व्यवहार ही मुख्य कारण था जिससे लोग स्क्रीन देखते थे। यदि रोबोट कुछ सटीक कार्य कर रहा था (जैसे कप उठाना), तो लोग करीब से देखते थे। यदि रोबोट बस स्थिर बैठा था या धीरे चल रहा था, तो वे दूर देख लेते थे। शोधकर्ताओं का सुझाव है कि यदि रोबोट के कार्य भ्रमित करने वाले या समझने में कठिन हैं, तो ऑपरेटर की आँखें भटक जाएंगी क्योंकि वे समझने की कोशिश कर रहे हैं कि क्या हो रहा है।
- "फेक मेमोरी" का जाल: शोधकर्ताओं ने गौर किया कि "रीप्ले" पद्धति के साथ एक दिलचस्प बात है। कभी-कभी, जब लोग रीप्ले देखते हैं, तो वे वह याद नहीं कर रहे होते जो उन्होंने वास्तव में उस क्षण में सोचा था; बल्कि वे एक ऐसी कहानी बना रहे होते हैं जो अब (परिणाम जानने के बाद) तर्कसंगली लगती है। उदाहरण के लिए, यदि उन्होंने रीप्ले में रोबोट को कप गिराते देखा, तो वे कह सकते हैं, "मैंने वहाँ इसलिए देखा क्योंकि मुझे पता था कि यह गिरने वाला है," भले ही उन्हें उस समय यह पता न हो। टूल ने उन्हें यह समझने में मदद की, लेकिन यह एक याद दिलाता है कि अपने ध्यान को पीछे मुड़कर देखना हमेशा 100% सटीक नहीं होता है।
- AI एक सहायक है, बॉस नहीं: प्रतिभागियों को AI के सुझाव पसंद आए, लेकिन केवल तभी जब उन्हें लगा कि AI सही था। यदि AI गलत अनुमान लगाता, तो उन्हें लगा कि उन्हें उसे ठीक करने के लिए अधिक मेहनत करनी पड़ेगी। शोधकर्ताओं ने पाया कि लोग चाहते थे कि AI एक "स्कैफोल्ड" (ढांचा) के रूप में काम करे—यानी, सोचने में मदद करने के लिए, न कि उनकी जगह सोचने के लिए। उन्होंने अनुमान लगाया कि AI पूरी तरह से भरोसेमंद होने के लिए लगभग 80% से 90% सटीक होना चाहिए।
यह क्यों महत्वपूर्ण है
यह पेपर यह दावा नहीं करता कि इसने रोबोट सुपरविज़न की समस्या को हमेशा के लिए हल कर दिया है। वास्तव में, शोधकर्ता बहुत सावधानी से कहते हैं कि उनका टूल केवल एक पहला कदम है। उन्होंने केवल दो रोबोटों और प्री-रिकॉर्डेड वीडियो के साथ परीक्षण किया, न कि वास्तविक जीवन के रोबोटों के बेड़े के साथ जो अभी अस्पतालों में घूम रहे हों। उन्होंने उन लोगों का भी उपयोग किया जो विशेषज्ञ नहीं थे, इसलिए वास्तविक रोबोट ऑपरेटर अलग तरह से व्यवहार कर सकते हैं।
हालाँकि, अध्ययन रोबोट डिजाइन के बारे में सोचने का एक शक्तिशाली नया तरीका सुझाता है। रोबोट डिजाइनरों को यह अनुमान लगाने के बजाय कि इंसान क्या चाहता है, उनसे पूछना चाहिए, "आपने वहाँ क्यों देखा?" और उनके उत्तरों का उपयोग रोबोट के व्यवहार को बेहतर बनाने के लिए करना चाहिए।
शोधकर्ता यह भी बताते हैं कि यदि हम हर किसी के ध्यान को इतनी बारीकी से ट्रैक करना शुरू करते हैं, तो हमें गोपनीयता (प्राइवेसी) के प्रति सावधान रहना होगा। हम नहीं चाहते कि इन "अटेंशन प्रोफाइल्स" का उपयोग श्रमिकों की जासूसी करने या उनके प्रदर्शन को आंकने के लिए किया जाए। टूल का उद्देश्य रोबोट को इंसान के लिए बेहतर बनाना है, न कि इंसान को जज करना।
अंत में, Attune एक सेतु (bridge) है। यह मानव आँखों की अनिश्चित गति और रोबोट की तार्किक, प्रोग्राम की गई दुनिया के बीच के अंतर को पाटता है। यह समझने के माध्यम से कि "कहाँ" के पीछे का "क्यों" क्या है, हम भविष्य में ऐसे रोबोट बेड़े देख सकते हैं जो स्क्रीनों के अराजक ट्रैफिक जाम की तरह नहीं, बल्कि एक सुव्यवस्थित नृत्य की तरह महसूस होंगे, जहाँ हर चाल मानव कप्तान को शांत, केंद्रित और नियंत्रण में रखने के लिए डिज़ाइन की गई है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।