Can People Distinguish Human and AI Agency in Humanoid Teleoperation? A Preliminary Study of Agency Perception
यह प्रारंभिक अध्ययन "घोस्ट-इन-द-लूप" (Ghost-in-the-Loop) ढांचे को प्रस्तुत करता है यह प्रदर्शित करने के लिए कि प्रतिभागी अक्सर ह्यूमनॉइड टेलीऑपरेशन में मानव और एआई एजेंसी के बीच अंतर करने में संघर्ष करते हैं, और उनके निर्णय मुख्य रूप से नियंत्रण के वास्तविक स्रोत के बजाय कथित स्वाभाविकता और मल्टीमॉडल निरंतरता द्वारा संचालित होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसे भविष्य की कल्पना करें जहाँ आपके लिविंग रूम में खड़ा एक रोबोट केवल एक स्क्रिप्ट का पालन करने वाली मशीन नहीं है, बल्कि बातचीत में एक साथी है, जो मुस्कुराने, संकेत करने और मानवीय सहजता के साथ प्रतिक्रिया देने में सक्षम है। यह दृष्टिकोण 'टेलीऑपरेशन' (teleoperation) पर निर्भर करता है, एक ऐसी विधि जहाँ एक व्यक्ति दूर बैठकर वास्तविक समय में रोबोट की गतिविधियों और आवाज़ को नियंत्रित करता है, प्रभावी रूप से मशीन का उपयोग एक रिमोट शरीर के रूप में करता है। वर्षों से, इसके लिए एक मानव ऑपरेटर का निरंतर उपस्थित रहना आवश्यक था, जिससे इस बात पर सीमा लग जाती थी कि एक व्यक्ति कितने लोगों की मदद कर सकता है या एक बातचीत कितनी लंबी चल सकती है। हालाँकि, आर्टिफिशियल इंटेलिजेंस के तीव्र उदय ने एक नई संभावना पेश की है: ऐसी प्रणालियाँ जो स्वयं अपनी आवाज़, चेहरे के भाव और हाव-भाव उत्पन्न कर सकती हैं, जो एक इंसान की इतनी बारीकी से नकल करती हैं कि अंतर पहचानना कठिन हो जाता है। यह उन लोगों के लिए एक दिलचस्प और थोड़ा परेशान करने वाला सवाल खड़ा करता है जो इन मशीनों के साथ बातचीत कर रहे हैं: यदि एक रोबट अभिनय कर रहा है, तो क्या आप बता सकते हैं कि क्या कोई वास्तविक व्यक्ति इसे नियंत्रित कर रहा है, या कोई एल्गोरिदम काम कर रहा है?
सोनी कंप्यूटर साइंस लैबोरेटरीज और टोक्यो विश्वविद्यालय के शोधकर्ताओं ने इस प्रश्न का उत्तर देने के लिए एक प्रणाली बनाई जिसे वे 'घोस्ट-इन-द-लूप' (Ghost-in-the-Loop) कहते हैं। यह ढांचा एक ह्यूमनॉइड रोबोट को एक मानव ऑपरेटर द्वारा नियंत्रित होने और पूरी तरह से आर्टिफिशियल इंटेलिजेंस द्वारा संचालित होने के बीच निर्बाध रूप से स्विच करने की अनुमति देता है, जबकि वह दिखने और सुनने में बिल्कुल एक जैसा रहता है। रोबोट, जो एक स्क्रीन वाला यूनिट्री जी1 (Unitree G1) मॉडल है, एक मंच के रूप में कार्य करता है। जब एक मानव नियंत्रण में होता है, तो वह एक हेडसेट पहनता है ताकि वह देख सके जो रोबलेट देख रहा है और रोबोट के हाथों और चेहरे को निर्देशित करने के लिए मोशन सेंसर का उपयोग करता है। जब सिस्टम AI मोड में स्विच होता है, तो रोबोट बातचीत सुनता है और अपनी आवाज़, चेहरे की हलचल और हाथ के इशारों को बनाने के लिए जनरेटिव मॉडल्स का उपयोग करता है, जो मानव-नियंत्रित संस्करण के समान ही दृश्य और श्रव्य शैली से मेल खाते हैं। लक्ष्य यह देखना नहीं था कि कौन सा बेहतर है, बल्कि यह देखना था कि क्या एक मानव प्रेक्षक अंतर को पहचान भी सकता है।
इसका परीक्षण करने के लिए, टीम ने बातचीत दिखाने वाले कुछ छोटे वीडियो क्लिप बनाए। उन्होंने आठ अलग-अलग इंटरैक्शन रिकॉर्ड किए, जो अनौपचारिक बातचीत से लेकर कार्य-उन्मुख चर्चाओं तक थे, जिनमें से प्रत्येक पाँच से चालीस सेकंड का था। इन क्लिप्स में से आधे में, एक मानव टेलीऑपरेटर रोबोट को नियंत्रित कर रहा था। दूसरे आधे हिस्से में, AI सिस्टम ने व्यवहार उत्पन्न किया। महत्वपूर्ण रूप से, रोबोट की आवाज़, चेहरा और शरीर सभी क्लिप्स में सुसंगत रहे, इसलिए एकमात्र चर (variable) नियंत्रण का स्रोत था। शोधकर्ताओं ने इन वीडियो को ऑनलाइन देखने के लिए पचास लोगों को आमंत्रित किया। प्रत्येक क्लिप के बाद, प्रतिभागियों से यह तय करने के लिए कहा गया कि रोबोट एक इंसान द्वारा चलाया जा रहा था या कंप्यूटर द्वारा, और उन्होंने -10 (निश्चित AI) से +10 (निश्चित मानव) के पैमाने पर अपनी निश्चितता दर्ज की। उनसे यह भी पूछा गया कि उन्हें ऐसा क्यों लगा।
परिणाम बताते हैं कि इन संक्षिप्त क्षणों में, मानव और मशीन के बीच की रेखा उल्लेखनीय रूप से धुंधली है। प्रतिभागी दोनों स्रोतों के बीच अंतर करने में काफी संघर्ष करते दिखे। औसतन, उनकी रेटिंग मानव-नियंत्रित क्लिप्स और AI-नियंत्रित क्लिप्स के बीच बहुत कम बदली, और अंतर इतना छोटा था कि वह रैंडम अनुमान लगाने से भी अलग नहीं था। अध्ययन इंगित करता है कि छोटी बातचीत के लिए, लोग विश्वसनीय रूप से यह नहीं बता सकते कि रोबोट को किसी व्यक्ति द्वारा संचालित किया जा रहा है या एल्गोरिदम द्वारा। जब शोधकर्ताओं ने देखा कि प्रतिभागी वास्तव में क्या सोच रहे थे, तो उनके स्पष्टीकरणों में एक स्पष्ट पैटर्न सामने आया। जो लोग निर्णय लेने में सक्षम महसूस करते थे, वे रोबोट के व्यवहार की समग्र सहजता (naturalness) पर बहुत अधिक निर्भर थे। उन्होंने बातचीत के समय, गतिविधियों की लय, और इस बात पर ध्यान दिया कि आवाज़, चेहरे के भाव और हाथ के इशारे आपस में कितनी सामंजस्यपूर्ण ढंग से जुड़े हुए थे।
जब रोबोट की गतिविधियाँ सख्त महसूस हुईं, समय का तालमेल बिगड़ा हुआ लगा, या शरीर के विभिन्न हिस्से उसकी आवाज़ के साथ तालमेल में नहीं दिखे, तो प्रतिभागी अधिक संभावना के साथ अनुमान लगाते थे कि यह एक AI है। इसके विपरीत, जब रोबट एक सुसंगत प्रवाह के साथ चला, जहाँ इशारे और अभिव्यक्ति भाषण के साथ पूरी तरह मेल खाते थे, तो लोग अधिक विश्वास करते थे कि इसके पीछे एक मानव है। इसका मतलब यह नहीं है कि AI पूर्ण था, बल्कि यह कि AI के प्रदर्शन की खामियां इतनी सूक्ष्म थीं कि उन्हें एक त्वरित नज़र में मिस किया जा सकता था। अध्ययन बताता है कि एजेंसी (agency) को पहचानने की हमारी क्षमता विशिष्ट तकनीक पर कम और प्रदर्शन की निरंतरता पर अधिक निर्भर करती है। यदि रोबोट एक एकीकृत इकाई के रूप में कार्य करता है, तो मस्तिष्क उसे एक एकल एजेंट के रूप में स्वीकार कर लेता है, चाहे वह एजेंट मांस-रक्त का हो या कोड का।
यह प्रारंभिक कार्य यह संकेत देता है कि हम भविष्य के रोबोट को कैसे डिजाइन कर सकते हैं। इसका तात्पर्य यह है कि निकट भविष्य में, हमें उपयोगकर्ताओं को यह सोचने की चिंता करने की आवश्यकता नहीं होगी कि क्या कोई रोबोट वास्तविक है या नकली, विशेष रूप से छोटी बातचीत के दौरान। इसके बजाय, ध्यान इस बात पर केंद्रित हो सकता है कि ये प्रणालियाँ मानव और कृत्रिम बुद्धिमत्ता को कैसे मिला सकती हैं, शायद एक मानव तब नियंत्रण ले सकता है जब बातचीत जटिल हो जाए, जबकि AI नियमित कार्यों को संभालता है। शोधकर्ता नोट करते हैं कि उनके निष्कर्ष इन लघु, संरचित क्लिप्स के लिए विशिष्ट हैं और लंबी, अधिक जटिल बातचीत अलग पैटर्न प्रकट कर सकती है। फिलहाल, अध्ययन पुष्टि करता है कि जब एक रोबोट बोलता है, मुस्कुराता है और पर्याप्त सामंजस्य के साथ चलता है, तो मानव मन इसे एक साथी के रूप में स्वीकार करने के लिए तैयार रहता है, जिससे इसकी वास्तविक एजेंसी एक शांत रहस्य बनकर रह जाती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।