UGotMe: An Embodied System for Affective Human-Robot Interaction
यह शोध पत्र UGotMe को प्रस्तुत करता है, जो एक एम्बॉडीड अफेक्टिव ह्यूमन-रोबोट इंटरैक्शन सिस्टम है जिसे मल्टीपार्टी बातचीत के लिए डिज़ाइन किया गया है, जो सक्रिय फेस एक्सट्रैक्शन और कुशल डेटा ट्रांसमिशन के माध्यम से पर्यावरणीय शोर और रियल-टाइम लेटेंसी चुनौतियों पर विजय प्राप्त करता है, जिसे ह्यूमनॉइड रोबोट Ameca पर मान्य किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक भीड़भाड़ वाली, शोर-शराबे वाली पार्टी में हैं। आप अपने एक दोस्त के साथ एक गहरी बातचीत करने की कोशिश कर रहे हैं, लेकिन आपके ठीक बगल में कुछ लोग चिल्ला रहे हैं, नाच रहे हैं और अजीबोगरीब चेहरे बना रहे हैं। अब, कल्पना कीजिए कि एक रोबोट उस पार्टी के बीच में खड़ा है, जो केवल आपके दोस्त की भावनाओं को समझने की कोशिश कर रहा है ताकि वह उचित प्रतिक्रिया दे सके।
यह बिल्कुल वही समस्या है जिसे शोध पत्र "UGotMe" हल करने की कोशिश करता है।
यहाँ शोधकर्ताओं ने क्या किया है, इसका एक सरल विवरण दिया गया है, जिसमें रोजमर्रा के उदाहरणों का उपयोग किया गया है:
1. समस्या: रोबोट का "भ्रमित दिमाग"
वर्तमान रोबट उन लोगों की तरह हैं जो शोर को फिल्टर करने में खराब होते हैं। यदि कोई रोबोट लोगों के समूह को देखता है, तो वह सभी के चेहरे देखता है।
- परिदृश्य: आप (सक्रिय वक्ता) एक दुखद कहानी सुना रहे हैं। लेकिन आपके ठीक बगल में एक अजनबी हंस रहा है, और आपके पीछे एक अजीब फूलदान (vase) वाली शेल्फ है।
- रोबोट की गलती: बिना किसी मदद के, रोबोट पूरी तस्वीर को देखता है। वह हंसते हुए अजनबी और अजीब फूलदान को देख लेता है। वह भ्रमित हो जाता है और सोच सकता है, "ओह, हर कोई खुश है!" या "वह फूलदान क्या है?" वह आपके उदास चेहरे पर ध्यान केंद्रित करने में विफल रहता है।
- गति का मुद्दा: इसके अलावा, रोबोट अक्सर धीमे होते हैं। जब तक रोबोट यह समझ पाता है कि आपने क्या कहा, तब तक बातचीत आगे बढ़ चुकी होती है। यह वैसा ही है जैसे किसी ऐसे व्यक्ति के साथ बातचीत करने की कोशिश करना जो हर शब्द के जवाब में 10 सेकंड का समय लेता है।
2. समाधान: UGotMe (एक "स्मार्ट पार्टी होस्ट")
शोधकर्ताओं ने UGotMe (संक्षेप में "You Got Me", जिसका अर्थ है कि रोबोट आखिरकार आपको समझ गया है) नामक एक सिस्टम बनाया है। यह एक सुपर-स्मार्ट पार्टी होस्ट की तरह काम करता है जो जानता है कि इस अराजकता को कैसे संभालना है।
यह दो चालाक तरीकों से दो मुख्य समस्याओं को हल करता है:
ट्रिक A: "स्पॉटलाइट" रणनीति (डिनोइजिंग/शोर हटाना)
पूरे अस्त-व्यस्त कमरे को देखने के बजाय, रोबोट उस व्यक्ति पर स्पॉटलाइट डालता है जो उससे बात कर रहा है।
- यह कैसे काम करता है: रोबोट सुनता है कि आवाज कहाँ से आ रही है। वह अपना सिर घुमाता है (जैसे एक इंसान वक्ता की ओर मुड़ता है) ताकि बोलने वाला व्यक्ति उसके कैमरा व्यू के बिल्कुल केंद्र में आ जाए।
- फ़िल्टर: इसके बाद यह डिजिटल रूप से केवल उस व्यक्ति के चेहरे को "काट" देता है और बैकग्राउंड में हंसते हुए अजनबी और फूलदान को अनदेखा कर देता है। यह एक फोटो एडिटर की तरह है जो बैकग्राउंड को क्रॉप कर देता है ताकि आप केवल उसी व्यक्ति को देख सकें जिसकी आप परवाह करते हैं।
- "न्यूट्रल" रीसेट: कभी-कभी, किसी व्यक्ति का चेहरा उनके मूड या लाइटिंग के आधार पर अलग दिख सकता है। सिस्टम पहले उस व्यक्ति के चेहरे की एक "न्यूट्रल" स्नैपशॉट (एक बेसलाइन फोटो की तरह) लेता है और फिर मापता है कि उनकी अभिव्यक्ति उस बेसलाइन से कितनी बदली है। यह रोबोट को व्यक्ति के अनूठे चेहरे के आकार के बजाय भावना को समझने में मदद करता है।
ट्रिक B: "एक्सप्रेस लेन" (रियल-टाइम स्पीड)
रोबोट को तेज़ बनाने के लिए, उन्होंने वीडियो डेटा को धीमे, बोझिल तरीके से नहीं भेजा।
- उदाहरण: एक पत्र भेजने बनाम एक लाइव वीडियो स्ट्रीम भेजने की कल्पना करें। अधिकांश सिस्टम पूरा पत्र भेजते हैं और जवाब का इंतजार करते हैं। UGotMe डेटा की एक निरंतर, उच्च-गति वाली स्ट्रीम (जैसे एक लाइव वीडियो फीड) पास के एक शक्तिशाली कंप्यूटर को भेजता है।
- परिणाम: रोबोट डेटा को तुरंत प्रोसेस करता है, ताकि वह रियल-टाइम में प्रतिक्रिया दे सके, ठीक वैसे ही जैसे एक इंसान बातचीत में करता है।
3. दिमाग: VL2E (द "इमोशन डिटेक्टिव")
यह सिस्टम VL2E (विज़न-लैंग्वेज टू इमोशन) नामक एक विशेष AI मॉडल का उपयोग करता है।
- यह क्या करता है: यह जो रोबोट देखता है (क्रॉप्ड चेहरा) उसे जो रोबोट सुनता है (बोले गए शब्द) के साथ जोड़ता है।
- जादू: यह केवल चेहरे को नहीं देखता; यह बातचीत के पिछले कुछ वाक्यों को याद रखता है। यदि आप कहते हैं, "मैं ठीक हूँ," लेकिन आपका चेहरा उदास दिखता है और आप अभी-अभी रोकर निकले हैं, तो रोबमा समझ जाएगा कि आप वास्तव में दुखी हैं, न कि ठीक। यह एक अच्छे दोस्त की तरह काम करता है जो संदर्भ (context) पर ध्यान देता है।
4. परीक्षण: रोबोट "Ameca"
शोधकर्ताओं ने इसका परीक्षण Ameca नामक एक वास्तविक, भौतिक रोबोट (एक बहुत ही अभिव्यंजक ह्यूमनॉइड रोबोट) पर किया।
- प्रयोग: उन्होंने वास्तविक मनुष्यों को एक समूह सेटिंग में Ameca से बात करने के लिए कहा।
- परिणाम:
- UGotMe के बिना: रोबोट बैकग्राउंड के लोगों से भ्रमित हो गया और गलत भावनात्मक प्रतिक्रिया दी (जैसे, इंसान के दुखी होने पर भी मुस्कुराना)।
- UGotMe के साथ: रोबोट ने 77% बार वक्ता की भावना को सही ढंग से पहचाना (जो पिछले तरीकों से एक बड़ी छलांग है) और लोगों को ऐसा महसूस कराया जैसे वे एक स्वाभाविक, सहानुभूतिपूर्ण बातचीत कर रहे हों।
निष्कर्ष
UGotMe को एक रोबोट को "सामाजिक कौशल" देने के रूप में सोचें। यह रोबोट को सिखाता है कि कैसे:
- शोर को अनसुना करें (बैकग्राउंड पार्टी को अनदेखा करें)।
- वक्ता पर ध्यान केंद्रित करें (अपना सिर घुमाएं और ज़ूम इन करें)।
- संदर्भ को सुनें (अभी जो कहा गया था उसे याद रखें)।
- तुरंत प्रतिक्रिया दें (धीमे न हों)।
लक्ष्य ऐसे रोबोट बनाना है जो न केवल मनुष्यों की तरह व्यवहार करें, बल्कि वास्तव में ऐसा महसूस करें कि वे हमें समझते हैं, जिससे हमारे साथ उनकी बातचीत अधिक स्वाभाविक और कम रोबोटिक हो सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।