← नवीनतम पेपर
💻 computer science

UGotMe: An Embodied System for Affective Human-Robot Interaction

यह शोध पत्र UGotMe को प्रस्तुत करता है, जो एक एम्बॉडीड अफेक्टिव ह्यूमन-रोबोट इंटरैक्शन सिस्टम है जिसे मल्टीपार्टी बातचीत के लिए डिज़ाइन किया गया है, जो सक्रिय फेस एक्सट्रैक्शन और कुशल डेटा ट्रांसमिशन के माध्यम से पर्यावरणीय शोर और रियल-टाइम लेटेंसी चुनौतियों पर विजय प्राप्त करता है, जिसे ह्यूमनॉइड रोबोट Ameca पर मान्य किया गया है।

मूल लेखक: Peizhen Li, Longbing Cao, Xiao-Ming Wu, Xiaohan Yu, Runze Yang

प्रकाशित 2026-03-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Peizhen Li, Longbing Cao, Xiao-Ming Wu, Xiaohan Yu, Runze Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक भीड़भाड़ वाली, शोर-शराबे वाली पार्टी में हैं। आप अपने एक दोस्त के साथ एक गहरी बातचीत करने की कोशिश कर रहे हैं, लेकिन आपके ठीक बगल में कुछ लोग चिल्ला रहे हैं, नाच रहे हैं और अजीबोगरीब चेहरे बना रहे हैं। अब, कल्पना कीजिए कि एक रोबोट उस पार्टी के बीच में खड़ा है, जो केवल आपके दोस्त की भावनाओं को समझने की कोशिश कर रहा है ताकि वह उचित प्रतिक्रिया दे सके।

यह बिल्कुल वही समस्या है जिसे शोध पत्र "UGotMe" हल करने की कोशिश करता है।

यहाँ शोधकर्ताओं ने क्या किया है, इसका एक सरल विवरण दिया गया है, जिसमें रोजमर्रा के उदाहरणों का उपयोग किया गया है:

1. समस्या: रोबोट का "भ्रमित दिमाग"

वर्तमान रोबट उन लोगों की तरह हैं जो शोर को फिल्टर करने में खराब होते हैं। यदि कोई रोबोट लोगों के समूह को देखता है, तो वह सभी के चेहरे देखता है।

  • परिदृश्य: आप (सक्रिय वक्ता) एक दुखद कहानी सुना रहे हैं। लेकिन आपके ठीक बगल में एक अजनबी हंस रहा है, और आपके पीछे एक अजीब फूलदान (vase) वाली शेल्फ है।
  • रोबोट की गलती: बिना किसी मदद के, रोबोट पूरी तस्वीर को देखता है। वह हंसते हुए अजनबी और अजीब फूलदान को देख लेता है। वह भ्रमित हो जाता है और सोच सकता है, "ओह, हर कोई खुश है!" या "वह फूलदान क्या है?" वह आपके उदास चेहरे पर ध्यान केंद्रित करने में विफल रहता है।
  • गति का मुद्दा: इसके अलावा, रोबोट अक्सर धीमे होते हैं। जब तक रोबोट यह समझ पाता है कि आपने क्या कहा, तब तक बातचीत आगे बढ़ चुकी होती है। यह वैसा ही है जैसे किसी ऐसे व्यक्ति के साथ बातचीत करने की कोशिश करना जो हर शब्द के जवाब में 10 सेकंड का समय लेता है।

2. समाधान: UGotMe (एक "स्मार्ट पार्टी होस्ट")

शोधकर्ताओं ने UGotMe (संक्षेप में "You Got Me", जिसका अर्थ है कि रोबोट आखिरकार आपको समझ गया है) नामक एक सिस्टम बनाया है। यह एक सुपर-स्मार्ट पार्टी होस्ट की तरह काम करता है जो जानता है कि इस अराजकता को कैसे संभालना है।

यह दो चालाक तरीकों से दो मुख्य समस्याओं को हल करता है:

ट्रिक A: "स्पॉटलाइट" रणनीति (डिनोइजिंग/शोर हटाना)

पूरे अस्त-व्यस्त कमरे को देखने के बजाय, रोबोट उस व्यक्ति पर स्पॉटलाइट डालता है जो उससे बात कर रहा है।

  • यह कैसे काम करता है: रोबोट सुनता है कि आवाज कहाँ से आ रही है। वह अपना सिर घुमाता है (जैसे एक इंसान वक्ता की ओर मुड़ता है) ताकि बोलने वाला व्यक्ति उसके कैमरा व्यू के बिल्कुल केंद्र में आ जाए।
  • फ़िल्टर: इसके बाद यह डिजिटल रूप से केवल उस व्यक्ति के चेहरे को "काट" देता है और बैकग्राउंड में हंसते हुए अजनबी और फूलदान को अनदेखा कर देता है। यह एक फोटो एडिटर की तरह है जो बैकग्राउंड को क्रॉप कर देता है ताकि आप केवल उसी व्यक्ति को देख सकें जिसकी आप परवाह करते हैं।
  • "न्यूट्रल" रीसेट: कभी-कभी, किसी व्यक्ति का चेहरा उनके मूड या लाइटिंग के आधार पर अलग दिख सकता है। सिस्टम पहले उस व्यक्ति के चेहरे की एक "न्यूट्रल" स्नैपशॉट (एक बेसलाइन फोटो की तरह) लेता है और फिर मापता है कि उनकी अभिव्यक्ति उस बेसलाइन से कितनी बदली है। यह रोबोट को व्यक्ति के अनूठे चेहरे के आकार के बजाय भावना को समझने में मदद करता है।

ट्रिक B: "एक्सप्रेस लेन" (रियल-टाइम स्पीड)

रोबोट को तेज़ बनाने के लिए, उन्होंने वीडियो डेटा को धीमे, बोझिल तरीके से नहीं भेजा।

  • उदाहरण: एक पत्र भेजने बनाम एक लाइव वीडियो स्ट्रीम भेजने की कल्पना करें। अधिकांश सिस्टम पूरा पत्र भेजते हैं और जवाब का इंतजार करते हैं। UGotMe डेटा की एक निरंतर, उच्च-गति वाली स्ट्रीम (जैसे एक लाइव वीडियो फीड) पास के एक शक्तिशाली कंप्यूटर को भेजता है।
  • परिणाम: रोबोट डेटा को तुरंत प्रोसेस करता है, ताकि वह रियल-टाइम में प्रतिक्रिया दे सके, ठीक वैसे ही जैसे एक इंसान बातचीत में करता है।

3. दिमाग: VL2E (द "इमोशन डिटेक्टिव")

यह सिस्टम VL2E (विज़न-लैंग्वेज टू इमोशन) नामक एक विशेष AI मॉडल का उपयोग करता है।

  • यह क्या करता है: यह जो रोबोट देखता है (क्रॉप्ड चेहरा) उसे जो रोबोट सुनता है (बोले गए शब्द) के साथ जोड़ता है।
  • जादू: यह केवल चेहरे को नहीं देखता; यह बातचीत के पिछले कुछ वाक्यों को याद रखता है। यदि आप कहते हैं, "मैं ठीक हूँ," लेकिन आपका चेहरा उदास दिखता है और आप अभी-अभी रोकर निकले हैं, तो रोबमा समझ जाएगा कि आप वास्तव में दुखी हैं, न कि ठीक। यह एक अच्छे दोस्त की तरह काम करता है जो संदर्भ (context) पर ध्यान देता है।

4. परीक्षण: रोबोट "Ameca"

शोधकर्ताओं ने इसका परीक्षण Ameca नामक एक वास्तविक, भौतिक रोबोट (एक बहुत ही अभिव्यंजक ह्यूमनॉइड रोबोट) पर किया।

  • प्रयोग: उन्होंने वास्तविक मनुष्यों को एक समूह सेटिंग में Ameca से बात करने के लिए कहा।
  • परिणाम:
    • UGotMe के बिना: रोबोट बैकग्राउंड के लोगों से भ्रमित हो गया और गलत भावनात्मक प्रतिक्रिया दी (जैसे, इंसान के दुखी होने पर भी मुस्कुराना)।
    • UGotMe के साथ: रोबोट ने 77% बार वक्ता की भावना को सही ढंग से पहचाना (जो पिछले तरीकों से एक बड़ी छलांग है) और लोगों को ऐसा महसूस कराया जैसे वे एक स्वाभाविक, सहानुभूतिपूर्ण बातचीत कर रहे हों।

निष्कर्ष

UGotMe को एक रोबोट को "सामाजिक कौशल" देने के रूप में सोचें। यह रोबोट को सिखाता है कि कैसे:

  1. शोर को अनसुना करें (बैकग्राउंड पार्टी को अनदेखा करें)।
  2. वक्ता पर ध्यान केंद्रित करें (अपना सिर घुमाएं और ज़ूम इन करें)।
  3. संदर्भ को सुनें (अभी जो कहा गया था उसे याद रखें)।
  4. तुरंत प्रतिक्रिया दें (धीमे न हों)।

लक्ष्य ऐसे रोबोट बनाना है जो न केवल मनुष्यों की तरह व्यवहार करें, बल्कि वास्तव में ऐसा महसूस करें कि वे हमें समझते हैं, जिससे हमारे साथ उनकी बातचीत अधिक स्वाभाविक और कम रोबोटिक हो सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →