Multimodal Rapport Estimation in Real-World HRI
यह अध्ययन प्रदर्शित करता है कि ज़ीरो-शॉट एलएलएम (विशेष रूप से जेमिनी 2.5 फ्लैश) का प्रीट्रेन्ड ऑडियो और विजुअल मॉडल्स (HuBERT और V-JEPA) के साथ मल्टीमॉडल फ्यूजन, वास्तविक दुनिया के एचआरआई सेटिंग्स में तीसरे पक्ष द्वारा रेट किए गए रैपोर (rapport) का प्रभावी ढंग से अनुमान लगाता है, जो व्यक्तिगत मॉडल्स से बेहतर प्रदर्शन करता है और इंटरेक्शन की अवधि और समूह के आकार जैसी प्रासंगिक परिवर्तनशीलता को ध्यान में रखने की आवश्यकता को रेखांकित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मानव-रोबोट संपर्क की हलचल भरी दुनिया में, शोधकर्ता लंबे समय से उस अदृश्य धागे को मापने का तरीका खोज रहे हैं जो एक व्यक्ति को मशीन से जोड़ता है। यह संबंध, जिसे अक्सर 'रैपो' (rapport) कहा जाता है, कोई स्थिर व्यक्तित्व लक्षण नहीं है, बल्कि एक गतिशील भावना है जो तब उत्पन्न होती है जब दो पक्ष एक-दूसरे पर ध्यान देते हैं, अपने कार्यों का समन्वय करते हैं, और गर्मजोशी का अनुभव साझा करते हैं। जबकि वैज्ञानिकों ने नियंत्रित प्रयोगशालाओं में इस बंधन का सफलतापूर्वक अध्ययन किया है जहाँ हर चर (variable) को प्रबंधित किया जाता है, वास्तविक दुनिया कहीं अधिक अव्यवस्थित है। एक व्यस्त स्टोर या सार्वजनिक चौक में, लोग अपनी गति से बातचीत में आते-जाते रहते हैं, दोस्तों के समूह एक साथ रोबोट के पास जमा हो सकते हैं, और कोई भी रुकने के लिए मजबूर नहीं है। आधुनिक रोबोटिक्स के लिए केंद्रीय प्रश्न यह है कि क्या लैब में जुड़ाव को मापने के लिए उपयोग किए जाने वाले उपकरण तब भी काम कर सकते हैं जब वातावरण अनियंत्रित हो और प्रतिभागी जब चाहें जाने के लिए स्वतंत्र हों।
इसका उत्तर देने के लिए, शोधकर्ताओं ने एक जापानी दवा की दुकान (ड्रगस्टोर) में एक सामाजिक रोबोट स्थापित किया, जो एक ऐसा परिवेश है जहाँ ग्राहक बिना किसी पूर्व निर्देश के स्वतंत्र रूप से आ सकते हैं। छह दिनों के दौरान, 'सोटा' नामक एक छोटे मेज पर रखे जाने वाले पुतले (टेबलटॉप फिगर) ने आगंतुकों के साथ अनौपचारिक बातचीत की, जबकि एक मानव ऑपरेटर दूर से इसके भाषण और हाव-भाव को निर्देशित करता था। टीम ने इन 62 अंतःक्रियाओं को रिकॉर्ड किया, जिसमें अकेले खरीदारी करने वाले लोगों से लेकर दोस्तों के छोटे समूहों तक के वीडियो और ऑडियो को कैप्चर किया गया। इसके बाद उन्होंने तीन स्वतंत्र मानव न्यायाधीशों से रिकॉर्डिंग देखने और प्रत्येक व्यक्ति तथा रोबोट के बीच के संबंध की गुणवत्ता को एक मानकीकृत पैमाने का उपयोग करके रेट करने के लिए कहा। इस पैमाने ने मापा कि बातचीत कितनी ध्यानपूर्ण और समन्वित महसूस हुई, जिससे प्रत्येक क्षण में प्राप्त हुए रैपो का एक विश्वसनीय स्कोर प्राप्त हुआ।
इस वास्तविक दुनिया के डेटा के साथ, शोधकर्ताओं ने परीक्षण किया कि क्या कंप्यूटर इन मानव रेटिंग्स की स्वचालित रूप से भविष्यवाणी करना सीख सकते हैं। उन्होंने दो अलग-अलग दृष्टिकोणों की तुलना की। पहले दृष्टिकोण में भारी मात्रा में टेक्स्ट, ऑडियो और वीडियो डेटा पर प्रशिक्षित विशेष कंप्यूटर मॉडल का उपयोग किया गया ताकि रिकॉर्डिंग से विशिष्ट विशेषताओं को निकाला जा सके। दूसरे दृष्टिकोण में शक्तिशाली, सामान्य प्रयोजन वाले कृत्रिम बुद्धिमत्ता (AI) सिस्टम का उपयोग किया गया जिन्हें 'लार्ज लैंग्वेज मॉडल्स' (LLMs) के रूप में जाना जाता है। इन सिस्टम्स को बातचीत के ट्रांसक्रिप्ट दिए गए और कुछ मामलों में, ऑडियो और वीडियो फाइलें भी दी गईं, और उन्हें एक तीसरे पक्ष के न्यायाधीश के रूप में कार्य करने और स्वयं रैपो को रेट करने के लिए कहा गया, ठीक वैसे ही जैसे मानव विशेषज्ञों ने किया था।
परिणामों ने सामान्य प्रयोजन वाली कृत्रिम बुद्धिमत्ता की आश्चर्यजनक शक्ति को प्रकट किया। केवल बातचीत के टेक्स्ट (पाठ) के साथ, इनमें से एक बड़े मॉडल ने असाधारण रूप से अच्छा प्रदर्शन किया, जिसने ऑडियो या विजुअल डेटा पर निर्भर विशेष मॉडलों की तुलना में बातचीत की बारीकियों को बेहतर ढंग से पकड़ा। इस मॉडल के टेक्स्ट-ओनली संस्करण ने उच्च स्तर की सटीकता के साथ रैपो स्कोर की भविष्यवाणी करने में सफलता प्राप्त की, जो यह सुझाव देता है कि लोग जो शब्द उपयोग करते हैं और उनकी बातचीत का प्रवाह, रोबोट के साथ उनके जुड़ाव के बारे में सबसे महत्वपूर्ण सुराग प्रदान करता है। हालाँकि, विशेष मॉडल बेकार नहीं थे। शोधकर्ताओं ने पाया कि जबकि टेक्स्ट-आधारित मॉडल मजबूत था, वह उन विवरणों को छोड़ देता था जिन्हें ऑडियो और विजुअल मॉडल पकड़ सकते थे। जब शोधकर्ताओं ने टेक्स्ट-आधारित मॉडल के भविष्यवाणियों को ऑडियो और विजुअल मॉडलों के साथ जोड़ा, तो परिणाम सबसे सटीक प्रणाली के रूप में सामने आया। इस संयुक्त दृष्टिकोण ने किसी भी एकल पद्धति से बेहतर प्रदर्शन किया, जो यह दर्शाता है कि विभिन्न प्रकार के डेटा प्रतिस्पर्धी होने के बजाय पूरक अंतर्दृष्टि प्रदान करते हैं।
अध्ययन ने यह भी रेखांकित किया कि बातचीत की लंबाई और शामिल लोगों की संख्या ने रैपो को मापने की क्षमता को कैसे प्रभावित किया। प्रयोगशाला के नियंत्रित वातावरण में, अंतःक्रियाएं अक्सर लंबी होती हैं और उनमें केवल दो लोग शामिल होते हैं। ड्रगस्टोर में, अंतःक्रियाएं संक्षिप्त थीं, जिनका औसत केवल 54 सेकंड से थोड़ा अधिक था, और अक्सर इसमें कई लोग शामिल हो जाते थे। शोधकर्ताओं ने पाया कि जैसे-जैसे प्रतिभागियों की संख्या बढ़ी, विशेष मॉडल अधिक संघर्ष करने लगे, संभवतः इसलिए क्योंकि समूह की बातचीत की जटिल गतिशीलता ने व्यक्तिगत संकेतों को अलग करना कठिन बना दिया। इसके विपरीत, सामान्य प्रयोजन वाला AI मॉडल मजबूत बना रहा, और जब तीन लोग एक साथ रोबोट से बात कर रहे थे, तब भी इसने अपनी उच्च सटीकता बनाए रखी। यह सुझाव देता है कि ये उन्नत सिस्टम पारंपरिक लैब विधियों की तुलना में वास्तविक दुनिया के अराजक, बहु-व्यक्ति मुठभेड़ों को संभालने के लिए बेहतर ढंग से सुसज्जित हैं।
अंततः, यह कार्य प्रदर्शित करता है कि वास्तविक दुनिया में मानव-रोबोट संबंधों की गुणवत्ता का अनुमान लगाना संभव है, लेकिन इसके लिए एक अलग रणनीति की आवश्यकता है जो अतीत में उपयोग की जाने वाली रणनीतियों से भिन्न है। निष्कर्ष बताते हैं कि केवल विशिष्ट कार्यों के लिए प्रशिक्षित विशेष मॉडलों पर निर्भर रहना पर्याप्त नहीं हो सकता है जब उपयोगकर्ता अपनी इच्छानुसार जुड़ने और हटने के लिए स्वतंत्र हों। इसके बजाय, एक हाइब्रिड दृष्टिकोण जो सामान्य कृत्रिम बुद्धिमत्ता की व्यापक समझ का लाभ उठाता है और उसे विशिष्ट ऑडियो और विजुअल संकेतों के साथ पूरक बनाता है, सबसे विश्वसनीय मार्ग प्रदान करता है। यह अंतर्दृष्टि सामाजिक रोबोट के भविष्य के लिए अत्यंत महत्वपूर्ण है, क्योंकि यह उन प्रणालियों की ओर संकेत करती है जो सार्वजनिक स्थानों में मानव जीवन की अप्रत्याशित और विविध प्रकृति के प्रति वास्तव में अनुकूल हो सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।