Breaking the 15% Barrier: A Real-World Data-Driven System for Proactive Social Robot Triggered by User Nonverbal Cues
यह शोध पत्र एक वास्तविक दुनिया के डेटा-संचालित सिस्टम को प्रस्तुत करता है जो सक्रिय सेवा रोबोट प्रतिक्रियाओं को ट्रिगर करने के लिए ग्राहकों के गैर-मौखिक संकेतों का पता लगाता है, यह प्रदर्शित करते हुए कि 15.3% बातचीत बिना बोले शुरू की जाती है और एक ऐसा ढांचा प्रस्तावित करता है जो इन दृश्य संकेतों को LLM-आधारित संवाद पीढ़ी में एकीकृत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक व्यस्त स्टोर में एक रोबोट खड़ा है, जो ग्राहकों के "नमस्ते" कहने का इंतज़ार कर रहा है ताकि वह जवाब दे सके। लंबे समय तक, अधिकांश सर्विस रोबोट इसी तरह काम करते थे: उनके पास कान (माइक्रोफोन) तो थे लेकिन आँखें नहीं (या कम से कम वे बोलने के लिए उनका उपयोग नहीं करते थे)। वे एक सरल श्रृंखला पर निर्भर थे: आप बोलते हैं, रोबोट सुनता है, रोबोट सोचता है, और रोबोट बोलता है।
लेकिन यहाँ वह मोड़ है जिसे लेखकों ने खोजा: ग्राहक हमेशा पहले बात नहीं करते।
एक जापानी ड्रगस्टोर में एक वास्तविक दुनिया के प्रयोग में, शोधकर्ताओं ने एक ऐसा रोबोट सेट किया जो वास्तव में पीछे छिपे एक मानव ऑपरेटर द्वारा नियंत्रित किया जा रहा था। उन्होंने देखा कि क्या हुआ। उन्होंने 6 दिनों तक निगरानी की। बड़ा आश्चर्य यह था कि रोबोट की बोले गए वाक्यों में से 15.3% किसी ग्राहक की आवाज़ से नहीं, बल्कि उनके शारीरिक हाव-भाव (body language) से प्रेरित थे। एक ग्राहक बस पास आ सकता है, हाथ हिला सकता है, किसी बैग की ओर इशारा कर सकता है, या रोबोट को कोई वस्तु दिखा सकता है। यदि रोबोट केवल शब्दों को सुनने का इंतज़ार करता, तो वह हर सात में से लगभग एक बातचीत को मिस कर देता!
यह शोध पत्र इस विचार के विरुद्ध तर्क देता है कि एक रोबोट को मददगार होने के लिए मौखिक कमांड का इंतज़ार करने की आवश्यकता है। यह सुझाव देता है कि केवल ऑडियो पर निर्भर रहना वैसा ही है जैसे ईयरप्लग लगाकर 'चारड्स' (charades) का खेल खेलने की कोशिश करना—आप आधा खेल मिस कर रहे हैं।
"बॉडी लैंग्वेज ट्रांसलेटर"
इसे ठीक करने के लिए, टीम ने एक ऐसा सिस्टम बनाया जो एक बहुत ही चौकस वेटर की तरह काम करता है। केवल सुनने के बजाय, रोबकार का "मस्तिष्क" रीयल-टाइम में वीडियो फीड को देखता है। उन्होंने इसे उन नौ विशिष्ट "मूव्स" (moves) को पहचानने के लिए प्रशिक्षित किया जो ग्राहक करते हैं:
- पास आना (रोबोट के पास चलना)
- हाथ हिलाना (Waving)
- इशारा करना (Pointing)
- कोई वस्तु दिखाना
- सिर हिलाना (Nodding)
- सामान को छूना
- रोबोट के अंदर झाँकना
- दूर जाना
- पास में मौजूद दूसरे व्यक्ति के साथ बातचीत करना
उन्होंने केवल अनुमान नहीं लगाया; उन्होंने उन्हें मापा। सिस्टम मानवीय बातचीत के साथ तालमेल बिठाने के लिए पर्याप्त तेज़ है, जो लगभग 8 फ्रेम प्रति सेकंड की गति से वीडियो प्रोसेस करता है। यह महत्वपूर्ण है क्योंकि मनुष्य लगभग एक सेकंड के भीतर प्रतिक्रिया की अपेक्षा करते हैं। यदि रोबोट जो देखता है उसके बारे में "सोचने" में बहुत अधिक समय लेता है, तो उस पल का जादू खत्म हो जाता है।
रोबोट कैसे जवाब देता है
एक बार जब रोबोट किसी मूव को पहचान लेता है, तो वह बिना सोचे-समझे कोई भी वाक्य नहीं बोलता। यह तय करने के लिए कि उसे क्या कहना चाहिए, यह एक "स्मार्ट ब्रेन" (Large Language Model) का उपयोग करता है जो उसने देखा उसके आधार पर निर्णय लेता है।
- यदि कोई ग्राहक हाथ हिलाता है, तो रोबोट कह सकता है, "नमस्ते!"
- यदि कोई ग्राहक भारी बैग दिखाता है, तो रोबोट कह सकता है, "वाह, वह बैग भारी लग रहा है!"
- यदि कोई ग्राहक इशारा करता है, तो रोबोट पूछ सकता है, "क्या मैं आपको कुछ ढूँढने में मदद कर सकता हूँ?"
शोधकर्ताओं ने पहले इसे ऑफलाइन टेस्ट किया। उन्होंने रोबोट के वीडियो इतिहास और ऑपरेटर की वास्तविक प्रतिक्रियाओं को सिस्टम में डाला यह देखने के लिए कि क्या रोबोट प्रतिक्रिया के इरादे (intent) का अनुमान लगा सकता है। परिणाम आशाजनक लेकिन मिश्रित थे:
- अभिवादन और सामाजिक बातचीत (जैसे "हाय" या "बाय" कहना) के लिए, सिस्टम लगभग 69% बार सही था।
- हालाँकि, विशिष्ट कार्यों (जैसे स्टोर के निर्देश देना या चेतावनी देना) के लिए, सिस्टम संघर्ष करता रहा। ऐसा इसलिए है क्योंकि इन क्षणों के लिए स्टोर के बहुत विशिष्ट विवरणों की आवश्यकता होती है जो रोबोट को अभी तक पता नहीं हैं, और उन्हें ट्रिगर करने वाले "मूव्स" (जैसे किसी विशेष वस्तु को छूना) दुर्लभ हैं।
वास्तविक दुनिया का परीक्षण
टीम केवल सिमुलेशन तक ही सीमित नहीं रही। उन्होंने एक वर्किंग प्रोटोटाइप बनाया जो एक शक्तिशाली ग्राफिक्स कार्ड वाले मानक गेमिंग पीसी पर चलता है। इस लाइव सेटअप में, रोबोट लोगों को ट्रैक करने के लिए कैमरा, बोलने के लिए माइक्रोफ़ोन और उन नौ मूव्स को देखने के लिए अपने नए "बॉडी लैंग्वेज आईज़" का उपयोग करता है। जब कोई ग्राहक पास आता है और हाथ हिलाता है, तो रोबोट वास्तव में रीयल-टाइम में "नमस्ते" कह सकता है, और यह सब बिना किसी मानव ऑपरेटर के हस्तक्षेप के होता है।
क्या अभी भी सुधार की गुंजाइश है
लेखक सावधान हैं कि वे इसे एक पूर्ण समाधान नहीं कह सकते। वे स्वीकार करते हैं कि हालांकि रोबोट "नमस्ते" कहने के समय को पहचानने में बहुत अच्छा है, लेकिन यह जटिल स्टोर निर्देशों को संभालने के लिए अभी भी सीख रहा है। यह सिस्टम वर्तमान में एक प्रोटोटाइप है जो अधिक सक्रिय होने की क्षमता को दर्शाता है। यह सुझाव देता है कि रोबोट के कानों में आँखें जोड़कर, हम बातचीत को बहुत अधिक स्वाभाविक बना सकते हैं, लेकिन व्यस्त स्टोर में हर संभावित स्थिति को संभालने के लिए रोबोट को अभी और प्रशिक्षण की आवश्यकता है।
संक्षेप में, यह शोध पत्र सिद्ध करता है कि 15.3% समय, एक रोबोट का सबसे अच्छा दोस्त माइक्रोफ़ोन नहीं—कैमरा होता है। कमरे की स्थिति को पढ़ना सीखकर, रोबोट केवल बोले जाने का इंतज़ार करना बंद कर सकते हैं और खुद "नमस्ते" कहना शुरू कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।