← नवीनतम पेपर
💻 computer science

SocioGesture: Real-Time and Adaptive Social Gesture Perception for Human-Robot Interaction

यह शोध पत्र SocioGesture प्रस्तुत करता है, जो मानव-रोबोट संपर्क के लिए एक वास्तविक समय, अनुकूलन योग्य सामाजिक जेस्चर धारणा प्रणाली है, जो एज डिवाइसेस पर मजबूत, कम-विलंबता वाली पहचान प्राप्त करने के लिए ऑक्यूजन-अवेयर करप्शन (occlusion-aware corruption) के साथ प्रशिक्षित एक हल्के डुअल-स्ट्रीम मॉडल का उपयोग करती है और ऑफलाइन अनुकूलन के माध्यम से निरंतर अपने शब्दावली का विस्तार करती है।

मूल लेखक: Wenjin Fu, Li-Fan Wu, Jerin Peter, Chip Huyen, Boyuan Chen, Jan Liphardt

प्रकाशित 2026-09-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenjin Fu, Li-Fan Wu, Jerin Peter, Chip Huyen, Boyuan Chen, Jan Liphardt

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट हमारी दुनिया में घूमना सीख रहे हैं, लेकिन उनके लिए हमारे साथ स्वाभाविक रूप से बातचीत करने के लिए केवल बोले गए आदेशों का पालन करना ही काफी नहीं है। उन्हें मानव गति की मूक भाषा को समझने की आवश्यकता है: नमस्ते कहने के लिए एक हाथ हिलाना, रुकने के लिए हथेली ऊपर उठाना, या "मैं व्यस्त हूँ" का संकेत देने के लिए कान से फोन लगाना। यह मानव-रोबोट संपर्क (human-robot interaction) की चुनौती है, एक ऐसा क्षेत्र जो मशीनों को इन सामाजिक संकेतों को पढ़ना सिखाने के लिए समर्पित है। इसकी कठिनाई वास्तविक दुनिया की अव्यवस्थित वास्तविकता में निहित है। एक शांत कार्यालय में देखे जाने वाले वीडियो के विपरीत, एक रोबोट लोगों को चलते हुए कोणों से देखता है, अक्सर हाथ शरीर के पीछे छिपे होते हैं या छाया में खो जाते हैं। इसके अलावा, एक रोबोट लंबे समय तक रुककर सोचने का जोखिम नहीं उठा सकता; यदि वह किसी हाव-भाव (gesture) की व्याख्या करने में बहुत अधिक देर करता है, तो बातचीत टूटी हुई और अप्राकृतिक महसूस होती है। लक्ष्य एक ऐसा सिस्टम बनाना है जो बातचीत के साथ तालमेल बिठाने के लिए पर्याप्त तेज़ हो, सूचना के गायब हिस्सों को संभालने के लिए पर्याप्त स्मार्ट हो, और बिना किसी मानवीय रीप्रोग्रामिंग के अपनी गलतियों से सीखने में सक्षम हो।

OpenMind के शोधकर्ताओं ने इस समस्या को हल करने के लिए 'SocioGesture' नामक एक नया सिस्टम विकसित किया है। यह एक रियल-टाइम परसेप्शन टूल है जिसे विशेष रूप से उन रोबोटों के लिए डिज़ाइन किया गया है जिन्हें चलते और काम करते समय सामाजिक इशारों को पहचानने की आवश्यकता होती है। यह सिस्टम व्यक्ति के कंकाल (skeleton)—उनके जोड़ों और हड्डियों के मानचित्र—को देखकर काम करता है, न कि उनके कपड़ों या पृष्ठभूमि का विश्लेषण करने की कोशिश करता है। यह दृष्टिकोण इसलिए चुना गया क्योंकि प्रकाश बदलने या व्यक्ति के अलग कपड़े पहनने पर भी कंकाल पहचान योग्य रहता है। हालाँकि, शोधकर्ताओं को पता था कि मानक कंकाल ट्रैकिंग अक्सर तब विफल हो जाती है जब हाथ ढका हुआ हो या कैमरा एंगल बदल जाए। इसे ठीक करने के लिए, उन्होंने एक ऐसा मॉडल बनाया जो हर एक जोड़ (joint) के आत्मविश्वास (confidence) पर ध्यान देता है। यदि रोबोट का कैमरा इस बात को लेकर अनिश्चित है कि हाथ कहाँ है, तो सिस्टम अंधे होकर अनुमान लगाने के बजाय उस अनिश्चितता को नोट कर लेता है। यह शरीर की व्यापक गति को हाथ के सूक्ष्म विवरणों के साथ जोड़ता है, और उन्हें एक एकल, बिजली जैसी तेज़ गणना में मिला देता है जो सीधे रोबोट के ऑनबोर्ड कंप्यूटर पर चलती है।

SocioGesture का मुख्य नवाचार यह है कि यह डेटा के अनिवार्य अंतराल (gaps) को कैसे संभालता है। कई पिछले सिस्टमों में, यदि कलाई जैसा कोई प्रमुख जोड़ गायब होता था, तो पहचान का पूरा प्रयास विफल हो जाता था। यह नया सिस्टम उन अंतरालों की अपेक्षा करने के लिए प्रशिक्षित है। शोधकर्ताओं ने जानबूझकर अपने प्रशिक्षण डेटा को "विकृत" (corrupted) किया, जिसमें कंप्यूटर सिमुलेशन में हाथों और बाहों को छिपा दिया गया, जिससे मॉडल को यह सीखने के लिए मजबूर किया जा सके कि कंकाल के कुछ हिस्से अदृश्य होने पर भी इशारे को कैसे पहचाना जाए। यह प्रशिक्षण लैब से बाहर निकलने से पहले ही हो जाता है, इसलिए रोबोट को मजबूत होने के लिए अतिरिक्त कंप्यूटिंग शक्ति की आवश्यकता नहीं होती है। जब रोबोट फील्ड में होता है, तो वह निर्णय इस आधार पर लेता है कि वह क्या देख रहा है। यदि वह किसी इशारे के प्रति बहुत आश्वस्त है, तो वह तुरंत कार्य करता है। यदि वह अनिश्चित है, तो वह अनुमान नहीं लगाता; इसके बजाय, वह उस बातचीत के क्षण को बाद में समीक्षा के लिए सुरक्षित रखता है। यह एक सुरक्षा लूप बनाता है जहाँ रोबोट गलतियाँ करने से बचता है, जैसे कि किसी ऐसे व्यक्ति के पास जाना जो उसे रोकने की कोशिश कर रहा हो, जबकि वह स्मार्ट बनने के लिए डेटा भी एकत्र करता रहता है।

सिस्टम का परीक्षण विभिन्न इनडोर और आउटडोर सेटिंग्स में वास्तविक लोगों के साथ किया गया। शोधकर्ताओं ने सात सामान्य सामाजिक इशारों का एक डेटासेट एकत्र किया, जिनमें रोबोट को करीब बुलाने के लिए हाथ हिलाना, उसे रोकने के लिए हाथ ऊपर उठाना, या अनुपलब्धता का संकेत देने के लिए फोन पर होने का नाटक करना शामिल है। उन्होंने एक "डिस्ट्रैक्टर" (distractor) इशारा भी शामिल किया, जैसे सिर खुजलाना, ताकि रोबोट इसे फोन कॉल समझने की गलती न करे। जब उन लोगों पर परीक्षण किया गया जिन्हें रोबोट ने पहले कभी नहीं देखा था, तो सिस्टम ने लगभग सभी मामलों में इशारों को सही ढंग से पहचाना, भले ही हाथ आंशिक रूप से छिपे हों। एक विशिष्ट परीक्षण में जहाँ हाथों को डेटा से पूरी तरह से हटा दिया गया था, सिस्टम की सटीकता 31 प्रतिशत के खराब स्तर से बढ़कर 85 प्रतिशत के मजबूत स्तर पर पहुँच गई, जिससे सिद्ध हुआ कि प्रशिक्षण पद्धति ने काम किया। सिस्टम एक मानक वीडियो कैमरे के साथ तालमेल बिठाने के लिए पर्याप्त तेज़ था, जो रोबोट-माउंटेड कंप्यूटर पर एक फुल फ्रेम को केवल 25 मिलीसेकंड में प्रोसेस करता है, जो एक मानव पर्यवेक्षक के लिए तात्कालिक महसूस करने के लिए पर्याप्त है।

शायद सबसे महत्वपूर्ण निष्कर्ष तैनाती के बाद सिस्टम की सीखने की क्षमता है। शोधकर्ताओं ने एक ऐसी प्रक्रिया स्थापित की जहाँ रोबोट उन क्षणों को चिह्नित करेगा जिनके बारे में वह अनिश्चित था और उन वीडियो क्लिप्स को क्लाउड में एक अधिक शक्तिशाली कंप्यूटर पर भेजेगा। वह शक्तिशाली कंप्यूटर इशारे को लेबल करेगा, और रोबोट उस नई जानकारी का उपयोग अपने स्वयं के मस्तिष्क को अपडेट करने के लिए करेगा। एक परीक्षण में जहाँ रोबोट को तीन नए इशारे—अंगूठा दिखाना (thumbs-up), हैंडशेक, और सैल्यूट—सिखाए गए, उसने मूल सात इशारों को भूले बिना सफलतापूर्वक उन्हें सीखा। सिस्टम ने पुराने इशारों पर अपनी उच्च सटीकता बनाए रखी और नए इशारों को लगभग दो-तिहाई बार सही ढंग से पहचाना। यह दर्शाता है कि एक ऐसा रास्ता है जहाँ रोबोट सामाजिक संकेतों की अपनी शब्दावली को समय के साथ बढ़ा सकते हैं, बिना शून्य से फिर से प्रशिक्षित हुए नई स्थितियों के अनुकूल हो सकते हैं।

शोधकर्ताओं ने इस सिस्टम का परीक्षण एक लाइव रोबोट पर भी किया, जो 'Unitree G1' नामक एक ह्यूमनॉइड मशीन है, जो पाँच नए लोगों के साथ बातचीत कर रहा था जो प्रशिक्षण डेटा का हिस्सा नहीं थे। 150 परीक्षणों में, रोबोट ने 97 प्रतिशत बार इशारे को सही ढंग से पहचाना। जब रोबोट ने कार्य करने का निर्णय लिया, तो उसने 98 प्रतिशत बार सही व्यवहार चुना—जैसे कि पास आना या रुकना। वे कुछ बार जब उसने कार्य नहीं किया, तो वह इसलिए नहीं था कि उसने कोई गलती की थी, बल्कि इसलिए क्योंकि वह सतर्क था; उसने गलत कदम उठाने के जोखिम के बजाय प्रतीक्षा करना चुना। यह रूढ़िवादी दृष्टिकोण ठीक वही है जो डिजाइनरों ने एक सार्वजनिक स्थान में रोबត के लिए चाहा था। अध्ययन बताता है कि एक हल्के, तेज़ मॉडल को सुरक्षा-प्रथम रणनीति और ऑफलाइन लर्निंग के लूप के साथ जोड़कर, हम ऐसे रोबोट बना सकते हैं जो न केवल कुशल हैं, बल्कि सामाजिक रूप से जागरूक और अनुकूलन योग्य भी हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →