← नवीनतम पेपर
🤖 AI

Hybrid Attention Estimation Pipeline for Adaptive HRI Using an Expressive Robotic Head

यह शोध पत्र एक अभिव्यंजक InMoov-आधारित रोबोटिक हेड के लिए एक हाइब्रिड अटेंशन एस्टीमेशन पाइपलाइन प्रस्तुत करता है जो अनुकूली मानव-रोबोट इंटरेक्शन व्यवहारों को संचालित करने के लिए उच्च-आवृत्ति ज्यामितीय धारणा को सिमेंटिक विजन-लैंग्वेज मॉडलिंग के साथ एकीकृत करता है, जिसे विश्वसनीय इंटरेक्शन प्रबंधन और गैर-अनावश्यक सिग्नल प्रोसेसिंग प्रदर्शित करने वाले परीक्षणों के माध्यम से मान्य किया गया था।

मूल लेखक: Pablo Moraes, Monica Rodriguez, Christopher Peters, Hiago Sodre, Tobias Doernbach, Bruna Guterres, Ricardo Grando

प्रकाशित 2026-08-04
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pablo Moraes, Monica Rodriguez, Christopher Peters, Hiago Sodre, Tobias Doernbach, Bruna Guterres, Ricardo Grando

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए एक ऐसी दुनिया की जहाँ रोबोट केवल कठोर स्क्रिप्ट का पालन करने वाली भारी-भरकम मशीनें नहीं, बल्कि सामाजिक साथी हैं जो वास्तव में "माहौल को समझ" सकते हैं। यह ह्यूमन-रोबोट इंटरैक्शन (HRI) का मूल है, जो एक ऐसा विज्ञान क्षेत्र है जो मशीनों को यह सिखाने के लिए समर्पित है कि एक विनम्र, चौकस मित्र की तरह व्यवहार कैसे किया जाए। एक रोबोट के लिए एक अच्छा वार्तालाप करने वाला बनने के लिए, उसे विजुअल अटेंशन (दृश्य ध्यान) की अवधारणा को समझना आवश्यक है: यह जानना कि आप उसकी ओर देख रहे हैं, आप अपने फोन में व्यस्त हैं, या आप कहीं और देख रहे हैं। इसे एक नृत्य की तरह समझें; यदि एक साथी दूसरे की ओर देखना बंद कर देता है, तो नृत्य अजीब हो जाता है। यदि एक रोबोट यह अंतर कर सकता है कि आप उसे अनदेखा कर रहे हैं या आप बस एक टेक्स्ट मैसेज देख रहे हैं, तो वह बातचीत को रोकने, धैर्यपूर्वक प्रतीक्षा करने या बात जारी रखने का निर्णय ले सकता है। यह शोध पत्र यह समझने के बारे में है कि एक ऐसा रोबोट कैसे बनाया जाए जो न केवल आपका चेहरा देखे, बल्कि यह भी समझे कि आप क्यों दूसरी ओर देख रहे हैं, जिसमें बातचीत को स्वाभाविक रूप से बनाए रखने के लिए तेज़ गणित और स्मार्ट AI का मिश्रण उपयोग किया गया है।


वह रोबोट जो जानता है कि आप कब ऊब रहे हैं (और कब आप बस अपना फोन देख रहे हैं)

मिलिए "InMoov" हेड से। यह एक 3D-प्रिंटेड, अभिव्यंजक रोबोटिक चेहरा है जो भावनाएं दिखाने के लिए अपनी भौहें, पलकें और जबड़ा हिला सकता है, बिल्कुल एक बहुत ही हाई-टेक कठपुतली की तरह। लेकिन एक सुंदर चेहरा बेकार है यदि रोबोट के भीतर मौजूद सिस्टम को यह नहीं पता कि उसके आसपास क्या हो रहा है। इस अध्ययन के पीछे के शोधकर्ताओं ने एक पेचीदा समस्या को हल करना चाहा: आप रोबोट को तुरंत प्रतिक्रिया देने के लिए कैसे तैयार करें जब आप दूसरी ओर देखते हैं, बिना इस बात से भ्रमित हुए कि आप केवल अपने फोन को देख रहे हैं या आसमान को?

इसे करने के लिए, उन्होंने रोबोट के लिए एक "हाइब्रिड" मस्तिष्क बनाया, जो दो लोगों की एक ऐसी टीम की तरह काम करता है जिनके काम बहुत अलग हैं।

तेज़ धावक और बुद्धिमान पर्यवेक्षक
कल्पना कीजिए कि रोबोट के पास एक साथ काम करने वाले दो मस्तिष्क हैं।

  1. तेज़ धावक (ज्यामितीय परत - Geometric Layer): यह हिस्सा बहुत तेज़ है। यह आपके सिर के कोण को ट्रैक करने के लिए सरल गणित का उपयोग करता है। यदि आपका सिर रोबोट की ओर है, तो धावक चिल्लाता है, "हमारे पास ध्यान है!" यदि आप अपना सिर घुमाते हैं, तो वह चिल्लाता है, "ध्यान खो गया!" यह एक रेफरी की तरह है जो खिलाड़ी के बाउंड्री से बाहर कदम रखते ही सीटी बजाता है। यह समय के लिए तेज़ और विश्वसनीय है, लेकिन यह नहीं जानता कि आप क्या देख रहे हैं, केवल यह जानता है कि आपका सिर किस ओर इशारा कर रहा है।
  2. बुद्धिشمند पर्यवेक्षक (सिमेंटिक परत - Semantic Layer): यह हिस्सा धीमा है लेकिन बहुत अधिक स्मार्ट है। यह एक शक्तिशाली AI जिसे विजन-लैंग्वेज मॉडल (VLM) कहा जाता है, का उपयोग करता है। केवल कोणों को मापने के बजाय, यह पूरी तस्वीर को देखता है और कहता है, "ओह, व्यक्ति अपने फोन को देख रहा है," या "वे पेड़ में एक पक्षी को देख रहे हैं।" यह एक ऐसे दोस्त की तरह है जो नोटिस करता है कि आप मैसेज कर रहे हैं और संदर्भ को समझता है।

जादू तब होता है जब ये दोनों एक-दूसरे से बात करते हैं। "तेज़ धावक" रोबोट के तत्काल कार्यों (जैसे कहानी रोकना) को नियंत्रित करता है, जबकि "बुद्धिमान पर्यवेक्षक" निगरानी करता है ताकि यह सुनिश्चित हो सके कि रोबोट कोई गलती न करे।

प्रयोग: 10 लोग, 40 चैट
टीम ने इस सिस्टम का परीक्षण 10 स्वयंसेवकों के साथ किया। प्रत्येक व्यक्ति चार अलग-अलग परिदृश्यों के लिए रोबोट के सामने बैठा। कुछ परीक्षणों में, रोबोट ने सामान्य रूप से चैट की। अन्य में, रोबोट "एडेप्टिव" (अनुकूलनशील) था, जिसका अर्थ था कि उसे यह नोटिस करना था कि क्या व्यक्ति विचलित हो गया है और बातचीत शुरू होने से पहले तक प्रतीक्षा करनी है।

परिणाम आश्चर्यजनक रूप से सुचारू थे। सभी 40 परीक्षणों में से हर एक में, रोबोट ने सफलतापूर्वक व्यक्ति को पहचाना, महसूस किया कि वे ध्यान दे रहे हैं, और बातचीत शुरू की। व्यक्ति को पहचानने में लगभग 1.73 सेकंड लगे और बोलने शुरू करने से पहले यह पुष्टि करने में कि वे रोबोट की ओर देख रहे हैं, लगभग 4.74 सेकंड लगे।

जब रोबोट "एडेप्टिव मोड" में था और व्यक्ति ने विचलित होने का नाटक किया (जैसे फोन देखना), तो रोबोट ने बिल्कुल सही प्रतिक्रिया दी। उस परीक्षण में जहाँ विकर्षण की योजना बनाई गई थी, रोबोट ने 10 में से 10 परीक्षणों में बातचीत को रोका और 10 में से 9 परीक्षणों में सफलतापूर्वक इसे फिर से शुरू किया। रोबोट केवल रुका नहीं; उसने धैर्यपूर्वक प्रतीक्षा की, और जैसे ही व्यक्ति ने वापस देखा, वह फिर से बातचीत में शामिल हो गया।

क्यों दो मस्तिष्क एक से बेहतर हैं
सबसे दिलचस्प बात यह है: "तेज़ धावक" और "बुद्धिमान पर्यवेक्षक" हमेशा सहमत नहीं होते थे। लगभग आधे क्षणों में जब उन्होंने जांच की, तो उन्होंने जो कुछ भी हो रहा था उसके बारे में अलग-अलग विवरण दिए। उदाहरण के लिए, तेज़ धावक कह सकता है, "सिर दूसरी ओर मुड़ा हुआ है, ध्यान नहीं है!" जबकि बुद्धिमान पर्यवेक्षक कह सकता है, "वे फोन देख रहे हैं।"

शोधकर्ताओं ने पाया कि इन दो परतों ने गैर-अतिरेक (non-redundant) जानकारी प्रदान की। इसका मतलब है कि "बुद्धिमान पर्यवेक्षक" केवल वही नहीं दोहरा रहा था जो "तेज़ धावक" कह रहा था; बल्कि वह नई, उपयोगी जानकारी जोड़ रहा था जिसे केवल गणित नहीं देख सकता था। यह साबित करता है कि आप मानव ध्यान को समझने के लिए केवल एक प्रकार के सेंसर पर भरोसा नहीं कर सकते। आपको समय को सही रखने के लिए ज्यामिति की गति और संदर्भ को समझने के लिए AI की बुद्धिमत्ता की आवश्यकता है।

रोबोट ने क्या नहीं किया
यह ध्यान रखना महत्वपूर्ण है कि इस अध्ययन ने क्या सिद्ध नहीं किया। रोबोट ने पूर्ण मानवीय समझ की समस्या को हल नहीं किया। शोधकर्ताओं ने स्वीकार किया कि उनके पास यह जांचने के लिए कोई "ग्राउंड ट्रुथ" (एक सटीक, मानव-एनोटेटेड रिकॉर्ड कि व्यक्ति हर सेकंड वास्तव में क्या सोच रहा था) नहीं था। इसलिए, हालांकि रोबोट अच्छा काम करता हुआ प्रतीत हुआ, वे निश्चित रूप से नहीं कह सकते कि क्या प्रत्येक ठहराव वास्तव में व्यक्ति के विचलित होने के सटीक क्षण के साथ सही ढंग से समयबद्ध था। उन्होंने यह भी परीक्षण नहीं किया कि रोबोट के व्यवहार ने मनुष्यों को कैसा महसूस कराया—चाहे वे इसे डरावना या आकर्षक पाते हों। यह अगले दौर के प्रयोगों का काम है।

निष्कर्ष
यह अध्ययन सुझाव देता है कि सबसे अच्छा तरीका यह नहीं है कि आप तेज़ गणित और स्मार्ट AI में से किसी एक को चुनें, बल्कि दोनों का उपयोग करें। एक तेज़ सिस्टम को समय को संभालने देने और एक स्मार्ट सिस्टम को संदर्भ को संभालने देने से, रोबोट एक स्वाभाविक बातचीत भागीदार की तरह कार्य कर सकता है—एक ऐसा जो जानता है कि कब रुकना है, कब प्रतीक्षा करनी है, और कब कहानी को आगे बढ़ाना है। यह उन रोबोटों की ओर एक छोटा कदम है जो हमें केवल देखते नहीं हैं, बल्कि वास्तव में हमें समझते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →