← नवीनतम पेपर
💻 computer science

HAP: A Hand-Driven Active Perception Framework for Egocentric Head Motion Prediction

यह शोध पत्र HAP प्रस्तुत करता है, जो एक हैंड-ड्रिवन एक्टिव परसेप्शन फ्रेमवर्क है जो लक्ष्य आत्मविश्वास (target confidence) का अनुमान लगाकर और एक प्रेडिक्टिव ग्राफ के माध्यम से गतिशील अवरोधों (dynamic occlusions) को मॉडल करके भविष्य की इगोसेंट्रिक हेड मोशन की भविष्यवाणी करता है, जिसे 'बॉटल' नामक एक नए डेटासेट द्वारा मान्य किया गया है और मौजूदा बेसलाइनों पर बेहतर प्रदर्शन प्रदर्शित किया गया है।

मूल लेखक: Yunji Feng, Junyi Ma, Guanzhong Sun, Chenyang Xu, Hesheng Wang

प्रकाशित 2026-09-17
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yunji Feng, Junyi Ma, Guanzhong Sun, Chenyang Xu, Hesheng Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

जब हम किसी को कप की ओर हाथ बढ़ाते हुए देखते हैं, तो हमारी आँखें केवल हाथ का पीछा नहीं करतीं; वे इस बात का पूर्वानुमान लगाती हैं कि हाथ कहाँ जा रहा है और लक्ष्य को स्पष्ट रूप से देखने के लिए हिलती हैं। यही सक्रिय धारणा (active perception) का सार है: यह विचार कि संवेदन (sensing) दुनिया का एक निष्क्रिय रिकॉर्डिंग नहीं है, बल्कि एक सक्रिय प्रक्रिया है जहाँ हम उस विशिष्ट जानकारी को एकत्र करने के लिए अपने शरीर को हिलाते हैं जिसकी हमें आवश्यकता होती है। रोबोट या आर्टिफिशियल इंटेलिजेंस के संदर्भ में, जो मानव व्यवहार को समझने की कोशिश कर रहे हैं, यह एक कठिन पहेली बनाता है। अधिकांश सिस्टम यह अनुमान लगाने में अच्छे होते हैं कि हाथ आगे कहाँ जाएगा, लेकिन वे अक्सर यह अनुमान लगाने में विफल रहते हैं कि व्यक्ति का सिर किस ओर घूमेगा। एक रोबट जो केवल हाथ को ट्रैक करता है, वह इस तथ्य को मिस कर सकता है कि व्यक्ति कोने के चारों ओर देखने वाला है ताकि वह देख सके कि वह क्या पकड़ रहा है, जिससे एक अनाड़ी या असफल संवाद हो सकता है। छिपी हुई वस्तुओं को देखने के लिए सिर कैसे घूमता है, इसे समझना इस बात के समान ही महत्वपूर्ण है कि हाथ कहाँ जा रहा है, क्योंकि सिर का ओरिएंटेशन यह निर्धारित करता है कि व्यक्ति को आगे क्या दृश्य साक्ष्य प्राप्त होंगे।

शंघाई जियाओ टोंग यूनिवर्सिटी और चाइना यूनिवर्सिटी ऑफ माइनिंग एंड टेक्नोलॉजी के शोधकर्ताओं की एक टीम ने इस समस्या को हल करने का एक नया तरीका विकसित किया है। उन्होंने HAP नामक एक प्रणाली बनाई है, जिसका अर्थ है 'हैंड-ड्रिवन एक्टिव परसेप्शन' (Hand-Driven Active Perception) फ्रेमवर्क। सिर को शरीर के एक माध्यमिक हिस्से के रूप में मानने के बजाय जो केवल हाथ का अनुसरण करता है, H-AP सिर को जानकारी एकत्र करने के एक उपकरण के रूप में मानता है। यह प्रणाली किसी व्यक्ति के हाथ को वस्तुओं की ओर बढ़ते हुए देखकर और फिर यह अनुमान लगाकर काम करती है कि उसका इरादा किस वस्तु को छूने का है। यह यहीं नहीं रुकती; यह यह भी गणना करती है कि वह वस्तु दृश्य के अन्य सामानों द्वारा कैसे छिपी या बाधित हो सकती है। लक्ष्य के बारे में अनुमान को दृश्यमान होने वाली चीजों के मानचित्र के साथ जोड़कर, प्रणाली सटीक रूप से अनुमान लगा सकती है कि व्यक्ति अपने लक्ष्य पर नज़र रखने के लिए अपना सिर कैसे घुमाएगा।

इस विचार को बनाने और परीक्षण करने के लिए, शोधकर्ताओं को सबसे पहले वीडियो डेटा का एक नया संग्रह बनाना पड़ा। उन्होंने लोगों के मेज पर वस्तुओं की ओर हाथ बढ़ाने के सैकड़ों छोटे क्लिप रिकॉर्ड किए, जिसमें रंग और गहराई (depth) दोनों को देखने वाले कैमरों का उपयोग किया गया। इन वीडियो में, वस्तुएं स्थिर रहती हैं, लेकिन जैसे-जैसे व्यक्ति हिलता है, लक्ष्य की दृश्यता बदल जाती है, जिससे व्यक्ति को यह देखने के लिए अपनी दृष्टि बदलनी पड़ती है कि वह क्या कर रहा है। इस डेटासेट को, जिसका नाम उन्होंने 'बॉटल' (Bottle) रखा है, हाथ की गतिविधियों और सिर की गतिविधियों की सिंक्रोनाइज्ड रिकॉर्डिंग शामिल है, जो यह दिखाती है कि जब लक्ष्य कठिन से दिखने लगता है तो लोग अपने दृष्टिकोण को कैसे समायोजित करते हैं। शोधकर्ताओं ने इस डेटा का उपयोग अपने कंप्यूटर मॉडल को हाथ की गति में उन सूक्ष्म संकेतों को पहचानने के लिए प्रशिक्षित करने के लिए किया जो एक विशिष्ट लक्ष्य का संकेत देते हैं, और यह समझने के लिए कि दृश्य का बदलता स्वरूप सिर की गति को कैसे प्रभावित करता है।

HAP प्रणाली का मुख्य आधार यह है कि छिपे हुए भाग के बारे में तर्क कैसे दिया जाए। जब कोई व्यक्ति किसी वस्तु की ओर हाथ बढ़ाता है, तो प्रणाली वस्तु के आकार और हाथ के पथ को देखकर प्रत्येक संभावित लक्ष्य को एक संभावना (probability) प्रदान करती है। इसके बाद यह दृश्य का एक गतिशील मानचित्र बनाती है, जो ट्रैक करती है कि कौन सी वस्तुएं दूसरों के दृश्य को बाधित कर रही हैं। यह मानचित्र स्थिर नहीं है; यह व्यक्ति के हिलने के साथ अपडेट होता रहता है, न केवल यह गणना करता है कि वर्तमान में क्या छिपा हुआ है, बल्कि यह भी कि यदि व्यक्ति अपनी स्थिति थोड़ी बदल दे तो क्या छिपा हुआ हो सकता है। प्रणाली इन संबंधों को एक विशिष्ट क्रम में संसाधित करने वाले नेटवर्क का उपयोग करती है, जो सूचना के प्रवाह की तरह है, ताकि यह समझ सके कि समय के साथ लक्ष्य की दृश्यता कैसे बदलती है। यह अनुमान लगाने में सक्षम बनाता है कि यदि कोई लक्ष्य आंशिक रूप से बाधित है, तो व्यक्ति केवल उसी दिशा में देखते रहने के बजाय उसे प्रकट करने के लिए अपना सिर घुमाएगा।

अध्ययन के परिणाम दिखाते हैं कि यह दृष्टिकोण पिछले तरीकों की तुलना में काफी बेहतर काम करता है। अपने नए डेटासेट और वीडियो के मौजूदा सार्वजनिक संग्रह दोनों पर परीक्षण करने पर, HAP प्रणाली ने अन्य उन्नत मॉडलों की तुलना में सिर की भविष्य की स्थिति और ओरिएंटेशन का अनुमान लगाने में कम गलतियाँ कीं। शोधकर्ताओं ने पाया कि केवल लक्ष्य का अनुमान लगाना पर्याप्त नहीं था; सटीक भविष्यवाणी करने के लिए प्रणाली को उस लक्ष्य की बदलती दृश्यता को समझने की आवश्यकता थी। उन्होंने यह भी पाया कि जटिल भविष्यवाणी को इस सरल धारणा के साथ मिलाने से—कि सिर एक स्थिर गति से चलता रहता है—परिणामों को सुचारू बनाने में मदद मिली, विशेष रूप से तत्काल भविष्य के लिए। लक्ष्य को समझने, बाधाओं को ट्रैक करने और गति के प्राकृतिक प्रवाह का सम्मान करने के इस संयोजन ने प्रणाली को उच्च सटीकता के साथ सिर की गतिविधियों की भविष्यवाणी करने में सक्षम बनाया।

अध्ययन में यह भी पता लगाया गया कि क्या होता है यदि प्रणाली को लक्ष्य के बारे में केवल एक निश्चित अनुमान लगाने के लिए मजबूर किया जाता है बजाय इसके कि संभावनाओं की एक श्रेणी रखी जाए। परिणामों ने दिखाया कि लक्ष्य के बारे में अनिश्चितता का एक स्तर बनाए रखना वास्तव में अंतिम भविष्यवाणी में सुधार करता है। यह सुझाव देता है कि हाथ के संपर्क में आने से पहले, पहुंच के शुरुआती चरणों में, मस्तिष्क संभवतः कई विकल्पों पर विचार करता है, और सिर की गति इस लचीलेपन को दर्शाती है। मॉडल में इस अनिश्चितता को सुरक्षित रखकर, प्रणाली अंतिम परिणाम के प्रति बेहतर अनुकूलन कर सकती है। शोधकर्ताओं ने निष्कर्ष निकाला कि सबसे सफल भविष्यवाणियां सिर को एक सक्रिय सेंसर के रूप में मानने से आईं जो दृश्य के बदलते परिदृश्य के अनुसार लगातार समायोजित होता है, न कि केवल हाथ के निष्क्रिय अनुयायी के रूप में।

हालाँकि प्रणाली ने टेबलटॉप प्रयोगों के नियंत्रित वातावरण में अच्छा प्रदर्शन किया, शोधकर्ताओं ने स्वीकार किया कि इसे अधिक जटिल, वास्तविक दुनिया के परिवेश में चुनौतियों का सामना करना पड़ता है। वर्तमान विधि को कई वस्तुओं के बीच संबंधों को ट्रैक करने के लिए महत्वपूर्ण कंप्यूटिंग शक्ति की आवश्यकता होती है, और यह उच्च गुणवत्ता वाले वीडियो डेटा पर निर्भर करती है जो हमेशा उपलब्ध नहीं हो सकता है। फिर भी, ये निष्कर्ष मानवों के साथ अधिक स्वाभाविक रूप से बातचीत करने के लिए रोबोट और वर्चुअल सहायकों को बनाने के लिए एक स्पष्ट मार्ग प्रदान करते हैं। यह समझकर कि सिर की गति लक्ष्य को स्पष्ट रूप से देखने की आवश्यकता से प्रेरित होती है, ये प्रणालियाँ मानवीय जरूरतों का पूर्वानुमान लगा सकती हैं और सफल संवाद का समर्थन करने के लिए अपनी गतिविधियों का समन्वय कर सकती हैं। यह कार्य प्रदर्शित करता है कि मानव व्यवहार को वास्तव में समझने के लिए, मशीनों को दुनिया को केवल चलते हुए हिस्सों के संग्रह के रूप में नहीं, बल्कि एक गतिशील पहेली के रूप में देखना सीखना होगा जहाँ पर्यवेक्षक लापता टुकड़ों को खोजने के लिए लगातार बदल रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →