← नवीनतम पेपर
💻 computer science

Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering

यह शोध पत्र EgoPointVQA प्रस्तुत करता है, जो जेस्चर-ग्राउंडेड इगोसेंट्रिक क्वेश्चन अनस्वर्सिंग के लिए एक नया डेटासेट और बेंचमार्क है, साथ ही हैंड इंटेंट टोकन्स (HINT) विधि भी प्रस्तुत करता है जो 3D हैंड कीपॉइंट्स का लाभ उठाकर इगोसेंट्रिक वीडियो से पॉइंटिंग इंटेंट का अनुमान लगाने की मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की क्षमता में महत्वपूर्ण सुधार करती है।

मूल लेखक: Yura Choi, Roy Miles, Rolandos Alexandros Potamias, Ismail Elezi, Jiankang Deng, Stefanos Zafeiriou

प्रकाशित 2026-03-17
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yura Choi, Roy Miles, Rolandos Alexandros Potamias, Ismail Elezi, Jiankang Deng, Stefanos Zafeiriou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने स्मार्ट चश्मा पहना हुआ है जो ठीक वही देख सकता है जो आप देख रहे हैं। आप अपने आस-पास की दुनिया के बारे में अपने AI असिस्टेंट से एक सवाल पूछना चाहते हैं।

समस्या: "पॉइंटिंग" (इशारा करने) का अंतर
अभी, यदि आप अपने चूल्हे पर रखे एक विशिष्ट बर्तन की ओर इशारा करते हैं और पूछते हैं, "क्या मुझे इसे इस्तेमाल करना चाहिए?", तो अधिकांश AI असिस्टेंट भ्रमित हो जाते हैं। वे पूरे किचन को देख सकते हैं, दो बर्तन देख सकते हैं, और अंदाज़े से कोई भी चुन सकते हैं। वे यह नहीं समझ पाते कि आपकी उंगली एक "कर्सर" है जो उन्हें ठीक से बता रही है कि आपका मतलब किस चीज़ से है।

यह "आई स्पाई" (I Spy) का खेल खेलने जैसा है जहाँ सामने वाला व्यक्ति आँखों पर पट्टी बाँधे हुए है; आप कहते हैं, "मैंने कुछ लाल देखा," लेकिन वह आपकी उंगली को नहीं देख पाता जो मेज पर रखे विशेष लाल सेब की ओर इशारा कर रही है, इसलिए वह ड्राइववे में खड़ी लाल कार का अंदाज़ा लगा लेता है।

समाधान: EGOPOINTVQA
इस शोध के पीछे के शोधकर्ताओं ने एक नया प्रशिक्षण मैदान बनाया है जिसे EGOPOINTVQA कहा जाता है। इसे AI के लिए एक विशाल "ड्राइविंग स्कूल" के रूप में सोचें, लेकिन कारों को चलाने के बजाय, AI इशारा करने (pointing) को समझना सीख रहा है।

उन्होंने हजारों वीडियो बनाए (कुछ कंप्यूटर द्वारा बनाए गए, कुछ स्मार्ट चश्मा पहने वास्तविक लोगों द्वारा फिल्माए गए) जहाँ कोई व्यक्ति किसी वस्तु की ओर इशारा करता है और प्रश्न पूछता है जैसे:

  • "यह क्या है?"
  • "इनमें से कौन सा करीब है?"
  • "इनमें से कितने हैं?"

लक्ष्य यह सिखाना था कि जब कोई इंसान इशारा करता है, तो "यह" या "वह" शब्द केवल एक रैंडम शब्द नहीं है; यह एक कमांड है जो कहती है, "ठीक यहाँ देखो, उस चीज़ पर जिसे मेरी उंगली छू रही है।"

सीक्रेट सॉस: HINT (हैंड इंटेंट टोकन्स)
इन वीडियो के बावजूद, मानक AI मॉडल अभी भी संघर्ष कर रहे थे। वे वीडियो देख सकते थे और प्रश्न पढ़ सकते थे, लेकिन वे इशारे को "महसूस" नहीं कर सकते थे।

इसे ठीक करने के लिए, शोधकर्ताओं ने एक चतुर तरकीब निकाली जिसे HINT (Hand Intent Tokens) कहा जाता है।

कल्पना कीजिए कि आप फोन पर अपने दोस्त को एक जटिल डांस स्टेप समझाने की कोशिश कर रहे हैं। आप केवल कदमों का वर्णन कर सकते हैं (टेक्स्ट), या आप उन्हें डांस का वीडियो भेज सकते हैं (विजुअल)। लेकिन क्या होगा अगर आप उन्हें एक विशेष मानचित्र भेजें जो हर सेकंड यह हाइलाइट करे कि आपके हाथ कहाँ हिल रहे हैं?

HINT वही करता है।

  1. मानचित्र: सिस्टम वीडियो के हर एक फ्रेम में उपयोगकर्ता के हाथ और उंगलियों की 3D स्थिति को ट्रैक करने के लिए एक विशेष टूल का उपयोग करता है।
  2. अनुवाद: यह उन हाथ की स्थितियों को एक गुप्त कोड (टोकन्स) में बदल देता है जिसे AI पढ़ सकता है।
  3. मिश्रण: यह इस "हैंड कोड" को वीडियो और प्रश्न के साथ AI के मस्तिष्क में मिला देता है।

अब, जब AI प्रश्न पढ़ता है, "क्या यह बर्तन काला है?", तो वह केवल अंदाज़ा नहीं लगाता। वह "हैंड मैप" को देखता है, काले बर्तन की ओर इशारा करती उंगली को देखता है, और आत्मविश्वास से उत्तर देता है, "हाँ।"

यह क्यों महत्वपूर्ण है
यह शोध AI सहायकों को वास्तव में स्वाभाविक बनाने की दिशा में एक बड़ा कदम है। भविष्य में, आपको यह कहने की ज़रूरत नहीं होगी, "हे AI, बाईं ओर रखे काले बर्तन को देखो।" आप बस उसकी ओर इशारा कर सकते हैं और पूछ सकते हैं, "क्या यह वाला तैयार है?" और AI बिल्कुल जान जाएगा कि आपका क्या मतलब है।

संक्षेप में:

  • समस्या: AI इंसानों द्वारा चीजों की ओर इशारा करने को समझने में बुरा है।
  • डेटासेट: उन्होंने AI को प्रशिक्षित करने के लिए पॉइंटिंग वीडियो का एक विशाल पुस्तकालय बनाया।
  • समाधान: उन्होंने AI को एक "सुपरपावर" (HINT) दी जो हाथ की गतिविधियों को एक ऐसी भाषा में अनुवादित करती है जिसे AI समझ सके, जिससे वह अंततः यह "देख" पाता है कि आप किस ओर इशारा कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →