← नवीनतम पेपर
💻 computer science

Graph-Based Multimodal and Multi-view Alignment for Keystep Recognition

मूल लेखक: Julia Lee Romero, Kyle Min, Subarna Tripathi, Morteza Karimzadeh

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Julia Lee Romero, Kyle Min, Subarna Tripathi, Morteza Karimzadeh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यूट्यूब पर एक कुकिंग ट्यूटोरियल देख रहे हैं, लेकिन एक पेशेवर शेफ एक चमकदार रसोई में खड़ा होने के बजाय, कैमरा शेफ के माथे पर बंधा हुआ है।

जैसे ही वे हिलते हैं, कैमरा हिलता है, उनके हाथ लगातार दृश्य को बाधित करते हैं, और बैकग्राउंड गति का एक धुंधला सा अहसास देता है। यह "एगोसेंट्रिक वीडियो" (प्रथम-व्यक्ति दृश्य) की दुनिया है, और यह एक कंप्यूटर के लिए यह समझना अविश्वसनीय रूप से कठिन बना देता है कि कार्य का सटीक चरण क्या है—जैसे कि यह जानना कि शेफ वर्तमान में "प्याज काट रहा है" या "आलू छील रहा है।"

यहाँ यह शोध पत्र एक चतुर नई विधि का उपयोग करके इस समस्या को कैसे हल करता है।

समस्या: "शकी कैमरा" (हिलता हुआ कैमरा) का सिरदर्द

अधिकांश AI मॉडल वीडियो को एक फ्लिपबुक की तरह देखते हैं, जो एक के बाद एक फ्रेम को समझने की कोशिश करते हैं। लेकिन प्रथम-व्यक्ति वीडियो में, वह "फ्लिपबुक" अराजक होती है। क्योंकि कैमरा बहुत अधिक हिल रहा है, AI रास्ता भटक जाता है। यह वैसा ही है जैसे किसी के द्वारा आपके हाथों में किताब को हिलाने के दौरान उसे पढ़ने की कोशिश करना।

समाधान: वीडियो क्लिप्स का "सोशल नेटवर्क"

वीडियो को एक निरंतर, हिलते हुए प्रवाह के रूप में देखने के बजाय, शोधकर्ताओं ने इसे एक सोशल नेटवर्क (एक ग्राफ) की तरह मानने का निर्णय लिया।

उपमा:
कल्पना कीजिए कि आप एक पार्टी के बारे में एक कहानी जोड़ने की कोशिश कर रहे हैं। पार्टी के एक लंबे, धुंधले वीडियो को देखने के बजाय, आप रात की सैकड़ों व्यक्तिगत तस्वीरें लेते हैं।

  • प्रत्येक फोटो एक "नोड" (सोशल नेटवर्क में एक व्यक्ति) है।
  • फिर आप उन तस्वीरों के बीच रेखाएं (कनेक्शन) खींचते हैं जो दिखने में समान हैं या समय में एक साथ आती हैं।

शोधकर्ता वीडियो क्लिप्स के साथ ऐसा ही करते हैं। वे हर क्लिप को एक विशाल वेब में एक "नोड" में बदल देते हैं। इन क्लिप्स के आपस में जुड़ने के तरीके को देखकर, AI "बड़ी तस्वीर" देख सकता है। भले ही कोई एक क्लिप धुंधली हो या हाथ से ढकी हो, AI उस क्लिप के "दोस्तों" (उससे पहले और बाद की क्लिप्स) को देखकर समझ सकता है कि क्या हो रहा है।

सीक्रेट सॉस: "जासूस" तकनीक (एगो-एक्सो अलाइनमेंट)

शोधकर्ताओं ने प्रशिक्षण के दौरान एक शानदार ट्रिक का उपयोग किया। उन्होंने दो प्रकार के वीडियो का उपयोग किया:

  1. एगोसेंट्रिक (Egocentric): हिलता हुआ, प्रथम-व्यक्ति दृश्य (कठिन वाला)।
  2. एक्सोसेंट्रिक (Exocentric): एक स्थिर, तृतीय-व्यक्ति दृश्य (जैसे ट्राइपॉड कैमरा शेफ को देख रहा हो)।

उपमा:
कल्पना कीजिए कि आप अपने पैरों के एक हिलते हुए वीडियो को देखकर एक जटिल डांस मूव सीखने की कोशिश कर रहे हैं। यह कठिन है! लेकिन, यदि आपका कोई मित्र पास में खड़ा होकर एक स्थिर कैमरे से आपकी साइड से रिकॉर्डिंग कर रहा है, तो आप अपनी फुटेज की तुलना उनके स्पष्ट फुटेज से कर सकते हैं ताकि यह सीख सकें कि आप वास्तव में क्या कर रहे थे।

AI खुद को समझाने के लिए "स्पष्ट" वीडियो का उपयोग करता है कि वह "हिलते हुए" वीडियोों की व्याख्या कैसे करे। वास्तविक परीक्षण के दौरान, "स्पष्ट" वीडियो वहां मौजूद नहीं होते हैं, लेकिन AI उनके साथ अभ्यास करके इतना स्मार्ट हो चुका होता है कि वह "हिलने" के बावजूद भी देख सकता है।

"बहु-संवेदी" बोनस

अंत में, शोधकर्ताओं ने केवल चित्रों को नहीं देखा। उन्होंने AI को अतिरिक्त "इंद्रियां" दीं, ठीक वैसे ही जैसे एक इंसान करता है:

  • सुनना: व्यक्ति जो कह रहा है (कथन) उसे सुनना।
  • स्पर्श/स्थान: वस्तुएं कितनी दूर हैं (गहराई/डेप्थ) इसे समझना।
  • दृष्टि: विशिष्ट वस्तुओं (जैसे "यह एक चाकू है") को पहचानना।

उन्होंने इन सभी अलग-अलग प्रकार की सूचनाओं को एक विशाल, जटिल "मानचित्र" (एक हेट्रोजेनियस ग्राफ) में मिला दिया ताकि AI और भी सटीक हो सके।

परिणाम

एक अराजक वीडियो को सूचना के एक स्मार्ट, जुड़े हुए वेब में बदलकर, उन्होंने केवल एक छोटा सुधार नहीं किया—उन्होंने प्रतियोगिता को पूरी तरह से पछाड़ दिया, सटीकता में 12 अंकों से अधिक की वृद्धि की। यह एक ऐसे कंप्यूटर के बीच का अंतर है जो केवल "अनुमान" लगाता है कि क्या हो रहा है और एक ऐसे कंप्यूटर के बीच जो क्रियाओं के क्रम को वास्तव में "समझता" है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →