← नवीनतम पेपर
💻 computer science

Keystep Recognition using Graph Neural Networks

यह शोध पत्र GLEVR का प्रस्ताव करता है, जो एक गणनात्मक रूप से कुशल ग्राफ-लर्निंग फ्रेमवर्क है जो कीस्टेप रिकग्निशन (keystep recognition) को एक नोड क्लासिफिकेशन टास्क के रूप में मानता है और एगोसेंट्रिक वीडियो, एक्सोसेंट्रिक वीडियो और कैप्शन के बीच दीर्घकालिक निर्भरता और क्रॉस-मोडल संरेखण का लाभ उठाकर प्रदर्शन में सुधार करता है।

मूल लेखक: Julia Lee Romero, Kyle Min, Subarna Tripathi, Morteza Karimzadeh

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Julia Lee Romero, Kyle Min, Subarna Tripathi, Morteza Karimzadeh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक पेशेवर शेफ को एक जटिल पांच-कोर्स का भोजन तैयार करते हुए देख रहे हैं। यदि आप केवल प्याज काटने का उनका 5 सेकंड का क्लिप देखते हैं, तो आपको यह पता नहीं चलेगा कि वे सूप बना रहे हैं, सलाद बना रहे हैं, या स्टिर-फ्राई। यह समझने के लिए कि वे वास्तव में किस "चरण" (step) पर हैं, आपको यह याद रखना होगा कि उन्होंने दस मिनट पहले क्या किया था और वे आगे क्या करने वाले हैं।

यह शोध पत्र, जिसका शीर्षक GLEVR है, आर्टिफिशियल इंटेलिजेंस (AI) के लिए लंबे वीडियो (विशेष रूप से एक पहले व्यक्ति के "एर्गोसेंट्रिक" दृष्टिकोण से, जैसे कि किसी कर्मचारी द्वारा पहना गया गोप्रो) को "देखने" और प्रक्रिया के सटीक चरण की पहचान करने का एक नया तरीका पेश करता है।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, कुछ सरल उपमाओं का उपयोग करके।

1. समस्या: AI की "गोल्डफिश मेमोरी"

अधिकांश वर्तमान AI मॉडल गोल्डफिश (सुनहरी मछली) की तरह हैं। वे एक एकल स्नैपशॉट या बहुत छोटे क्लिप को देखने और यह कहने में माहिर हैं कि, "वह एक व्यक्ति है जिसने हथौड़ा पकड़ा हुआ है।" हालाँकि, जब आप उन्हें किसी कैबिनेट बनाने की 10 मिनट की लंबी वीडियो दिखाते हैं, तो वे घबरा जाते हैं। वे कहानी का "धागा" खो देते हैं। वे "कब्जे को पेंच कसने" वाले चरण को "लकड़ी को मापने" वाले चरण से नहीं जोड़ पाते हैं जो बहुत पहले हुआ था।

2. समाधान: "कनेक्ट-द-डॉट्स" मैप (ग्राफ न्यूरल नेटवर्क)

वीडियो के हर एक फ्रेम को देखने के बजाय (जो थकाऊ है और बहुत अधिक कंप्यूटर शक्ति का उपयोग करता है), शोधकर्ताओं ने वीडियो को एक ग्राफ में बदल दिया।

उपमा: कल्पना कीजिए कि पूरी फिल्म देखने के बजाय, आप केवल पोस्ट-इट नोट्स (Post-it notes) की एक श्रृंखला देखते हैं। प्रत्येक नोट एक विशिष्ट क्षण (एक "नोड") का प्रतिनिधित्व करता है। फिर आप नोट्स के बीच रेखाएं ( "एजेस") खींचते हैं ताकि यह दिखाया जा सके कि वे एक-दूसरे से कैसे संबंधित हैं।

  • नोट A: "पेचकस उठाना।"
  • नोट B: "पेंच कसना।"
  • उनके बीच की रेखा कहती है: "B, A के ठीक बाद हुआ।"

वीडियो को इस "कनेक्ट-द-डॉट्स" मैप में बदलकर, AI को हर सेकंड के हर पिक्सेल को प्रोसेस करने की आवश्यकता नहीं होती है। यह कहानी के प्रवाह को समझने के लिए केवल मैप को देखता है। यह AI को बहुत तेज़ और लंबी अवधि के पैटर्न के बारे में बहुत अधिक स्मार्ट बनाता है।

3. "सीक्रेट सॉस": अतिरिक्त दृष्टिकोणों का उपयोग करना

शोधकर्ताओं ने यह भी पाया कि अपने "ट्रेनिंग" चरण (उनके स्कूल के वर्षों) के दौरान मल्टी-व्यू एलाइनमेंट (Multi-view alignment) का उपयोग करके वे AI को और स्मार्ट बना सकते हैं।

उपमा: कल्पना कीजिए कि आप पियानो बजाना सीख रहे हैं। अपने अभ्यास सत्रों के दौरान, आपके सामने से एक शिक्षक आपको देख रहा है, एक कैमरा आपके हाथों को बगल से रिकॉर्ड कर रहा है, और ध्वनि की एक रिकॉर्डिंग है। भले ही, आपकी अंतिम परीक्षा के दौरान, आप बिना किसी कैमरे के अकेले कमरे में हों, अभ्यास के दौरान विभिन्न कोणों को देखने की "याददाश्त" आपको एक बहुत बेहतर खिलाड़ी बनाती है।

GLEVR ट्रेनिंग के दौरान अतिरिक्त कैमरा एंगल (एक्सोसेंट्रिक व्यू) का उपयोग करता है ताकि AI "एगो" (व्यक्ति के) दृष्टिकोण को बेहतर ढंग से समझ सके। लेकिन—और यही चालाकी भरा हिस्सा है—जब "अंतिम परीक्षा" (इन्फरेंस) का समय आता है, तो इसे पूरी तरह से काम करने के लिए केवल पहले व्यक्ति के दृश्य की आवश्यकता होती है।

4. एक "नैरेटर" जोड़ना (मल्टीमॉडल लर्निंग)

अंत में, उन्हें एहसास हुआ कि कभी-कभी केवल देखना पर्याप्त नहीं होता; आपको कहानी को सुनने की भी आवश्यकता होती है। उन्होंने एक फीचर जोड़ा जहाँ AI जो हो रहा है उसके टेक्स्ट विवरण को भी "पढ़ता" है।

उपमा: यह एक मूक फिल्म देखने बनाम नैरेटर के साथ फिल्म देखने जैसा है। यदि वीडियो धुंधला है, तो नैरेटर का यह कहना कि, "अब वह बोल्ट को कस रहा है," AI को 100% सुनिश्चित होने के लिए अतिरिक्त सुराग देता है।

परिणाम

इस "मैप" दृष्टिकोण का उपयोग करके, ट्रेनिंग के दौरान "अतिरिक्त कोण" जोड़कर, और एक "नैरेटर" को सुनकर, शोधकर्ताओं ने एक ऐसा AI बनाया है जो:

  1. बहुत अधिक सटीक है: इसने पिछले तरीकों को भारी अंतर (16% से अधिक) से पीछे छोड़ दिया।
  2. बहुत तेज़/हल्का है: इसे चलाने के लिए सुपरकंप्यूटर की आवश्यकता नहीं है क्योंकि यह कच्चे वीडियो डेटा के पहाड़ के बजाय नोट्स के "मैप" को देख रहा है।

संक्षेप में: GLEVR AI को वीडियो को गति के धुंधलेपन के रूप में देखना बंद करने और उन्हें जुड़े हुए घटनाओं के एक तार्किक क्रम के रूप में देखना सिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →