← नवीनतम पेपर
💻 computer science

Action-Guided Attention for Video Action Anticipation

यह शोध पत्र एक्शन-गाइडेड अटेंशन (AGA) का प्रस्ताव करता है, जो एक नवीन अटेंशन मैकेनिज्म है जो वीडियो एक्शन एंटिसिपेशन में लेटेंट इंटेंशन्स (latent intentions) के मॉडलिंग को निर्देशित करने और सामान्यीकरण (generalization) में सुधार करने के लिए अनुमानित एक्शन सीक्वेंस का लाभ उठाता है, जैसा कि EPIC-Kitchens-100 बेंचमार्क पर इसके उत्कृष्ट प्रदर्शन और एक्शन डिपेंडेंसीज़ में व्याख्यात्मक अंतर्दृष्टि प्रदान करने की इसकी क्षमता से प्रदर्शित होता है।

मूल लेखक: Tsung-Ming Tai, Sofia Casarin, Andrea Pilzer, Werner Nutt, Oswald Lanz

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tsung-Ming Tai, Sofia Casarin, Andrea Pilzer, Werner Nutt, Oswald Lanz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कुकिंग शो देख रहे हैं, लेकिन आपको क्लिप के केवल पहले कुछ सेकंड ही देखने को मिलते हैं और फिर स्क्रीन काली हो जाती है। आपका काम यह अनुमान लगाना है कि शेफ आगे क्या करेगा। क्या वह प्याज काटेगा? क्या वह दूध डालेगा? क्या वह पैन गिरा देगा?

यह वीडियो एक्शन एन्टिसिपेशन (Video Action Anticipation) की चुनौती है। यह कठिन है क्योंकि पिछले फ्रेम्स (जो आप देखते हैं) अक्सर अस्पष्ट होते हैं। सिर्फ इसलिए कि एक शेफ हाथ में चाकू पकड़े हुए है, इसका मतलब यह नहीं है कि वह काटने वाला है; हो सकता है कि वह दराज खोलने वाला हो।

इन समस्याओं को हल करने की कोशिश कर रहे वर्तमान AI मॉडल उन छात्रों की तरह हैं जो विवरणों पर बहुत अधिक ध्यान केंद्रित करते हैं। वे शेफ के हाथ के पिक्सेल या चाकू की बनावट को इतनी गहराई से देखते हैं कि वे बड़ी तस्वीर को मिस कर देते हैं। वे ट्रेनिंग वीडियो से विशिष्ट दृश्य पैटर्न को याद कर लेते हैं, जिसका अर्थ है कि वे नए शेफ या अलग रसोई देखते ही भ्रमित हो जाते हैं। वे "ओवरफिट" (overfit) हो जाते हैं, जिसका अर्थ है कि वे विशिष्ट उदाहरणों को बहुत अच्छी तरह से सीख लेते हैं और सामान्यीकरण (generalize) करने में विफल रहते हैं।

इस पेपर के लेखक एक नया समाधान प्रस्तावित करते हैं जिसे एक्शन-गाइडेड अटेंशन (Action-Guided Attention - AGA) कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. "कहानीकार" बनाम "पिक्सेल देखने वाला" (The "Storyteller" vs. The "Pixel Peeker")

अधिकांश AI मॉडल एक वीडियो को फ्रेम दर फ्रेम देखते हैं, और केवल इस आधार पर अनुमान लगाने की कोशिश करते हैं कि पिक्सेल कैसे दिखते हैं।

AGA अलग है। केवल पिक्सेल को देखने के बजाय, यह AI से पूछता है: "जो हमने अब तक देखा है, उसके आधार पर, आपको क्या लगता है कि अभी क्या हो रहा है?"

AI वर्तमान क्रिया (जैसे, "शेफ चाकू पकड़े हुए है") के बारेв "सर्वश्रेष्ठ अनुमान" लगाता है। फिर यह उस अनुमान का उपयोग अतीत को देखने के लिए एक मार्गदर्शक के रूप में करता है।

  • उपमा: कल्पना कीजिए कि आप एक रहस्यमयी उपन्यास के अंत का अनुमान लगाने की कोशिश कर रहे हैं। अंतिम पृष्ठ के फॉन्ट को घूरने के बजाय, आप खुद से पूछते हैं, "यदि जासूस ने वर्तमान में बंदूक पकड़ी हुई है, तो किस तरह की पिछली घटनाएं तर्कसंगत होंगी?" आप कहानी (क्रिया) का उपयोग यह तय करने के लिए करते हैं कि पिछले अध्यायों (वीडियो इतिहास) के कौन से हिस्से महत्वपूर्ण हैं।

2. "टॉर्च" (एक्शन-गाइडेड अटेंशन)

इस प्रणाली में, AI के पिछले अनुमान एक टॉर्च (Flashlight) की तरह काम करते हैं।

  • यदि AI अनुमान लगाता है कि शेफ "अलमारी खोल रहा है," तो टॉर्च उन पिछले क्षणों पर चमकती है जहाँ अलमारी खोली गई थी, और उन क्षणों को अनदेखा करती है जहाँ फ्रिज खोला गया था।
  • यह वीडियो इतिहास को फ़िल्टर करने के लिए इन "एक्शन अनुमानों" का उपयोग करता है। यह मॉडल को बताता है: "बैकग्राउंड के कचरे पर ध्यान न दें; उन विशिष्ट क्षणों पर ध्यान दें जब शेफ ने अलमारी का हैंडल पकड़ा था।"

यह AI को विजुअल शोर (जैसे बैकग्राउंड में बिल्ली का चलना) से विचलित होने से रोकता है और इसे घटनाओं के तार्किक क्रम पर ध्यान केंद्रित करने के लिए मजबूर करता है।

3. "स्मार्ट मिक्सर" (एडैप्टिव गेटिंग)

कभी-कभी, अतीत बहुत महत्वपूर्ण होता है। कभी-कभी, जो अभी हो रहा है वह सबसे महत्वपूर्ण होता है।

  • उपमा: एक डीजे (DJ) की तरह सोचें जो दो गानों को मिक्स कर रहा है। एक ट्रैक "इतिहास" (जो पहले हुआ) है, और दूसरा "लाइव फीड" (जो अभी हो रहा है) है।
  • AGA के पास एक स्मार्ट मिक्सर (जिसे एडैप्टिव गेटिंग कहा जाता है) है जो स्वचालित रूप से यह तय करता है कि प्रत्येक ट्रैक की आवाज़ कितनी तेज़ रखनी है।
    • यदि शेफ एक धीमी, स्थिर क्रिया के बीच में है, तो मिक्सर इतिहास वाले ट्रैक की आवाज़ बढ़ा देता है।
    • यदि शेफ अचानक एक पैन गिरा देता है, तो मिक्सर तुरंत लाइव फीड वाले ट्रैक की आवाज़ बढ़ा देता है।
  • यह सुनिश्चित करता है कि AI अतीत में न फंसा रहे या वर्तमान को अनदेखा न करे।

4. "टाइम मशीन" (पोस्ट-ट्रेनिंग एनालिसिस)

इस पेपर की सबसे शानदार विशेषताओं में से एक यह है कि यह मॉडल "पारदर्शी" है। क्योंकि AI अपने ही अनुमानों का उपयोग अपना ध्यान केंद्रित करने के लिए करता है, शोधकर्ता प्रशिक्षण समाप्त होने के बाद इससे प्रश्न पूछ सकते हैं।

  • फॉरवर्ड एनालिसिस (Forward Analysis): "हे AI, तुमने भविष्यवाणी की कि शेफ 'फ्रिज बंद करने वाला है।' उस निर्णय को लेने के लिए तुमने अतीत के किन क्षणों को देखा?"
    • परिणाम: मॉडल कह सकता है, "मैंने उस क्षण को देखा जब शेफ ने खाना बाहर निकाला था।"
  • बैकवर्ड एनालिसिस (Backward Analysis - काउंटरफैक्चुअल्स): यह एक "क्या होगा अगर" (What If) मशीन की तरह है। शोधकर्ता पूछते हैं, "यदि शेफ 'फ्रिज बंद करने' के बजाय 'पैन उठाने वाला' होता, तो आपके निश्चित होने के लिए अतीत कैसा होना चाहिए था?"
    • परिणाम: मॉडल को एहसास हो सकता है, "आह, यदि शेफ ने पहले स्पैटुला उठाया होता, तो मैं उच्च विश्वास के साथ 'पैन उठाने' की भविष्यवाणी करता।"

यह साबित करता है कि मॉडल केवल रैंडम अनुमान नहीं लगा रहा है; इसने क्रियाओं के बीच तार्किक संबंध (जैसे, "स्पैटुला उठाना" आमतौर पर "पैन उठाने" की ओर ले जाता है) सीख लिया है।

परिणाम

लेखकों ने इसका परीक्षण EPIC-Kitchens-100 डेटासेट पर किया, जो प्रथम-व्यक्ति (first-person) कुकिंग वीडियो का एक विशाल संग्रह है।

  • परिणाम: AGA ने पिछले तरीकों की तुलना में बेहतर प्रदर्शन किया, विशेष रूप से उन वीडियो पर जिन्हें उसने पहले कभी नहीं देखा था।
  • क्यों? क्योंकि इसने केवल रसोई के दृश्य रूप को याद नहीं किया; इसने खाना बनाने की क्रियाओं के तर्क को सीखा। इसने अच्छा सामान्यीकरण (generalize) किया, जिसका अर्थ है कि यह केवल ट्रेनिंग डेटा में देखे गए दृश्यों को दोहराने के बजाय, नई रसोई और नए शेफ के साथ भविष्य की क्रियाओं की भविष्यवाणी कर सकता है।

संक्षेप में, AGA AI को पिक्सेल को घूरना बंद करने और कहानी के बारे में सोचना सिखाता है, और अतीत के सबसे प्रासंगिक हिस्सों पर अपना ध्यान केंद्रित करने के लिए अपने स्वयं के अनुमानों का उपयोग करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →