← नवीनतम पेपर
💻 computer science

EgoAction: Egocentric Action Composition with Reliability-Aware Temporal Fusion for the EPIC-KITCHENS Action Detection Challenge at CVPR 2026

यह शोध पत्र EgoAction प्रस्तुत करता है, जो EPIC-KITCHENS चुनौती में एगोसेंट्रिक एक्शन डिटेक्शन के लिए एक एकीकृत ढांचा है जो क्रिया (verb) और संज्ञा (noun) के टेम्पोरल मॉडलिंग को अलग करके और स्ट्रीम-विशिष्ट विश्वसनीयता के आधार पर उनके अनुमानों को अनुकूल रूप से संयोजित करने के लिए एक नवीन डायनेमिक वेटेड फ्यूजन रणनीति का उपयोग करके स्थानीयकरण सटीकता में सुधार करता है।

मूल लेखक: Zhiheng Fu, Zixu Li, Zhiwei Chen, Fangxu Liu, Yupeng Hu, Weili Guan, Liqiang Nie

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhiheng Fu, Zixu Li, Zhiwei Chen, Fangxu Liu, Yupeng Hu, Weili Guan, Liqiang Nie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रसोई में किसी के खाना बनाने का एक लंबा, अनएडिटेड वीडियो देख रहे हैं, जिसे उनके सिर पर लगे कैमरे से फिल्माया गया है। वीडियो हिलता हुआ है, कैमरा उनके सिर के साथ हिलता है, और दृश्य में बहुत सारी चीजें बिखरी हुई हैं। आपका काम एक अत्यंत सटीक संपादक की तरह होना है: आपको यह पता लगाना है कि कोई विशिष्ट क्रिया कब शुरू होती है और कब समाप्त होती है (जैसे "फ्रिज खोलना" या "पैन में चलाना") और उसे सही ढंग से लेबल करना है।

यह शोध पत्र, जिसका शीर्षक EgoAction है, एक ऐसे सिस्टम का वर्णन करता है जिसे एक विशिष्ट चुनौती (EPIC-KITCHENS Action Detection Challenge) को जीतने के लिए बनाया गया है। यह उन तीन मुख्य समस्याओं को हल करता है जो आमतौर पर कंप्यूटर को उलझा देती हैं।

यहाँ उनके समाधान का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

समस्या: दो विशेषज्ञ, एक अस्त-व्यस्त काम

शोधकर्ताओं ने महसूस किया कि यह पहचानना कि क्या हो रहा है (वह "संज्ञा" या "Noun", जैसे "कप") और क्या किया जा रहा है (वह "क्रिया" या "Verb", जैसे "लेना") दो अलग-अलग कौशल हैं जो अक्सर अलग-अलग तरीकों से विफल होते हैं।

  • "संज्ञा" विशेषज्ञ (The "Noun" Expert): यह विशेषज्ञ वस्तुओं को पहचानने में माहिर है। लेकिन यदि कप हाथ के पीछे छिपा है या बर्तनों के ढेर में दबा हुआ है, तो यह विशेषज्ञ भ्रमित हो जाता है और गलत अनुमान लगा सकता है कि क्रिया कब हुई।
  • "क्रिया" विशेषज्ञ (The "Verb" Expert): यह विशेषज्ञ हलचल या मूवमेंट को पहचानने में माहिर है। लेकिन यदि हलचल बहुत सूक्ष्म है या बहुत धीरे हो रही है, तो यह विशेषज्ञ भ्रमित हो जाता है और गलत शुरुआत या अंत का समय बता सकता है।

पुराना तरीका: पहले, सिस्टम दोनों विशेषज्ञों के अनुमानों का औसत (average) ले लेते थे। यदि संज्ञा विशेषज्ञ आश्वस्त था लेकिन क्रिया विशेषज्ञ पूरी तरह से खोया हुआ था, तो औसत सही उत्तर को गलत दिशा की ओर खींच लेता था, जिससे टाइमिंग खराब हो जाती थी।

समाधान: "विश्वसनीयता-जागरूक" मैनेजर (The "Reliability-Aware" Manager)

EgoAction सिस्टम एक स्मार्ट मैनेजर की तरह कार्य करता है जो केवल दो कर्मचारियों की राय का औसत नहीं निकालता; बल्कि, मैनेजर यह देखता है कि उस विशिष्ट क्षण में कौन अधिक आश्वस्त है।

1. दो अलग-अलग टीमें (Decoupled Detection)

कंप्यूटर को "फ्रिज खोलना" जैसे एक विशाल, जटिल विचार के रूप में सीखने के लिए मजबूर करने के बजाय, यह सिस्टम दो अलग-अलग टीमों को प्रशिक्षित करता है:

  • टीम संज्ञा (Team Noun): केवल वस्तुओं (फ्रिज, कप, चाकू) को देखती है।
  • टीम क्रिया (Team Verb): केवल क्रियाओं (खोलना, लेना, चलाना) को देखती है।
    वे स्वतंत्र रूप से काम करते हैं, और एक शक्तिशाली विजुअल ब्रेन (जिसे VideoMAE-L कहा जाता है) का उपयोग करते हैं, जिसे हजारों किचन वीडियो पर प्री-ट्रेन किया गया है।

2. "डायनेमिक वेटेड फ्यूजन" (The "Dynamic Weighted Fusion" - स्मार्ट मैनेजर)

यह इस शोध पत्र का सबसे बड़ा नवाचार है। जब दोनों टीमें अपना काम पूरा कर लेती हैं, तो वे एक क्रिया के लिए शुरू और अंत का समय प्रस्तावित करती हैं।

  • पुराना नियम: "चलो, तुम्हारे दोनों समय का औसत ले लेते हैं।"
  • नया नियम (DWF): सिस्टम प्रत्येक टीम के कॉन्फिडेंस स्कोर (confidence score) को देखता है।
    • यदि टीम संज्ञा 99% सुनिश्चित है कि वह एक कप देख रही है, लेकिन टीम क्रिया "लेने" की गति के बारे में केवल 50% सुनिश्चित है, तो सिस्टम कहता है, "ठीक है, हम इस क्लिप के शुरू और अंत के समय के लिए टीम संज्ञा के समय पर भरोसा करेंगे।"
    • यदि टीम क्रिया चिल्ला रही है, "मैं निश्चित रूप से चलाना देख रहा हूँ!" लेकिन टीम संज्ञा अनिश्चित है क्योंकि पैन धुंधला है, तो सिस्टम टीम क्रिया के समय पर भरोसा करता है।

यह एक रेफरी की तरह है जो कहता है, "जो खिलाड़ी स्थिर खड़ा होकर गेंद को देख रहा है, वही तय करेगा कि खेल कहाँ शुरू हुआ, न कि वह खिलाड़ी जो भ्रमित होकर इधर-उधर दौड़ रहा है।"

3. पहेली को जोड़ना (Composition)

एक बार जब सिस्टम सबसे विश्वसनीय टीम से सबसे अच्छा समय प्राप्त कर लेता है, तो वह सबसे अच्छे "क्रिया" और सबसे अच्छी "संज्ञा" को मिलाकर अंतिम लेबल (जैसे, "लेना" + "कप" = "कप लेना") बनाता है। यह शीर्ष 10 सबसे संभावित क्रियाओं और संज्ञाओं के लिए ऐसा करता है, और फिर डुप्लिकेट अनुमानों को हटाने के लिए एक फ़िल्टर (Soft-NMS) का उपयोग करता है ताकि आपको एक ही क्रिया के लिए दस "कप लेना" लेबल न मिलें।

परिणाम

इस सिस्टम का परीक्षण किचन वीडियो के एक विशाल डेटासेट पर किया गया।

  • इसने आधिकारिक लीडरबोर्ड पर 25.94% स्कोर (जिसे "mAP" कहा जाता है) प्राप्त किया, जिसने सभी प्रतिस्पर्धियों में से तीसरा स्थान प्राप्त किया।
  • इसने साबित किया कि "संज्ञा" और "क्रिया" विशेषज्ञों को अलग-अलग काम करने देने और उन्हें केवल तभी मिलाने से जब एक स्पष्ट रूप से अधिक विश्वसनीय हो, सिस्टम चीज़ें कब होती हैं, इसके बारे में कम गलतियाँ करता है।

सारांश

EeroAction को दो विशेषज्ञों की एक टीम (एक वस्तुओं के लिए और एक गति के लिए) के रूप में समझें जो एक हिलते हुए वीडियो पर काम कर रहे हैं। उनके विरोधाभासी विचारों का अंधाधुंध औसत निकालने के बजाय, सिस्टम एक स्मार्ट सुपरवाइजर के रूप में कार्य करता है: "अभी जो अधिक आश्वस्त है, वही सटीक समय तय करेगा।" रणनीति में इस सरल बदलाव ने उन्हें प्रतियोगिता में कई जटिल सिस्टमों को हराने में सक्षम बनाया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →