← नवीनतम पेपर
🤖 AI

ENTER: Event Based Interpretable Reasoning for VideoQA

यह शोध पत्र ENTER को पेश करता है, जो एक व्याख्यात्मक (interpretable) VideoQA सिस्टम है जो वीडियो घटनाओं और उनके संबंधों को संरचनात्मक रूप से दर्शाने के लिए इवेंट ग्राफ का उपयोग करता है, जिससे उत्पन्न कोड के माध्यम से सुदृढ़ और व्याख्या योग्य तर्क सक्षम होता है जो टॉप-डाउन प्लानिंग और बॉटम-अप विजुअल प्रोसेसिंग के बीच के अंतर को प्रभावी ढंग से पाटता है।

मूल लेखक: Hammad Ayyubi, Junzhang Liu, Ali Asgarov, Zaber Ibn Abdul Hakim, Najibul Haque Sarker, Zhecan Wang, Chia-Wei Tang, Hani Alomari, Md. Atabuzzaman, Xudong Lin, Naveen Reddy Dyava, Shih-Fu Chang, Chris T
प्रकाशित 2026-04-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hammad Ayyubi, Junzhang Liu, Ali Asgarov, Zaber Ibn Abdul Hakim, Najibul Haque Sarker, Zhecan Wang, Chia-Wei Tang, Hani Alomari, Md. Atabuzzaman, Xudong Lin, Naveen Reddy Dyava, Shih-Fu Chang, Chris Thomas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वीडियो के आधार पर किसी रहस्य को सुलझाने की कोशिश कर रहे हैं, जैसे कि यह पता लगाना कि क्यों एक विरोध प्रदर्शन हिंसक हो गया या एक कुत्ता कैसे एक नया करतब सीखा।

वर्तमान में वीडियो के आधार पर यह करने वाले अधिकांश AI सिस्टम दो बहुत अलग प्रकार के जासूसों की तरह हैं, और दोनों में कमियां हैं:

  1. "टॉप-डाउन" (ऊपर से नीचे) जासूस: यह जासूस पहले सवाल पढ़ता है और तुरंत सामान्य ज्ञान के आधार पर उत्तर का अनुमान लगाने लगता है। वे कह सकते हैं, "विरोध प्रदर्शन आमतौर पर शांतिपूर्ण होते हैं," और वहीं रुक जाते हैं। वे वास्तविक वीडियो फुटेज को अनदेखा कर देते हैं, इसलिए यदि वीडियो में दंगा दिखाया गया है, तो वे गलत साबित होते हैं। वे तेज़ हैं और अपने तर्क को समझा सकते हैं, लेकिन वे विशिष्ट विवरणों के प्रति अंधे होते हैं।

  2. "बॉटम-अप" (नीचे से ऊपर) जासूस: यह जासूस वीडियो के हर एक फ्रेम को देखता है, और सब कुछ याद कर लेता है। वे विवरण पकड़ने में माहिर हैं लेकिन यह समझाने में बहुत खराब हैं कि उन्हें उत्तर कैसे मिला। वे बस एक 'मैजिक 8-बॉल' की तरह परिणाम थमा देते हैं। आप उन पर भरोसा नहीं कर सकते क्योंकि आपको पता ही नहीं चलता कि वे केवल अनुमान लगा रहे हैं या वास्तव में सच देख रहे हैं।

प्रवेश होता है (इवेंट बेस्ड इंटरप्रिटेबल रीजनिंग - ENTER) एक नए प्रकार के जासूस के रूप में जो इन दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को मिलाता है। यहाँ बताया गया है कि यह कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए:

"इवेंट ग्राफ" (जासूस का व्हाइटबोर्ड)

वीडियो को केवल देखने या केवल प्रश्न पढ़ने के बजाय, ENTER पहले वीडियो को एक जीवित मानचित्र (जिसे इवेंट ग्राफ कहा जाता है) में बदल देता है।

  • नोड्स (बिंदु): कल्पना कीजिए कि वीडियो में होने वाली हर महत्वपूर्ण घटना व्हाइटबोर्ड पर एक बिंदु है। एक बिंदु है "प्रदर्शनकारियों का मार्च करना," दूसरा है "पुलिस द्वारा आंसू गैस छोड़ना," और तीसरा है "भीड़ का भागना।"
  • एजेस (रेखाएं): अब, इन बिंदुओं को जोड़ने वाली रेखाएं खींचें।
    • "बाद में" (After) लेबल वाली एक रेखा "मार्च करने" को "आंसू गैस छोड़ने" से जोड़ती है।
    • "क्योंकि" (Because) लेबल वाली एक रेखा "आंसू गैस छोड़ने" को "भागने" से जोड़ती है।
    • "का हिस्सा" (Part of) लेबल वाली एक रेखा "विरोध" को "मार्च करने" से जोड़ती है।

यह मानचित्र केवल शब्दों की सूची नहीं है; यह कारण और प्रभाव की एक संरचित कहानी है।

"कोड" (जासूस की योजना)

एक बार जब मानचित्र तैयार हो जाता है, तो ENTER केवल अनुमान नहीं लगाता। यह विशेष रूप से उस मानचित्र को पढ़ने के लिए डिज़ाइन किया गया एक सरल कंप्यूटर प्रोग्राम (कोड) लिखता है।

  • यदि प्रश्न है "क्या विरोध प्रदर्शन शांतिपूर्ण था?", तो कोड कहता है: " 'विरोध' वाले बिंदु पर जाओ। उससे जुड़ी रेखाओं को देखो। क्या उनमें से कोई भी 'हिंसक' या 'आंसू गैस' कहता है? यदि हाँ, तो 'नहीं' लौटाओ।"
  • यही वह इंटरप्रिटेबल (व्याख्या योग्य) हिस्सा है। आप वास्तव में कोड को पढ़ सकते हैं और देख सकते हैं कि AI अपने निष्कर्ष तक कैसे पहुँचा। यह बिल्कुल वैसा ही है जैसे आप जासूस को व्हाइटबोर्ड पर सबूत की ओर इशारा करते हुए देखते हैं और कहते हैं, "देखो? यह रेखा इसे साबित करती है।"

"सेल्फ-करेक्शन" (जासूस की दूसरी नज़र)

कभी-कभी, शुरुआती मानचित्र पहेली का एक हिस्सा भूल जाता है। शायद वीडियो धुंधला था, या AI ने एक सूक्ष्म विवरण मिस कर दिया। अतीत में, जासूस बस एक गलत उत्तर दे देता था।

ENTER के पास एक स्मार्ट सेल्फ-करेक्शन सिस्टम है:

  1. मानचित्र की जाँच करें: कोड चलता है और महसूस करता है, "रुको, मेरे पास पर्याप्त जानकारी नहीं है जिससे मैं उत्तर दे सकूँ।"
  2. ज़ूम इन (सघन ग्राफ): यह टेक्स्ट विवरण की ओर वापस जाता है और पूछता है, "क्या आप मुझे विरोध प्रदर्शन के बारे में अधिक विवरण दे सकते हैं?" यह मानचित्र में और अधिक बिंदु जोड़कर उसे फिर से बनाता है।
  3. वीडियो को दोबारा देखें (मल्टीमॉडल): यदि टेक्स्ट अभी भी पर्याप्त नहीं है, तो यह कहता है, "ठीक है, मुझे वास्तविक वीडियो क्लिप को फिर से देखने की आवश्यकता है।" यह अंतिम सुराग पाने के लिए उस विशिष्ट 5 सेकंड के हिस्से को निकालता है जहाँ क्रिया हुई थी।

यह एक लूप में तब तक चलता रहता है जब तक कि मानचित्र उत्तर देने के लिए पर्याप्त पूर्ण न हो जाए।

यह एक बड़ी बात क्यों है?

  • विश्वास: क्योंकि यह कोड लिखता है और एक मानचित्र बनाता है, आप देख सकते हैं कि इसने उत्तर सही (या गलत) क्यों पाया। यदि यह गलत है, तो आप मानचित्र को देख सकते हैं और कह सकते हैं, "आह, इसने बंदूक को गोली से जोड़ने वाली रेखा को मिस कर दिया।"
  • सटीकता: वास्तव में वीडियो को देखने के कारण (केवल अनुमान लगाने के बजाय), यह "टॉप-डाउन" जासूसों की तुलना में सही उत्तर अधिक बार देता है।
  • लचीलापन: यह छोटे क्लिप और लंबी फिल्मों दोनों पर काम करता है क्योंकि यह केवल फ्रेम की सूची नहीं, बल्कि कहानी का एक मानचित्र बनाता है।

संक्षेप में: ENTER एक ऐसे जासूस की तरह है जो अपराध स्थल का एक विस्तृत मानचित्र बनाता है, उस मानचित्र के आधार पर रहस्य को सुलझाने के लिए एक चरण-दर-चरण योजना लिखता है, और यदि मानचित्र अधूरा दिखता है तो सबूतों की फिर से जांच करने से नहीं डरता। यह आपको सही उत्तर देता है और साथ ही उसका प्रमाण भी दिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →