ENTER: Event Based Interpretable Reasoning for VideoQA
यह शोध पत्र ENTER को पेश करता है, जो एक व्याख्यात्मक (interpretable) VideoQA सिस्टम है जो वीडियो घटनाओं और उनके संबंधों को संरचनात्मक रूप से दर्शाने के लिए इवेंट ग्राफ का उपयोग करता है, जिससे उत्पन्न कोड के माध्यम से सुदृढ़ और व्याख्या योग्य तर्क सक्षम होता है जो टॉप-डाउन प्लानिंग और बॉटम-अप विजुअल प्रोसेसिंग के बीच के अंतर को प्रभावी ढंग से पाटता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक वीडियो के आधार पर किसी रहस्य को सुलझाने की कोशिश कर रहे हैं, जैसे कि यह पता लगाना कि क्यों एक विरोध प्रदर्शन हिंसक हो गया या एक कुत्ता कैसे एक नया करतब सीखा।
वर्तमान में वीडियो के आधार पर यह करने वाले अधिकांश AI सिस्टम दो बहुत अलग प्रकार के जासूसों की तरह हैं, और दोनों में कमियां हैं:
"टॉप-डाउन" (ऊपर से नीचे) जासूस: यह जासूस पहले सवाल पढ़ता है और तुरंत सामान्य ज्ञान के आधार पर उत्तर का अनुमान लगाने लगता है। वे कह सकते हैं, "विरोध प्रदर्शन आमतौर पर शांतिपूर्ण होते हैं," और वहीं रुक जाते हैं। वे वास्तविक वीडियो फुटेज को अनदेखा कर देते हैं, इसलिए यदि वीडियो में दंगा दिखाया गया है, तो वे गलत साबित होते हैं। वे तेज़ हैं और अपने तर्क को समझा सकते हैं, लेकिन वे विशिष्ट विवरणों के प्रति अंधे होते हैं।
"बॉटम-अप" (नीचे से ऊपर) जासूस: यह जासूस वीडियो के हर एक फ्रेम को देखता है, और सब कुछ याद कर लेता है। वे विवरण पकड़ने में माहिर हैं लेकिन यह समझाने में बहुत खराब हैं कि उन्हें उत्तर कैसे मिला। वे बस एक 'मैजिक 8-बॉल' की तरह परिणाम थमा देते हैं। आप उन पर भरोसा नहीं कर सकते क्योंकि आपको पता ही नहीं चलता कि वे केवल अनुमान लगा रहे हैं या वास्तव में सच देख रहे हैं।
प्रवेश होता है (इवेंट बेस्ड इंटरप्रिटेबल रीजनिंग - ENTER) एक नए प्रकार के जासूस के रूप में जो इन दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को मिलाता है। यहाँ बताया गया है कि यह कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए:
"इवेंट ग्राफ" (जासूस का व्हाइटबोर्ड)
वीडियो को केवल देखने या केवल प्रश्न पढ़ने के बजाय, ENTER पहले वीडियो को एक जीवित मानचित्र (जिसे इवेंट ग्राफ कहा जाता है) में बदल देता है।
- नोड्स (बिंदु): कल्पना कीजिए कि वीडियो में होने वाली हर महत्वपूर्ण घटना व्हाइटबोर्ड पर एक बिंदु है। एक बिंदु है "प्रदर्शनकारियों का मार्च करना," दूसरा है "पुलिस द्वारा आंसू गैस छोड़ना," और तीसरा है "भीड़ का भागना।"
- एजेस (रेखाएं): अब, इन बिंदुओं को जोड़ने वाली रेखाएं खींचें।
- "बाद में" (After) लेबल वाली एक रेखा "मार्च करने" को "आंसू गैस छोड़ने" से जोड़ती है।
- "क्योंकि" (Because) लेबल वाली एक रेखा "आंसू गैस छोड़ने" को "भागने" से जोड़ती है।
- "का हिस्सा" (Part of) लेबल वाली एक रेखा "विरोध" को "मार्च करने" से जोड़ती है।
यह मानचित्र केवल शब्दों की सूची नहीं है; यह कारण और प्रभाव की एक संरचित कहानी है।
"कोड" (जासूस की योजना)
एक बार जब मानचित्र तैयार हो जाता है, तो ENTER केवल अनुमान नहीं लगाता। यह विशेष रूप से उस मानचित्र को पढ़ने के लिए डिज़ाइन किया गया एक सरल कंप्यूटर प्रोग्राम (कोड) लिखता है।
- यदि प्रश्न है "क्या विरोध प्रदर्शन शांतिपूर्ण था?", तो कोड कहता है: " 'विरोध' वाले बिंदु पर जाओ। उससे जुड़ी रेखाओं को देखो। क्या उनमें से कोई भी 'हिंसक' या 'आंसू गैस' कहता है? यदि हाँ, तो 'नहीं' लौटाओ।"
- यही वह इंटरप्रिटेबल (व्याख्या योग्य) हिस्सा है। आप वास्तव में कोड को पढ़ सकते हैं और देख सकते हैं कि AI अपने निष्कर्ष तक कैसे पहुँचा। यह बिल्कुल वैसा ही है जैसे आप जासूस को व्हाइटबोर्ड पर सबूत की ओर इशारा करते हुए देखते हैं और कहते हैं, "देखो? यह रेखा इसे साबित करती है।"
"सेल्फ-करेक्शन" (जासूस की दूसरी नज़र)
कभी-कभी, शुरुआती मानचित्र पहेली का एक हिस्सा भूल जाता है। शायद वीडियो धुंधला था, या AI ने एक सूक्ष्म विवरण मिस कर दिया। अतीत में, जासूस बस एक गलत उत्तर दे देता था।
ENTER के पास एक स्मार्ट सेल्फ-करेक्शन सिस्टम है:
- मानचित्र की जाँच करें: कोड चलता है और महसूस करता है, "रुको, मेरे पास पर्याप्त जानकारी नहीं है जिससे मैं उत्तर दे सकूँ।"
- ज़ूम इन (सघन ग्राफ): यह टेक्स्ट विवरण की ओर वापस जाता है और पूछता है, "क्या आप मुझे विरोध प्रदर्शन के बारे में अधिक विवरण दे सकते हैं?" यह मानचित्र में और अधिक बिंदु जोड़कर उसे फिर से बनाता है।
- वीडियो को दोबारा देखें (मल्टीमॉडल): यदि टेक्स्ट अभी भी पर्याप्त नहीं है, तो यह कहता है, "ठीक है, मुझे वास्तविक वीडियो क्लिप को फिर से देखने की आवश्यकता है।" यह अंतिम सुराग पाने के लिए उस विशिष्ट 5 सेकंड के हिस्से को निकालता है जहाँ क्रिया हुई थी।
यह एक लूप में तब तक चलता रहता है जब तक कि मानचित्र उत्तर देने के लिए पर्याप्त पूर्ण न हो जाए।
यह एक बड़ी बात क्यों है?
- विश्वास: क्योंकि यह कोड लिखता है और एक मानचित्र बनाता है, आप देख सकते हैं कि इसने उत्तर सही (या गलत) क्यों पाया। यदि यह गलत है, तो आप मानचित्र को देख सकते हैं और कह सकते हैं, "आह, इसने बंदूक को गोली से जोड़ने वाली रेखा को मिस कर दिया।"
- सटीकता: वास्तव में वीडियो को देखने के कारण (केवल अनुमान लगाने के बजाय), यह "टॉप-डाउन" जासूसों की तुलना में सही उत्तर अधिक बार देता है।
- लचीलापन: यह छोटे क्लिप और लंबी फिल्मों दोनों पर काम करता है क्योंकि यह केवल फ्रेम की सूची नहीं, बल्कि कहानी का एक मानचित्र बनाता है।
संक्षेप में: ENTER एक ऐसे जासूस की तरह है जो अपराध स्थल का एक विस्तृत मानचित्र बनाता है, उस मानचित्र के आधार पर रहस्य को सुलझाने के लिए एक चरण-दर-चरण योजना लिखता है, और यदि मानचित्र अधूरा दिखता है तो सबूतों की फिर से जांच करने से नहीं डरता। यह आपको सही उत्तर देता है और साथ ही उसका प्रमाण भी दिखाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।