ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding
ViSAGE एक मल्टीमॉडल एजेंटिक मेमोरी फ्रेमवर्क है जो क्रॉस-मोडल बाइंडिंग, द्विदिश परिशोधन (bidirectional refinement) और मल्टी-एजेंट क्रॉस-वेरिफिकेशन के माध्यम से स्व-सुधारात्मक, एंटिटी-केंद्रित मेमोरी का निर्माण करके दीर्घकालिक वीडियो समझ को बढ़ाता है ताकि पहचान संबंधी भ्रम और मतिभ्रम (hallucinations) को रोका जा सके, जिससे अत्याधुनिक बेसलाइनों की तुलना में 5.9% सटीकता में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक ऐसे रहस्य को सुलझाने की कोशिश कर रहे हैं जो एक पूरी फिल्म में फैला हुआ है, लेकिन आपको केवल एक बार में एक स्थिर फ्रेम (frozen frame) देखने की अनुमति है, और हर कुछ मिनटों में, आपकी याददाश्त मिट जाती है। यह आधुनिक आर्टिफिशियल इंटेलिजेंस (AI) का दैनिक संघर्ष है जब वह लंबी वीडियो को समझने की कोशिश करता है। आज के सबसे स्मार्ट AI मॉडल एक ऐसे प्रतिभाशाली जासूस की तरह हैं जो किताब के एक पन्ने को तो पूरी तरह से पढ़ सकते हैं, लेकिन यदि आप उन्हें 40 मिनट की फिल्म थमा दें, तो वे घबरा जाते हैं। वे पूरी कहानी को एक छोटे से मानसिक डिब्बे में समेटने की कोशिश करते हैं, या वे फिल्म को छोटे, अलग-थलग टुकड़ों में काट देते हैं। समस्या क्या है? जब आप एक कहानी को काटते हैं, तो आप उसके जुड़ाव खो देते हैं। आप भूल जाते हैं कि पात्र कौन हैं, आप उनके नाम मिला देते हैं, और आप पहले दृश्य के बारे में जंगली अंदाजे लगाने लगते हैं क्योंकि आप पिछले दृश्य के सुरागों को याद नहीं रख पाते।
यहीं से "लॉन्ग-फॉर्म वीडियो अंडरस्टैंडिंग" (long-form video understanding) का क्षेत्र आता है। वैज्ञानिक कंप्यूटर को घंटों का वीडियो देखना, विवरण याद रखना और इस बारे में कठिन सवालों के जवाब देना सिखाने की कोशिश कर रहे हैं कि क्या हुआ, किसने किया और क्यों। लक्ष्य एक ऐसा AI बनाना है जो न केवल पिक्सेल देखे बल्कि एक कहानी को समझे, और शुरुआत से लेकर क्रेडिट्स तक लोगों और वस्तुओं का ध्यान रखे। लेकिन वर्तमान विधियाँ अक्सर विफल हो जाती हैं क्योंकि वे वीडियो को सारांशित करने में बहुत आक्रामक होती हैं, जिससे वे उन सूक्ष्म विवरणों को फेंक देती हैं जो एक व्यक्ति को दूसरे से अलग बताने के लिए आवश्यक होते हैं, या वे एक ऐसे लूप में फंस जाती हैं जहाँ वे पाँच मिनट पहले हुई गलती को ठीक नहीं कर पातीं क्योंकि वे केवल "वर्तमान" को देख रही होती हैं।
यहाँ ViSAGE आता है, जो झेजियांग यूनिवर्सिटी और शियान यूनिवर्सिटी के शोधकर्ताओं द्वारा डिजाइन किया गया एक नया सिस्टम है जो AI एजेंटों के लिए एक सुपर-पावर्ड, स्व-सुधारने वाली (self-correcting) स्मृति की तरह कार्य करता है। मानक AI मेमोरी को एक बिखरी हुई नोटबुक की तरह समझें जहाँ आप फिल्म देखते समय नोट्स लिखते हैं, लेकिन एक बार जब आप पन्ना पलट देते हैं, तो आप गलत अनुमान को ठीक करने के लिए वापस नहीं जा सकते। यदि आप पहले दृश्य में किसी पात्र को "मारियो" समझते हैं, लेकिन बाद में पता चलता है कि वह वास्तव में "एम्मा" है, तो एक सामान्य सिस्टम उन्हें हमेशा के लिए मारियो ही कहता रहेगा, जिससे भ्रम और गलत उत्तर मिलते हैं। हालाँकि, ViSAGE एक ऐसे जासूस की तरह है जो संदिग्धों की एक मास्टर लिस्ट और घटनाओं की एक टाइमलाइन रखता है। जब कोई नया सुराग आता है—जैसे कि 30 मिनट के निशान पर किसी बातचीत में नाम सुनना—तो यह उसे केवल फाइल में दर्ज नहीं करता; यह शुरुआत से ही अपने नोट्स को फिर से लिखता है ताकि पूरी कहानी तर्कसंगत बनी रहे।
शोधकर्ताओं ने पाया कि इस "स्व-सुधारने वाले" सिस्टम का निर्माण करके, AI अंततः लंबी वीडियो के भ्रम को संभाल सकता है। उन्होंने एक ऐसा ढांचा बनाया जो "क्या हुआ" (घटनाओं) को "किसने किया" (पात्रों) से अलग करता है। जब AI किसी व्यक्ति को देखता है लेकिन अभी तक उसका नाम नहीं जानता, तो वह उसे एक अस्थायी लेबल देता है। बाद में, जब वीडियो में उसका नाम सामने आता है, तो ViSAGE एक "बैकवर्ड अपडेट" का उपयोग करके तुरंत पिछले सभी नोट्स को ठीक कर देता है, जिससे यह सुनिश्चित होता है कि प्रत्येक क्रिया को सही व्यक्ति से जोड़ा गया है। यह अपने काम की दोबारा जांच करने के लिए "एजेंटों" की एक टीम का भी उपयोग करता है। यदि AI किसी उत्तर के बारे में अनिश्चित है, तो कहानी बनाने (जिसे मतिभ्रम या hallucinating कहा जाता है) के बजाय, इसे "मुझे नहीं पता" कहने के लिए प्रोग्राम किया गया है, जो बहुत अधिक सुरक्षित और विश्वसनीय है।
अपने परीक्षणों में, यह नया दृष्टिकोण पिछले सर्वोत्तम तरीकों की तुलना में काफी बेहतर रहा। चुनौतीपूर्ण लॉन्ग-वीडियो टेस्ट पर, ViSAGE ने सबसे मजबूत मौजूदा सिस्टम की तुलना में 5.9% बेहतर सटीकता दिखाई। विशेष रूप से, इसने रोबोट से संबंधित वीडियो कार्यों पर 45.5%, वेब-आधारित वीडियो कार्यों पर 58.4%, और Video-MME-long बेंचमार्क पर भारी 79.1% का स्कोर किया। शोधकर्ताओं ने दिखाया कि मेमोरी त्रुटियों को ठीक करके, AI ने न केवल अधिक प्रश्नों के सही उत्तर दिए; बल्कि इसने खतरनाक गलतियाँ करना भी बंद कर दिया, जैसे कि यह आपस में मिला देना कि कौन क्या कर रहा था, और यह बताने में बहुत बेहतर हो गया कि उसके पास जानकारी की कमी है। यह सुझाव देता है कि लंबी कहानियों को समझने के लिए, AI को एक ऐसी स्मृति की आवश्यकता है जो बढ़ सके, बदल सके और स्वयं को सुधार सके, न कि केवल तथ्यों की एक स्थिर सूची की।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।