← नवीनतम पेपर
💻 computer science

REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding

यह शोध पत्र REVISOR को प्रस्तुत करता है, जो एक नवीन ढांचा (framework) है जो टेक्स्ट और विजुअल दोनों मोडैलिटीज के बीच मल्टीमॉडल इंट्रोस्पेक्टिव रीजनिंग को सक्षम करके लॉन्ग-फॉर्म वीडियो समझ को बढ़ाता है, जिसे रीजनिंग और वीडियो साक्ष्य के बीच कॉज़ल अलाइनमेंट सुनिश्चित करने के लिए ड्यूल एट्रिब्यूशन डिकपल्ड रिवॉर्ड मैकेनिज्म द्वारा समर्थित किया गया है।

मूल लेखक: Jiaze Li, Hao Yin, Wenhui Tan, Jingyang Chen, Boshen Xu, Yuxun Qu, Yijing Chen, Jianzhong Ju, Zhenbo Luo, Jian Luan

प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiaze Li, Hao Yin, Wenhui Tan, Jingyang Chen, Boshen Xu, Yuxun Qu, Yijing Chen, Jianzhong Ju, Zhenbo Luo, Jian Luan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "REVISOR" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

समस्या: "तेज़ सोचने वाला" जो बारीकियों को छोड़ देता है

कल्पना कीजिए कि आप एक 30 मिनट की फिल्म में किसी रहस्य को सुलझाने की कोशिश कर रहे हैं। आप एक जासूस (AI) हैं जो आमतौर पर स्क्रिप्ट (टेक्स्ट) पढ़कर अपराधों को सुलझाते हैं।

अतीत में, जब AI ने लंबे वीडियो पहेलियों को हल करने की कोशिश की, तो उसने "टेक्स्टुअल रिफ्लेक्शन" (Textual Reflection) नामक विधि का उपयोग किया। यह एक ऐसे जासूस की तरह है जो फिल्म देखता है, फिर अपनी आँखें बंद करता है और बस सोचता है, "हम्म, मैंने अभी क्या देखा? चलो अपने नोट्स फिर से पढ़ लेता हूँ।"

यह पेपर तर्क देता है कि लंबे वीडियो के लिए यह दृष्टिकोण विफल रहता है क्योंकि:

  1. वीडियो अराजक होते हैं: एक स्थिर फोटो के विपरीत, एक वीडियो गतिशील हिस्सों, तेज़ क्रियाओं और बदलते दृश्यों से भरा होता है। केवल "टेक्स्ट के बारे में सोचना" उस छोटी सी डिटेल को पकड़ने के लिए पर्याप्त नहीं है जो दो मिनट पहले हुई थी।
  2. AI खो जाता है: वास्तविक वीडियो को दोबारा देखे बिना, AI अक्सर भ्रमित हो जाता है (hallucinate) या एक ही गलती को दोहराता है, जैसे कि एक जासूस जो गलत संदिग्ध का ही अनुमान लगाता रहता है क्योंकि वह सबूतों की जांच करना भूल गया है।

समाधान: REVISOR (रिविंड बटन वाला जासूस)

लेखकों ने REVISOR नामक एक नया फ्रेमवर्क बनाया है। REVISOR को केवल एक जासूस के रूप में नहीं, बल्कि एक "मैजिक रिमोट कंट्रोल" वाले जासूस के रूप में सोचें।

केवल सोचने के लिए आँखें बंद करने के बजाय, REVISOR दो चरणों वाली प्रक्रिया का पालन करता है:

  1. पहला दौर (प्रारंभिक अनुमान - Initial Inference): AI वीडियो को तेज़ी से देखता है (जैसे फ़ास्ट-फॉरवर्ड स्कैन) और एक अनुमान लगाता है। लेकिन महत्वपूर्ण बात यह है कि वह यह भी कहता है, "रुको, मुझे मिनट 2 और मिनट 4 के बीच के हिस्से के बारे में यकीन नहीं है। मुझे वहां फिर से देखने की ज़रूरत है।"
  2. दूसरा दौर (विजुअल रिफ्लेक्शन - Visual Reflection): AI अपने "मैजिक रिमोट" का उपयोग करके विशेष रूप से उस 2 मिनट के हिस्से को रिविंड और ज़ूम इन करता है। वह केवल उसी हिस्से के उच्च-गुणवत्ता वाले, स्लो-मोशन फ्रेम प्राप्त करता है। फिर, वह अपने मूल अनुमान को इस ताज़ा, विस्तृत दृश्य साक्ष्य के साथ जोड़कर अपने उत्तर को सही करता है।

उपमा (Analogy):

  • पुराना तरीका: आप एक रेसिपी पढ़ते हैं, महसूस करते हैं कि शायद आपने कोई सामग्री छोड़ दी है, और अनुमान लगाते हैं कि शेफ ने खाना बनाते समय क्या कहा होगा। आप अंदाज़ा लगाते हैं।
  • REVISOR: आप एक रेसिपी पढ़ते हैं, महसूस करते हैं कि आपने एक सामग्री छोड़ दी है, कुकिंग शो को रोकते (pause) हैं, ठीक उसी सेकंड पर रिवाइंड करते हैं जब शेफ ने मसाला डाला था, उसे ध्यान से देखते हैं, और फिर खाना बनाना पूरा करते हैं।

गुप्त मंत्र: "कॉज़ल रिवॉर्ड" (DADR)

AI को यह सिखाना कठिन है। यदि आप केवल AI को कहते हैं, "सही उत्तर प्राप्त करो," तो वह बेईमानी कर सकता है। वह सही उत्तर दे सकता है लेकिन अपने "साक्ष्य" के रूप में वीडियो के गलत हिस्से की ओर इशारा कर सकता है।

इसे ठीक करने के लिए, लेखकों ने एक विशेष प्रशिक्षण नियम बनाया जिसे DADR (Dual Attribution Decoupled Reward) कहा जाता है।

उपमा (Analogy):
कल्पना कीजिए कि एक शिक्षक छात्र के टेस्ट को ग्रेड दे रहा है।

  • पुराना ग्रेडिंग: शिक्षक केवल यह देखता है कि अंतिम उत्तर सही है या नहीं। यदि छात्र का उत्तर "42" सही है, तो उसे 'A' ग्रेड मिलता है, भले ही उसने अपने तर्क के रूप में लिखा हो "क्योंकि चंद्रमा पनीर से बना है।"
  • DADR ग्रेडिंग: शिक्षक दो ग्रेड देता है:
    1. क्या अंतिम उत्तर सही है?
    2. क्या छात्र ने वास्तव में उस उत्तर को पाने के लिए पाठ्यपुस्तक के सही भाग को देखा था?

यदि छात्र सही उत्तर देता है लेकिन गलत पेज की ओर इशारा करता है, तो उसे खराब ग्रेड मिलता है। यह AI को यह सीखने के लिए मजबूर करता है कि सही वीडियो सेगमेंट को खोजना उतना ही महत्वपूर्ण है जितना कि सही उत्तर प्राप्त करना।

उन्होंने क्या पाया

इस पेपर का परीक्षण चार प्रमुख वीडियो समझ बेंचमार्क (जैसे VideoMME और LongVideoBench) पर किया गया।

  • परिणाम: REVISOR ने लगातार पिछले सर्वश्रेष्ठ मॉडलों को पछाड़ दिया। इसने कठिन, लंबे वीडियो पर सटीकता में लगभग 2% से 4% का सुधार किया।
  • मुख्य अंतर्दृष्टि: पेपर ने पाया कि लंबे वीडियो के लिए, शब्दों के बारे में अधिक गहराई से सोचने (textual reflection) के बजाय वीडियो को वापस देखना (visual reflection) बहुत अधिक महत्वपूर्ण है। वास्तव में, AI को अधिक टेक्स्ट तर्क लिखने के लिए मजबूर करने से उसका प्रदर्शन वास्तव में खराब हो गया। AI ने शब्दों के बारे में अधिक सोचने के बजाय महत्वपूर्ण क्षणों को फिर से देखने पर ध्यान केंद्रित करना सीख लिया।

सारांश

REVISOR लंबे वीडियो को समझने का एक नया तरीका है। केवल यह सोचने के बजाय कि उसने क्या देखा, यह महत्वपूर्ण क्षणों पर रुकने, रिवाइंड करने और ज़ूम इन करने के लिए सीखता है। AI को एक विशेष नियम के साथ प्रशिक्षित करके जो इसे वीडियो के गलत हिस्सों को देखने के लिए दंडित करता है, यह सिस्टम बिना दोबारा प्रशिक्षित हुए जटिल विजुअल पहेलियों को हल करने में बहुत बेहतर हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →