MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation
MARQUIS एक तीन-चरणीय पाइपलाइन है जो क्वेरी विस्तार (query expansion), संरचित साक्ष्य निष्कर्षण (structured evidence extraction) और नियंत्रित लेख निर्माण (controlled article generation) के माध्यम से जटिल क्वेरी हैंडलिंग और मल्टी-वीडियो संश्लेषण की सीमाओं को संबोधित करके वीडियो रिट्रीवल-ऑगमेंटेड जनरेशन को महत्वपूर्ण रूप से बढ़ाता है, जिससे MAGMaR2026 साझा कार्य पर अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक पत्रकार हैं जिसे एक जटिल घटना, जैसे कि कोई भीषण तूफान या राजनीतिक चुनाव, के बारे में एक विस्तृत समाचार लेख लिखने का काम सौंपा गया है। हालाँकि, आपके पास ज़मीन पर मौजूद कोई अकेला रिपोर्टर नहीं है; आपके पास उस घटना के 100,000 अलग-अलग वीडियो क्लिप्स का एक पुस्तकालय है, जिन्हें सैकड़ों अलग-अलग कैमरों द्वारा रिकॉर्ड किया गया है। आपका काम सही क्लिप्स खोजना, यह समझना है कि वास्तव में उनमें क्या हुआ था, और एक सुसंगत कहानी लिखना है जो ठीक से बताए कि किस वीडियो ने किस तथ्य को प्रमाणित किया।
यह वह चुनौती है जिसे MARQUIS सिस्टम हल करता है। पेपर का तर्क है कि वर्तमान AI उपकरण इस विशिष्ट कार्य में खराब हैं। या तो वे जटिल सवाल होने पर सही वीडियो नहीं ढूंढ पाते, या वे एक साथ बहुत सारे वीडियो पढ़ने की कोशिश में इतने अभिभूत हो जाते हैं कि वे 'हैलुसिनेशन' (अपनी ओर से बातें बनाना) करने लगते हैं।
MARQUIS इसे एक तीन-चरणीय समाचार कक्ष असेंबली लाइन की तरह काम करके हल करता है, जो इस विशाल कार्य को छोटे, प्रबंधनीय चरणों में विभाजित करता है।
चरण 1: जासूस की खोज (रिट्रीवल/प्राप्ति)
समस्या: यदि आप एक AI से पूछते हैं, "मुझे 2025 के चुनाव परिणामों के बारे में सब कुछ बताओ," तो एक मानक सर्च इंजन भ्रमित हो सकता है। यह पूरे लंबे प्रश्न को एक एकल "सर्च कोड" (एम्बेडिंग) में बदलने की कोशिश करता है, जिससे अक्सर बारीकियां छूट जाती हैं। यह एक घास के ढेर में विशिष्ट सुई खोजने के लिए पूरे घास के ढेर का वर्णन करने जैसा है।
MARQUIS का समाधान:
एक बड़ी खोज के बजाय, MARQUIS एक जासूस की तरह काम करता है जो एक बड़े मामले को छोटे-छोटे सुरागों में तोड़ देता है।
- विखंडन (Decomposition): यह आपके बड़े प्रश्न को 20+ छोटे, विशिष्ट प्रश्नों में तोड़ देता है (जैसे, "लिबरल्स ने कितनी सीटें जीतीं?" "मतदान प्रतिशत क्या था?" "कौन से जिले बदले?")।
- समानांतर खोज (Parallel Search): यह उन प्रत्येक छोटे प्रश्नों के लिए अलग-अलग वीडियो लाइब्रेरी की खोज करता है।
- फ्यूजन (The Fusion): यह उन छोटे प्रश्नों के लिए मिले वीडियो की सूचियों को लेता है और उन्हें एक मास्टर लिस्ट में मिला देता है।
- री-रैंकर (The Re-Ranker): अंत में, एक विशेष "वीडियो जज" शीर्ष उम्मीदवारों को देखता है और उन्हें फिर से व्यवस्थित करता है ताकि यह सुनिश्चित हो सके कि सबसे प्रासंगिक वीडियो सबसे ऊपर हों।
परिणाम: यह तरीका पूरे घास के ढेर का अनुमान लगाने के बजाय विशिष्ट सुइयों को खोजने के लिए आवर्धक लेंस (magnifying glass) का उपयोग करने जैसा है। इसने सिस्टम की सही वीडियो खोजने की क्षमता को 0.195 से बढ़ाकर 0.759 कर दिया (एक बड़ी छलांग)।
चरण 2: तथ्य-जांचकर्ता (सूचना निष्कर्षण)
समस्या: एक बार जब आपके पास वीडियो आ जाते हैं, तो आप पूरे वीडियो फ़ाइल को सीधे लेखक को नहीं दे सकते। लेखक को विशिष्ट तथ्यों की आवश्यकता होती है। इसके अलावा, वीडियो पेचीदा हो सकते हैं; कभी-कभी कोई व्यक्ति ऐसी बात कहता है जो सच नहीं होती, या कैमरा एंगल भ्रामक हो सकता है।
MARQUIS का समाधान:
MARQUIS केवल वीडियो को "पढ़ता" नहीं है; यह विशिष्ट "दावे" (claims) निकालता है और फिर उन्हें कैलिब्रेट (परिशोधित) करता है।
- तीन प्रकार के नोट्स:
- सामान्य नोट्स: "लाल कोट पहने एक महिला बोल रही है।" (ऐसे तथ्य जो बाद में उपयोगी हो सकते हैं)।
- लक्षित दावे (Targeted Claims): "वीडियो में 50 लोगों को बचाया गया दिखाया गया है।" (विशेष रूप से आपके प्रश्न का उत्तर देने वाले तथ्य)।
- प्रश्न-उत्तर (Q&A): सिस्टम वीडियो से विशिष्ट प्रश्न पूछता है और उत्तर प्राप्त करता है।
- कैलिब्रेशन (झूठ पकड़ने वाला यंत्र): यह एक महत्वपूर्ण चरण है। इससे पहले कि लेखक किसी दावे को देखे, एक "कैलिब्रेटर" मॉडल दावे और मूल वीडियो को अगल-बगल रखकर देखता है। यह पूछता है: "क्या यह वीडियो वास्तव में इस वाक्य को सिद्ध करता है?" यह एक प्रायिकता स्कोर (0 से 1) असाइन करता है। यदि वीडियो दावे का समर्थन नहीं करता है, तो उसे हटा दिया जाता है।
उपमा: कल्पना कीजिए कि तथ्य-जांचकर्ताओं की एक टीम है जो लेखक द्वारा लिखे गए हर वाक्य को पढ़ती है और फिर सत्यापन के लिए कच्चे फुटेज पर वापस जाती है। यदि फुटेज मेल नहीं खाता है, तो उस वाक्य को कचरे में फेंक दिया जाता है।
चरण 3: लेखक (लेख निर्माण)
समस्या: अच्छे तथ्यों के साथ भी, एक सहज लेख लिखना कठिन है। यदि आप एक लेखक को 500 असंबद्ध बुलेट पॉइंट्स देते हैं, तो वे एक अव्यवस्थित सूची लिख सकते हैं। यदि आप उन्हें 2 घंटे का वीडियो ट्रांसक्रिप्ट देते हैं, तो वे विवरणों में खो सकते हैं और मुख्य बिंदु भूल सकते हैं।
MARQUIS का समाधान:
सिस्टम लेख लिखने के तीन तरीके प्रदान करता है, लेकिन सबसे अच्छा एक संरचित दृष्टिकोण का उपयोग करता है:
- क्लस्टरिंग (Clustering): यह सत्यापित तथ्यों को विषयों (जैसे, "हताहत", "बचाव प्रयास", "सरकारी प्रतिक्रिया") में समूहित करता है।
- सारांश (Summarizing): यह प्रत्येक विषय के लिए एक संक्षिप्त, उद्धृत (cited) वाक्य लिखता है।
- पॉलिशिंग (Polishing): यह उन वाक्यों को एक सहज, पठनीय समाचार कहानी में पिरोता है, यह सुनिश्चित करते हुए कि प्रत्येक तथ्य का एक साइटेशन (जैसे,
[वीडियो #45, 0:12-0:15]) हो।
"रिकर्सिव" विकल्प (MARQUIS-RLM):
पेपर एक विशेष "मैनेजर" AI (Recursive Language Models पर आधारित) भी पेश करता है। केवल एक बार लिखने के बजाय, यह मैनेजर एक प्रोजेक्ट मैनेजर के साथ एक स्थायी नोटबुक की तरह काम करता है।
- यह अपने पास मौजूद तथ्यों को देखता है।
- इसे एहसास होता है, "मेरे पास उत्तरी जिले के हताहतों की संख्या गायब है।"
- यह विशेष रूप से उस गायब जानकारी के लिए चरण 1 और 2 में वापस जाता है, उस जानकारी को जोड़ता है, और संघर्षों (conflicts) की जांच करता है।
- केवल तभी जब नोटबुक पूरी और सुसंगत हो जाती है, यह अंतिम लेख लिखता है।
निचोड़ (The Bottom Line)
पेपर का दावा है कि समस्या को विभाजित करके—स्मार्ट तरीके से खोजकर, तथ्यों को सख्ती से सत्यापित करके, और लेखन प्रक्रिया को व्यवस्थित करके—MARQUIS वर्तमान तरीकों की तुलना में बहुत बेहतर परिणाम देता है।
- रिट्रीवल (प्राप्ति): इसने सही वीडियो बहुत अधिक बार खोजे।
- जेनरेशन (निर्माण): इसने ऐसे लेख तैयार किए जिन्हें मनुष्यों ने बेसलाइन की तुलना में उच्च रेटिंग (3.09 के मुकाबले 3.83 आउट ऑफ 5) दी, क्योंकि वे अधिक सुसंगत और बेहतर ढंग से स्रोतबद्ध थे।
- विश्वसनीयता: सिस्टम को "ग्राउंडेड" (आधारित) बनाया गया है, जिसका अर्थ है कि यह उन तथ्यों को लिखने से इनकार कर देता है जो वीडियो साक्ष्य द्वारा समर्थित नहीं हैं, जिससे अन्य AI सिस्टमों में होने वाले "हैलुसिनेशन" से बचा जा सके।
संक्षेप में, MARQUIS 100,000 वीडियो के अराजक ढेर को एक विश्वसनीय, अच्छी तरह से स्रोतबद्ध समाचार लेख में बदल देता है, क्योंकि यह एक अकेले, अभिभूत लेखक के बजाय एक अत्यधिक संगठित, बहु-चरणीय समाचार कक्ष की तरह काम करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।