MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks
MAVEN एक मल्टी-स्टेज एजेंटिक पाइपलाइन है जो पदानुक्रमित परिशोधन (hierarchical refinement) और डोमेन अनुकूलन (domain adaptation) के माध्यम से चेन-ऑफ-थॉट ट्रेसेस के साथ उच्च-गुणवत्ता वाला, संरचित वीडियो रीजनिंग डेटा स्वचालित रूप से उत्पन्न करता है, जो जटिल इवेंट रीजनिंग बेंचमार्क पर फाइन-ट्यून किए गए विजन लैंग्वेज मॉडल्स के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल मूवी सीन समझना सिखाने की कोशिश कर रहे हैं, जैसे कि ट्रैफिक दुर्घटना या गोदाम में लड़ाई का दृश्य। यदि आप केवल रोबोट को कच्चा वीडियो दिखा देते हैं और पूछते हैं, "क्या हुआ?", तो वह भ्रमित हो सकता है, विवरण चूक सकता है, या अपनी ओर से बातें बना सकता है (हैलुसिनेशन)।
यह पेपर MAVEN पेश करता है, जो एक स्मार्ट सिस्टम है जिसे इन रोबोटों के लिए एक बहुत ही व्यवस्थित "पटकथा लेखक" (scriptwriter) और "शिक्षक" के रूप में कार्य करने के लिए डिज़ाइन किया गया है। वीडियो को सीधे रोबोट को खिलाने के बजाय, MAVEN पहले वीडियो को एक संरचित कहानी में तोड़ देता है, और फिर उस कहानी का उपयोग प्रशिक्षण प्रश्न बनाने के लिए करता है।
MAVEN कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है:
1. तीन-चरणीय "ज़ूम-इन" प्रक्रिया (Three-Stage "Zoom-In" Process)
अधिकांश सिस्टम पूरे वीडियो का वर्णन एक बार में करने की कोशिश करते हैं, जैसे कोई पर्यटक छुट्टियों का संक्षिप्त सारांश देता है। वे अक्सर छोटे, महत्वपूर्ण विवरणों को छोड़ देते हैं। MAVEN इसे अलग तरह से करता है, तीन-चरणीय "ज़ूम" दृष्टिकोण का उपयोग करके:
- चरण 1: वाइड शॉट (ग्लोबल कॉन्टेक्स्ट): सबसे पहले, यह पूरे दृश्य को देखता है। क्या बारिश हो रही है? क्या दिन है या रात? सड़क कैसी दिखती है? यह मंच तैयार करता है।
- चरण 2: टाइमलाइन (डेंस इवेंट्स): इसके बाद, यह मुख्य घटनाओं की एक टाइमलाइन बनाता है, यह नोट करता है कि चीजें ठीक कब शुरू हुईं और कब समाप्त हुईं।
- चरण 3: क्लोज-अप (फाइन डिटेल्स): अंत में, यह सूक्ष्म विवरणों को पकड़ने के लिए छोटे, संक्षिप्त क्लिप्स पर ज़ूम करता है, जैसे कि किसी व्यक्ति का इधर-उधर देखना या किसी छोटी वस्तु को उठाना।
2. "मास्टर ब्लूप्रिंट" (MSTED)
यह सबसे महत्वपूर्ण हिस्सा है। सीधे प्रश्न पूछने के बजाय, MAVEN उन तीनों विवरणों को लेता है और उन्हें एक एकल, पूर्ण "मास्टर ब्लूप्रिंट" में मिला देता है जिसे MSTED कहा जाता है।
इसे एक जासूस द्वारा गवाह से पूछताछ करने से पहले एक पूर्ण केस फाइल लिखने के रूप में समझें।
- यह क्यों मायने रखता है: यदि रोबोट वीडियो से सीधे उत्तर का अनुमान लगाने की कोशिश करता है, तो वह तथ्य गढ़ सकता है। लेकिन यदि रोबोट को पहले "मास्टर ब्लूप्रिंट" पढ़ने के लिए मजबूर किया जाता है, तो वह केवल उसी के आधार पर उत्तर दे सकता है जो वहां स्पष्ट रूप से लिखा है। वह मनगढ़ंत बातें नहीं कर सकता क्योंकि ब्लूप्रिंट ही एकमात्र सत्य है जिसका उसे उपयोग करने की अनुमति है।
3. "स्मार्ट एडिटर" (एजेंट-ड्रिवन अडैप्टेशन)
आमतौर पर, यदि आप एक रोबोट को नए विषय (जैसे ट्रैफिक कैमरों से वेयरहाउस सुरक्षा में स्विच करना) के बारे में सिखाना चाहते हैं, तो आपको रोबोट के लिए सभी निर्देशों को मैन्युअल रूप से फिर से लिखना होगा। इसमें बहुत अधिक मानवीय समय लगता है।
MAVEN में एक अंतर्निहित "स्मार्ट एडिटर" (एक AI एजेंट) है।
- यह कैसे काम करता है: आप बस एडिटर को एक नए संसार का विवरण देते हैं (जैसे, "यह ऊंचे शेल्फ और फोर्कलिफ्ट वाला एक गोदाम है") और कुछ उदाहरण प्रश्न।
- जादू: एडिटर ऊपर दिए गए तीन चरणों के लिए सभी निर्देशों को स्वचालित रूप से फिर से लिख देता है। वह समझ जाता है, "ओह, एक गोदाम में, मुझे शर्ट के नीचे छिपी चीजों को देखना होगा, न कि केवल रेड लाइट पार करती कारों को।" वह यह सब बिना किसी मानव के कोड को छुए करता है।
4. "क्वालिटी कंट्रोल लूप"
यदि मनुष्य उत्तरों की समीक्षा करते हैं और गलतियाँ पाते हैं, तो MAVEN केवल "ओप्स" नहीं कहता। यह अपनी विफलता की जांच करने वाले एक जासूस की तरह कार्य करता है।
- यह पूछता है: "क्या हमने वीडियो विवरण में विवरण मिस कर दिया? या क्या हम सही प्रश्न पूछने में विफल रहे?"
- यदि विवरण खराब था, तो यह विवरण प्रॉम्प्ट्स को ठीक करता है।
- यदि संरचना गलत थी (उदाहरण के लिए, वीडियो के हिस्से बहुत छोटे थे और एक घटना को बीच में ही काट दिया गया), तो यह संरचनात्मक समस्या को ठीक करने के लिए पाइपलाइन में एक नया चरण भी जोड़ देता है।
उन्होंने क्या हासिल किया?
टीम ने 5,300 से अधिक ट्रैफिक वीडियो (स्ट्रीट कैमरा और कार डैशकैम दोनों से) को लेबल करने के लिए MAVEN का उपयोग किया। फिर उन्होंने इस डेटा का उपयोग Cosmos-Reason2 नामक रोबोट मॉडल को प्रशिक्षित करने के लिए किया।
- परिणाम: प्रशिक्षित रोबोट तर्क करने (reasoning) में अविश्वसनीय रूप से कुशल हो गया। एक निजी परीक्षण पर, इसने Gemini 2.5 Pro और Gemini 3.1 Flash जैसे शीर्ष स्तर के मॉडलों को भी पीछे छोड़ दिया।
- आश्चर्य: भले ही उन्होंने इसे केवल स्ट्रीट कैमरा (CCTV) वीडियो पर प्रशिक्षित किया था, फिर भी इसने डैशकैम परीक्षणों पर बड़े मॉडलों के समान प्रदर्शन किया। यह बताता है कि रोबोट ने केवल कारों के दिखने को याद नहीं किया, बल्कि घटनाओं के बारे में तर्क करने का तरीका सीखा।
- बहुमुखी प्रतिभा: उन्होंने दिखाया कि कैसे "स्मार्ट एडिटर" को निर्देशों को अनुकूलित करने देकर सिस्टम वेयरहाउस वीडियो और सार्वजनिक सुरक्षा फुटेज (जैसे सुरंगों में लड़ाई) पर भी काम कर सकता है, जिससे यह साबित होता है कि यह बिना मानव पुन: इंजीनियरिंग के विभिन्न दुनियाओं को संभाल सकता है।
संक्षेप में: MAVEN एक ऐसा सिस्टम है जो अव्यवस्थित वीडियो को एक पूर्ण, संरचित कहानी में बदल देता है, उस कहानी का उपयोग रोबोटों को तार्किक रूप से सोचना सिखाने के लिए करता है, और इसमें एक स्व-सुधार करने वाला एडिटर है जो स्वचालित रूप से नए वातावरण के अनुकूल हो सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।