Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning
Video-o3 लंबी-वीडियो मल्टी-हॉप रीजनिंग के लिए एक नवीन फ्रेमवर्क है जो टास्क-डिकपल्ड अटेंशन मास्किंग के माध्यम से नेटिव, इटरेटिव क्लू सीकिंग को सक्षम करके यूनिफॉर्म सैंपलिंग की सीमाओं को दूर करता है और एक वेरीफिएबल ट्रजेक्टरी-गाइडेड रिवॉर्ड के साथ MLVU और Video-Holmes जैसे बेंचमार्क पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप 30 मिनट की एक फिल्म में रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन आपके पास इसे देखने के लिए केवल कुछ ही सेकंड हैं। वर्तमान के अधिकांश AI मॉडल इसे करने के लिए हर कुछ सेकंड में पूरी फिल्म का एक त्वरित, धुंधला स्नैपशॉट लेते हैं और फिर तुरंत उत्तर का अनुमान लगाते हैं। यह पूरी घास के ढेर को एक बार देखने और उम्मीद करने जैसा है कि आपने उसमें सुई देख ली होगी। आप अक्सर सुई को मिस कर देते हैं क्योंकि वह "घास" (बोरिंग हिस्सों) में छिपी होती है, या आप बहुत अधिक जानकारी से अभिभूत हो जाते हैं।
Video-o3 एक नया AI फ्रेमवर्क है जो खेल बदल देता है। देखने के बजाय, यह एक आवर्धक लेंस (magnifying glass) के साथ एक जासूस की तरह काम करता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. जासूस का दृष्टिकोण (Native Interleaved Clue Seeking)
पूरी फिल्म देखने और फिर अनुमान लगाने के बजाय, Video-o3 थोड़ा सा देखता है, सोचता है, और फिर निर्णय लेता है: "मुझे यह देखने के लिए इस विशिष्ट 5-सेकंड के हिस्से पर ज़ूम करने की आवश्यकता है कि क्या हो रहा है।"
- यह कैसे काम करता है: यह सिस्टम से वीडियो के एक विशिष्ट खंड को "क्रॉप" करने (जैसे फिल्म के रील से छोटा टुकड़ा काटना) के लिए कहता है ताकि उसे करीब से देखा जा सके।
- लूप (The Loop): यह इस प्रक्रिया को दोहराता है। देखें सोचें एक सुराग पर ज़ूम करें फिर से सोचें दूसरे सुराग पर ज़ूम करें।
- परिणाम: यह उत्तर को टुकड़ों में बनाता है, केवल वीडियो के उन हिस्सों को देखते हुए जो वास्तव में मायने रखते हैं, बाकी को अनदेखा करते हुए।
2. "विभाजित ध्यान" की समस्या (Task-Decoupled Attention Masking)
कल्पना कीजिए कि एक जासूस अपराध स्थल को देखते हुए साथ ही साथ एक रिपोर्ट लिखने की कोशिश कर रहा है। यदि वे दोनों काम एक ही समय में करने की कोशिश करते हैं, तो वे भ्रमित हो सकते हैं। वे अपराध स्थल को देख तो सकते हैं लेकिन जो वे देख रहे हैं उसके बजाय अपनी याददाश्त से कुछ लिख सकते हैं। इसे "नकली सोच" (fake thinking) कहा जाता है।
- समाधान: Video-o3 एक विशेष "मास्किंग" तकनीक का उपयोग करता है।
- जब AI सुराग खोज रहा होता है (वीडियो को स्कैन कर रहा होता है), तो उसे उस अंतिम उत्तर को अनदेखा करने के लिए मजबूर किया जाता है जिसे वह शायद लिख रहा होगा। यह पूरी तरह से सबूत खोजने पर ध्यान केंद्रित करता है।
- जब AI उत्तर लिख रहा होता है, तो उसे कच्चे वीडियो फुटेज को अनदेखा करने और केवल उन सुरागों पर ध्यान केंद्रित करने के लिए मजबूर किया जाता है जो उसने अभी-अभी खोजे हैं।
- उपमा: यह उस छात्र की तरह है जिसे केवल "पढ़ाई" के चरण के दौरान अपनी पाठ्यपुस्तक देखने की अनुमति है, और केवल "परीक्षा" के चरण के दौरान अपने नोट्स देखने की अनुमति है। यह उन्हें नकल करने या भ्रमित होने से रोकता है, यह सुनिश्चित करता है कि उनका अंतिम उत्तर ठोस सबूतों पर आधारित है।
3. "स्टॉप साइन" (Verifiable Trajectory-Guided Reward)
एक जासूस सैद्धांतिक रूप से हर एक फ्रेम को देखने के लिए अनंत काल तक ज़ूम कर सकता है, जिससे बहुत अधिक समय लगेगा और इसमें बहुत अधिक पैसा (कंप्यूटिंग पावर) खर्च होगा।
- समाधान: Video-o3 को एक विशेष रिवॉर्ड सिस्टम के साथ प्रशिक्षित किया गया है।
- यदि AI जल्दी और सटीक रूप से उत्तर खोज लेता है, तो उसे एक बड़ा "गोल्ड स्टार" (रिवॉर्ड) मिलता है।
- यदि AI अनावश्यक रूप से ज़ूम करना जारी रखता है जब उसके पास पहले से ही उत्तर है, तो उसे "पेनल्टी" (रिवॉर्ड कम हो जाता है) मिलती है।
- उपमा: यह "Hot and Cold" गेम की तरह है। AI सीखता है कि जैसे ही उसे "Hot" (पर्याप्त सबूत) महसूस होता है, खोज को रोकना है। यह कुशल होना सीखता है, खाली कमरों में समय बर्बाद करने के बजाय ठीक उसी समय रुक जाता है जब उसने पहेली सुलझा ली होती है।
4. प्रशिक्षण का मैदान (Seeker-173K)
AI को एक जासूस बनने के लिए सिखाने के लिए, आप केवल उसे एक किताब नहीं दे सकते; आपको उसे हजारों अभ्यास केस देने होंगे जहाँ उसे सुराग खोजने के लिए संघर्ष करना पड़े।
- डेटासेट: शोधकर्ताओं ने Seeker-173K नामक एक विशाल डेटासेट बनाया है। इसमें 173,000 उदाहरण हैं जहाँ AI को इस चक्र का अभ्यास करने के लिए मजबूर किया जाता है: देखें ज़ूम करें सोचें फिर से देखें हल करें।
- परिणाम: क्योंकि इसने इन विशिष्ट "सुराग-खोजने" कार्यों पर बहुत अधिक अभ्यास किया, इसलिए यह पिछले मॉडलों की तुलना में जटिल वीडियो प्रश्नों को हल करने में बहुत बेहतर हो गया।
निचोड़ (The Bottom Line)
Video-o3 कंप्यूटर के लिए लंबी वीडियो देखने का एक स्मार्ट तरीका है। पूरी फिल्म को एक साथ याद करने के बजाय, यह एक मानव जासूस की तरह कार्य करता है: यह दृश्य को स्कैन करता है, महत्वपूर्ण विवरणों पर ज़ूम करता है, बिंदुओं को जोड़ता है, और जैसे ही उसके पास सबूत होते हैं, वह रुक जाता है। यह इसे बहुत तेज़, अधिक सटीक और लंबी वीडियो में छिपी जटिल पहेलियों को हल करने में बेहतर बनाता है।
प्रदर्शन: परीक्षणों में, इस दृष्टिकोण ने AI को पुराने तरीकों (जो केवल वीडियो पर "नज़र डालते" थे) की तुलना में वीडियो पहेलियों को काफी उच्च सटीकता (जैसे, एक प्रमुख बेंचमार्क पर 72.1%) के साथ हल करने की अनुमति दी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।