← नवीनतम पेपर
💻 computer science

Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning

Video-o3 लंबी-वीडियो मल्टी-हॉप रीजनिंग के लिए एक नवीन फ्रेमवर्क है जो टास्क-डिकपल्ड अटेंशन मास्किंग के माध्यम से नेटिव, इटरेटिव क्लू सीकिंग को सक्षम करके यूनिफॉर्म सैंपलिंग की सीमाओं को दूर करता है और एक वेरीफिएबल ट्रजेक्टरी-गाइडेड रिवॉर्ड के साथ MLVU और Video-Holmes जैसे बेंचमार्क पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करता है।

मूल लेखक: Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, Ziang Yan, Yi Wang, Hongjie Zhang, Yali Wang, Limin Wang

प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, Ziang Yan, Yi Wang, Hongjie Zhang, Yali Wang, Limin Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप 30 मिनट की एक फिल्म में रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन आपके पास इसे देखने के लिए केवल कुछ ही सेकंड हैं। वर्तमान के अधिकांश AI मॉडल इसे करने के लिए हर कुछ सेकंड में पूरी फिल्म का एक त्वरित, धुंधला स्नैपशॉट लेते हैं और फिर तुरंत उत्तर का अनुमान लगाते हैं। यह पूरी घास के ढेर को एक बार देखने और उम्मीद करने जैसा है कि आपने उसमें सुई देख ली होगी। आप अक्सर सुई को मिस कर देते हैं क्योंकि वह "घास" (बोरिंग हिस्सों) में छिपी होती है, या आप बहुत अधिक जानकारी से अभिभूत हो जाते हैं।

Video-o3 एक नया AI फ्रेमवर्क है जो खेल बदल देता है। देखने के बजाय, यह एक आवर्धक लेंस (magnifying glass) के साथ एक जासूस की तरह काम करता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. जासूस का दृष्टिकोण (Native Interleaved Clue Seeking)

पूरी फिल्म देखने और फिर अनुमान लगाने के बजाय, Video-o3 थोड़ा सा देखता है, सोचता है, और फिर निर्णय लेता है: "मुझे यह देखने के लिए इस विशिष्ट 5-सेकंड के हिस्से पर ज़ूम करने की आवश्यकता है कि क्या हो रहा है।"

  • यह कैसे काम करता है: यह सिस्टम से वीडियो के एक विशिष्ट खंड को "क्रॉप" करने (जैसे फिल्म के रील से छोटा टुकड़ा काटना) के लिए कहता है ताकि उसे करीब से देखा जा सके।
  • लूप (The Loop): यह इस प्रक्रिया को दोहराता है। देखें \rightarrow सोचें \rightarrow एक सुराग पर ज़ूम करें \rightarrow फिर से सोचें \rightarrow दूसरे सुराग पर ज़ूम करें।
  • परिणाम: यह उत्तर को टुकड़ों में बनाता है, केवल वीडियो के उन हिस्सों को देखते हुए जो वास्तव में मायने रखते हैं, बाकी को अनदेखा करते हुए।

2. "विभाजित ध्यान" की समस्या (Task-Decoupled Attention Masking)

कल्पना कीजिए कि एक जासूस अपराध स्थल को देखते हुए साथ ही साथ एक रिपोर्ट लिखने की कोशिश कर रहा है। यदि वे दोनों काम एक ही समय में करने की कोशिश करते हैं, तो वे भ्रमित हो सकते हैं। वे अपराध स्थल को देख तो सकते हैं लेकिन जो वे देख रहे हैं उसके बजाय अपनी याददाश्त से कुछ लिख सकते हैं। इसे "नकली सोच" (fake thinking) कहा जाता है।

  • समाधान: Video-o3 एक विशेष "मास्किंग" तकनीक का उपयोग करता है।
    • जब AI सुराग खोज रहा होता है (वीडियो को स्कैन कर रहा होता है), तो उसे उस अंतिम उत्तर को अनदेखा करने के लिए मजबूर किया जाता है जिसे वह शायद लिख रहा होगा। यह पूरी तरह से सबूत खोजने पर ध्यान केंद्रित करता है।
    • जब AI उत्तर लिख रहा होता है, तो उसे कच्चे वीडियो फुटेज को अनदेखा करने और केवल उन सुरागों पर ध्यान केंद्रित करने के लिए मजबूर किया जाता है जो उसने अभी-अभी खोजे हैं।
  • उपमा: यह उस छात्र की तरह है जिसे केवल "पढ़ाई" के चरण के दौरान अपनी पाठ्यपुस्तक देखने की अनुमति है, और केवल "परीक्षा" के चरण के दौरान अपने नोट्स देखने की अनुमति है। यह उन्हें नकल करने या भ्रमित होने से रोकता है, यह सुनिश्चित करता है कि उनका अंतिम उत्तर ठोस सबूतों पर आधारित है।

3. "स्टॉप साइन" (Verifiable Trajectory-Guided Reward)

एक जासूस सैद्धांतिक रूप से हर एक फ्रेम को देखने के लिए अनंत काल तक ज़ूम कर सकता है, जिससे बहुत अधिक समय लगेगा और इसमें बहुत अधिक पैसा (कंप्यूटिंग पावर) खर्च होगा।

  • समाधान: Video-o3 को एक विशेष रिवॉर्ड सिस्टम के साथ प्रशिक्षित किया गया है।
    • यदि AI जल्दी और सटीक रूप से उत्तर खोज लेता है, तो उसे एक बड़ा "गोल्ड स्टार" (रिवॉर्ड) मिलता है।
    • यदि AI अनावश्यक रूप से ज़ूम करना जारी रखता है जब उसके पास पहले से ही उत्तर है, तो उसे "पेनल्टी" (रिवॉर्ड कम हो जाता है) मिलती है।
  • उपमा: यह "Hot and Cold" गेम की तरह है। AI सीखता है कि जैसे ही उसे "Hot" (पर्याप्त सबूत) महसूस होता है, खोज को रोकना है। यह कुशल होना सीखता है, खाली कमरों में समय बर्बाद करने के बजाय ठीक उसी समय रुक जाता है जब उसने पहेली सुलझा ली होती है।

4. प्रशिक्षण का मैदान (Seeker-173K)

AI को एक जासूस बनने के लिए सिखाने के लिए, आप केवल उसे एक किताब नहीं दे सकते; आपको उसे हजारों अभ्यास केस देने होंगे जहाँ उसे सुराग खोजने के लिए संघर्ष करना पड़े।

  • डेटासेट: शोधकर्ताओं ने Seeker-173K नामक एक विशाल डेटासेट बनाया है। इसमें 173,000 उदाहरण हैं जहाँ AI को इस चक्र का अभ्यास करने के लिए मजबूर किया जाता है: देखें \rightarrow ज़ूम करें \rightarrow सोचें \rightarrow फिर से देखें \rightarrow हल करें।
  • परिणाम: क्योंकि इसने इन विशिष्ट "सुराग-खोजने" कार्यों पर बहुत अधिक अभ्यास किया, इसलिए यह पिछले मॉडलों की तुलना में जटिल वीडियो प्रश्नों को हल करने में बहुत बेहतर हो गया।

निचोड़ (The Bottom Line)

Video-o3 कंप्यूटर के लिए लंबी वीडियो देखने का एक स्मार्ट तरीका है। पूरी फिल्म को एक साथ याद करने के बजाय, यह एक मानव जासूस की तरह कार्य करता है: यह दृश्य को स्कैन करता है, महत्वपूर्ण विवरणों पर ज़ूम करता है, बिंदुओं को जोड़ता है, और जैसे ही उसके पास सबूत होते हैं, वह रुक जाता है। यह इसे बहुत तेज़, अधिक सटीक और लंबी वीडियो में छिपी जटिल पहेलियों को हल करने में बेहतर बनाता है।

प्रदर्शन: परीक्षणों में, इस दृष्टिकोण ने AI को पुराने तरीकों (जो केवल वीडियो पर "नज़र डालते" थे) की तुलना में वीडियो पहेलियों को काफी उच्च सटीकता (जैसे, एक प्रमुख बेंचमार्क पर 72.1%) के साथ हल करने की अनुमति दी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →