← नवीनतम पेपर
💻 computer science

Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA

यह शोध पत्र VideoTreeSearch (VTS) का प्रस्ताव करता है, जो एक स्व-सुधारात्मक एजेंट फ्रेमवर्क है जो ग्राउंडेड लॉन्ग-वीडियो QA को स्पष्ट बैकट्रैकिंग ऑपरेशन्स के साथ एक एडेप्टिव टेम्पोरल ट्री पर इटरेटिव सर्च के रूप में मॉडल करता है, जो शुरुआती गलतियों से उबरने में सक्षम बनाकर और कई बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त करके पूर्व विधियों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Ce Zhang, Ziyang Wang, Yulu Pan, Oluwatumininu Oguntola, Pranav Wagh, Qiyu Wu, Hiromi Wakaki, Mohit Bansal, Gedas Bertasius

प्रकाशित 2026-07-20
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ce Zhang, Ziyang Wang, Yulu Pan, Oluwatumininu Oguntola, Pranav Wagh, Qiyu Wu, Hiromi Wakaki, Mohit Bansal, Gedas Bertasius

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप घंटों लंबी एक फिल्म में एक विशिष्ट, बहुत ही सूक्ष्म क्षण को खोजने की कोशिश कर रहे हैं। शायद आपको ठीक से देखना है कि शेफ ने ओवन में डालने से ठीक पहले कटोरे में क्या डाला था, लेकिन वीडियो एक पूरी लंबाई का कुकिंग ट्यूटोरियल है। यदि आप पूरे वीडियो को तेज़ी से स्कैन करते हैं, तो आप उस पल भर की क्रिया को मिस कर सकते हैं। लेकिन यदि आप हर एक फ्रेम को सामान्य गति से देखते हैं, तो इसमें अनंत काल लग जाएगा। यह "ग्राउंडेड लॉन्ग-वीडियो क्वेश्चन अनस्वियरिंग" (Grounded Long-Video Question Answering) की चुनौती है। यह एक ऐसा कार्य है जहाँ कंप्यूटर को न केवल एक लंबे वीडियो के बारे में उत्तर देना होता है, बल्कि उस सटीक कुछ सेकंडों की ओर भी इशारा करना होता है जहाँ वह उत्तर छिपा हुआ है।

कुछ समय के लिए, वैज्ञानिकों ने इसे एक "कैंची" उपकरण देकर हल करने की कोशिश की। कंप्यूटर एक समय सीमा का अनुमान लगाता, वीडियो को वहां से काटता और परिणाम देखता। यदि उसका अनुमान गलत होता, तो वह फिर से काटने की कोशिश करता। लेकिन यह दृष्टिकोण एक घास के ढेर में सुई खोजने जैसा था जहाँ आपको केवल घास के ढेर को आधा काटने की अनुमति दी जाती है; यदि आपने गलत हिस्सा काट दिया, तो आप आसानी से दूसरे पक्ष को आज़माने के लिए वापस नहीं जा सकते। आप बस गलत टुकड़े को छोटा और छोटा करते जाते हैं जब तक कि आप हार न मान लें। यह शोध पत्र खोजने का एक स्मार्ट तरीका पेश करता है, जो वीडियो को एक मानचित्र (मैप) में बदल देता है जिसे कंप्यूटर खोज सकता है, पीछे हट सकता है और अपनी गलतियों को सुधार सकता है, बिल्कुल एक जासूस की तरह जो रहस्य सुलझा रहा हो।


जासूस का मानचित्र: VTS वीडियो रहस्य को कैसे सुलझाता है

VideoTreeSearch (VTS) से मिलिए, एक नया फ्रेमवर्क जिसे कंप्यूटर को विशेषज्ञ वीडियो जासूस बनाने के लिए डिज़ाइन किया गया है। इस शोध पत्र के पीछे के शोधकर्ताओं ने महसूस किया कि वीडियो खोजने का पुराना तरीका बहुत अनाड़ी था। पिछले तरीके उन व्यक्ति की तरह थे जो केवल आगे बढ़ सकता था, लगातार वीडियो क्लिप को क्रॉप करके उसे छोटा करता जा रहा था। यदि वे शुरुआत में गलती करते—मान लीजिए, उन्हें लगा कि उत्तर पहले दस मिनट में है जबकि वह वास्तव में अंतिम दस मिनट में था—तो वे फंस जाते। उनके पास यह कहने का कोई तरीका नहीं था कि, "रुको, मैं गलत दिशा में गया था," और वापस जाकर दूसरा रास्ता आज़माने का कोई विकल्प नहीं था। वे बस गलत गड्ढे को खोदते रहते।

पेड़ का रूपक (The Tree Analogy)
इसे ठीक करने के लिए, लेखकों ने वीडियो को एक पेड़ में बदल दिया। कल्पना कीजिए कि पूरा वीडियो एक विशाल पेड़ का तना है। वह तना कुछ बड़ी शाखाओं में विभाजित होता है, जो प्रमुख दृश्यों या अध्यायों का प्रतिनिधित्व करते हैं। वे शाखाएं फिर छोटी टहनियों में विभाजित होती हैं, और टहनियां छोटी पत्तियों में विभाजित होती हैं।

  • जड़ (The Root): पूरा वीडियो।
  • शाखाएं (The Branches): वीडियो के बड़े हिस्से जहाँ दृश्य बदल जाता है (जैसे किचन से डाइनिंग रूम में जाना)।
  • पत्तियां (The Leaves): वे सूक्ष्म, विशिष्ट क्षण जहाँ उत्तर छिपा हो सकता है।

महत्वपूर्ण बात यह है कि यह पेड़ समान आकार के टुकड़ों से नहीं बना है। इसके बजाय, कंप्यूटर वीडियो को देखता है और पेड़ को ठीक वहीं से काटता है जहाँ दृश्य की कहानी बदलती है। यदि एक दृश्य पांच मिनट तक चलता है, तो वह शाखा लंबी होती है; यदि एक दृश्य बस एक त्वरित झलक है, तो वह शाखा छोटी होती है। इसका मतलब है कि पेड़ का हर हिस्सा एक कहानी की इकाई के रूप में तर्कसंगत है, न कि केवल समय का एक यादृच्छिक टुकड़ा।

चार जादुई चालें
एक बार जब वीडियो एक पेड़ बन जाता है, तो कंप्यूटर एजेंट अब केवल "क्रॉप" नहीं करता। उसके पास इस मानचित्र पर नेविगेट करने के लिए चार विशिष्ट चालें हैं:

  1. ज़ूम इन (Zoom In): वीडियो के एक छोटे, अधिक विस्तृत भाग को देखने के लिए एक शाखा के नीचे जाना।
  2. ज़ूम आउट (Zoom Out): वापस पैरेंट ब्रांच (parent branch) पर ऊपर जाना यदि आपको एहसास होता है कि आप गलत दिशा में बहुत गहराई में चले गए हैं।
  3. शिफ्ट (Shift): उसी स्तर पर एक अलग शाखा की ओर बगल में जाना (जैसे वर्तमान कमरे के बजाय अगले कमरे की जाँच करना)।
  4. उत्तर (Answer): खोजना बंद करना और सटीक टाइम स्टैम्प के साथ अंतिम उत्तर देना।

सबसे रोमांचक हिस्सा ज़ूम आउट और शिफ्ट है। ये "मैंने गलती की, चलो फिर से कोशिश करते हैं" बटन हैं। पुराने तरीकों में, वापस जाना असंभव या बहुत कठिन था। VTS में, यह एक मानक, अंतर्निहित चाल है। एजेंट एक गलत शाखा में जा सकता है, यह महसूस कर सकता है कि यह एक डेड एंड (dead end) है, वापस ऊपर चढ़ सकता है, और सच खोजने के लिए एक अलग शाखा पर कूद सकता है।

जासूस को प्रशिक्षित करना
आप कंप्यूटर को सिर्फ एक पेड़ देकर यह उम्मीद नहीं कर सकते कि वह इसका उपयोग करना जान जाएगा। शोधकर्ताओं को एजेंट को यह सिखाना पड़ा कि गलतियों को कैसे संभालना है। उन्होंने एक विशेष प्रशिक्षण प्रक्रिया बनाई जहाँ उन्होंने जानबूझकर एजेंट को गलत रास्ते पर भेजा।

  • विचलन (The Detour): एजेंट को जानबूझकर एक गलत शाखा चुनने के लिए निर्देशित किया गया।
  • रिकवरी (The Recovery): फिर, उसे वापस ऊपर चढ़ने और सही रास्ता खोजने का तरीका पता लगाना था।

इन "विचलन-और-रिकवरी" (detour-and-recovery) परिदृश्यों का अभ्यास करके, एजेंट ने सीखा कि गलती करना खेल का अंत नहीं है; यह खोज का एक हिस्सा है। उसने सीखा कि यदि वह फंस जाता है, तो उसे अपने ज़ूम आउट और शिफ्ट टूल्स का उपयोग करके रिकवर करना चाहिए।

परिणाम
जब उन्होंने इस नए जासूस का तीन अलग-अलग वीडियो प्रश्न-उत्तर चुनौतियों पर परीक्षण किया, तो परिणाम प्रभावशाली थे।

  • CG-Bench टेस्ट पर, VTS ने सही समय अंतराल खोजने की क्षमता में पिछले सर्वश्रेष्ठ तरीके की तुलना में 12.5 अंक का सुधार किया।
  • Haystack-Ego4D टेस्ट पर (जो बहुत लंबे वीडियो का उपयोग करता है), इसने 7.4 अंक का सुधार किया।
  • सामान्य वीडियो प्रश्नों पर भी, जहाँ उसे सटीक समय नहीं खोजना था, इसने सटीकता में अन्य तरीकों को 7.1 अंक तक पीछे छोड़ दिया।

यह शोध पत्र सुझाव देता है कि यह "पदानुक्रमित खोज" (hierarchical search - परतों में खोजना) ही असली सफलता का मंत्र है। जब उन्होंने ज़ूम आउट या शिफ्ट करने की क्षमता को हटा दिया, तो प्रदर्शन काफी गिर गया। यह साबित करता है कि पीछे हटने (backtrack करने) की क्षमता ही इस सिस्टम को इतना अच्छा बनाती है।

यह क्यों मायने रखता है
लेखकों ने पाया कि VTS केवल अनुमान नहीं लगाता; यह अन्वेषण करता है। औसतन, इसे किसी समस्या को हल करने में लगभग 4.8 टर्न (कदम) लगते हैं, जबकि पुराने तरीकों ने आमतौर पर केवल 1 या 2 टर्न के बाद हार मान ली थी। नया एजेंट लगभग 60% खोजों में अपने बैकट्रैकिंग टूल्स का सक्रिय रूप से उपयोग करता है। यह केवल एक तेज़ कैलकुलेटर नहीं है; यह एक स्मार्ट खोजकर्ता है जो जानता है कि कब गलत होने को स्वीकार करना है और दूसरा रास्ता आज़माना है।

संक्षेप में, यह शोध पत्र दिखाता है कि लंबे वीडियो को फ्रेमों की एक सपाट सूची के बजाय एक संरचित मानचित्र की तरह मानने से, कंप्यूटर बहुत अधिक सटीकता के साथ जटिल प्रश्नों को हल कर सकते हैं। उन्हें पीछे हटने और दिशा बदलने के उपकरण देकर, हमने उन्हें घास के ढेर में सुई खोजने में बहुत बेहतर बना दिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →