← नवीनतम पेपर
💻 computer science

LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts

यह शोध पत्र LoVR को प्रस्तुत करता है, जो 40,000 से अधिक सूक्ष्म क्लिप्स और एक नवीन VLM-आधारित परिशोधन पाइपलाइन के माध्यम से निर्मित उच्च गुणवत्ता वाले कैप्शन वाला एक बड़े पैमाने का लॉन्ग वीडियो-टेक्स्ट रिट्रीवल बेंचमार्क है, जिसे मौजूदा डेटासेट की सीमाओं को दूर करने और उन्नत मल्टीमॉडल रिट्रीवल मॉडल्स का कठोरता से मूल्यांकन करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Qifeng Cai, Hao Liang, Zhaoyang Han, Hejun Dong, Meiyi Qiang, Ruichuan An, Quanqing Xu, Bin Cui, Wentao Zhang

प्रकाशित 2026-02-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qifeng Cai, Hao Liang, Zhaoyang Han, Hejun Dong, Meiyi Qiang, Ruichuan An, Quanqing Xu, Bin Cui, Wentao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप तीन घंटे की एक फिल्म के भीतर एक विशिष्ट, बहुत ही सूक्ष्म क्षण को खोजने की कोशिश कर रहे हैं। आप उस दृश्य को जानते हैं: एक पात्र ने नीली शर्ट पहनी है, हाथ में कॉफी का कप है, और वह एक चुटकुले पर हंस रहा है। लेकिन फिल्म इतनी लंबी है, और उसमें इतने सारे दृश्य हैं, कि उस सटीक सेकंड को खोजना शहर के आकार के घास के ढेर में सुई खोजने जैसा है।

यही वह समस्या है जिसे LoVR पेपर हल करने की कोशिश कर रहा है।

समस्या: "शॉर्ट वीडियो" का जाल

अभी, कंप्यूटर के वे अधिकांश प्रोग्राम जो वीडियो खोजने के लिए डिज़ाइन किए गए हैं, उन छात्रों की तरह हैं जिन्होंने केवल 15 सेकंड के छोटे क्लिप्स का अध्ययन किया है। वे 10 सेकंड के वीडियो में बिल्ली के कूदने को खोजने में माहिर हैं, लेकिन यदि आप उन्हें 2 घंटे की डॉक्यूमेंट्री दे दें, तो वे खो जाते हैं। वे लंबी कहानी को समझने में सक्षम नहीं होते, या वे जानकारी की विशाल मात्रा से भ्रमित हो जाते हैं।

इन प्रोग्रामों के लिए मौजूदा "परीक्षण" (benchmarks) ऐसे हैं जैसे पूरे देश में नेविगेट करने के लिए एक अकेले कमरे के मानचित्र का उपयोग करना। वे बहुत छोटे हैं, उनके विवरण बहुत अस्पष्ट हैं, और वे कंप्यूटर की लंबी, जटिल कहानियों को संभालने की क्षमता का परीक्षण नहीं करते हैं।

समाधान: LoVR का परिचय

लेखकों ने LoVR (लॉन्ग वीडियो रिट्रीवल) बनाया है, जो अनिवार्य रूप से वीडियो खोजने वाले कंप्यूटरों के लिए एक विशाल, कठिन "फाइनल एग्जाम" है।

  • लाइब्रेरी: छोटे क्लिप्स के बजाय, LoVR में 467 लंबे वीडियो शामिल हैं (कुछ एक घंटे से भी अधिक लंबे हैं)।
  • विवरण: इन लंबे वीडियो के भीतर, उन्होंने उन्हें 40,804 छोटे, विशिष्ट क्लिप्स में विभाजित किया है।
  • वर्णन: प्रत्येक एकल क्लिप और पूरे वीडियो के लिए, उन्होंने बहुत विस्तृत, उच्च-गुणवत्ता वाले विवरण (कैप्शन) लिखे हैं।

इसे इस तरह सोचें: यदि अन्य परीक्षण यह पूछने जैसे हैं कि, "वह वीडियो ढूंढें जिसमें कुत्ता है," तो LoVR पूछता है, "उस सटीक 10 सेकंड के क्लिप को ढूंढें जहाँ लाल स्वेटर पहने हुए कुत्ते ने गिलहरी पर भौंकते हुए बारिश का सामना किया।"

उन्होंने इसे कैसे बनाया: "रोबोट एडिटर" पाइपलाइन

40,000 क्लिप्स के लिए विवरण हाथ से लिखना मनुष्यों को वर्षों लगा सकता है। एक साधारण रोबोट के साथ इन्हें लिखना निरर्थक परिणाम देगा। इसलिए, लेखकों ने एक चतुर "रोबोट एडिटर" पाइपलाइन बनाई:

  1. पहला ड्राफ्ट (रोबोट): उन्होंने एक बहुत ही स्मार्ट AI (एक विजन-लैंग्वेज मॉडल) का उपयोग किया जिसने क्लिप्स को देखा और विवरण का पहला ड्राफ्ट लिखा।
  2. गुणवत्ता जांच (ग्रेडर): एक अन्य AI ने एक सख्त शिक्षक की तरह कार्य किया, जो विवरण को ग्रेड देता था। यदि विवरण वीडियो के साथ पर्याप्त रूप से मेल नहीं खाता था, तो उसे वापस भेज दिया जाता था।
  3. पुनर्लेखन (एडिटर): यदि ग्रेड बहुत कम होता, तो सिस्टम एक अलग, यहाँ तक कि अधिक स्मार्ट AI मॉडल के साथ फिर से प्रयास करता।
  4. मानवीय स्पर्श (अंतिम प्रूफरीडर): केवल तभी जब रोबट तीन बार विफल हो जाते, तो एक इंसान विवरण लिखने के लिए आगे आता।

रोबोट और मनुष्यों के इस मिश्रण ने उन्हें एक विशाल डेटासेट बनाने की अनुमति दी जो आकार में विशाल और अविश्वसनीय रूप से सटीक है।

"पूरी कहानी" की चुनौती

लंबे वीडियो का एक कठिन हिस्सा यह है कि यदि आप केवल सभी छोटे विवरणों को एक साथ जोड़ देते हैं, तो यह एक टूटे हुए वाक्य की तरह पढ़ता है। इसे ठीक करने के लिए, लेखकों ने AI को एक उपन्यासकार की तरह कार्य करने के लिए प्रशिक्षित किया। केवल घटनाओं को सूचीबद्ध करने के बजाय, AI ने क्लिप्स के विवरणों को आपस में मिलाने, ट्रांजिशन को सुचारू बनाने के लिए सीखा, ताकि पूरे वीडियो का अंतिम विवरण एक सुसंगत कहानी की तरह पढ़े, न कि बुलेट पॉइंट्स की एक सूची की तरह।

परिणाम: एक वास्तविकता की जांच

जब शोधकर्ताओं ने आज के सबसे अच्छे वीडियो खोजने वाले कंप्यूटरों का इस नए LoVR एग्जाम पर परीक्षण किया, तो परिणाम निराशाजनक थे:

  • संघर्ष: यहाँ तक कि सबसे स्मार्ट मॉडल भी खो गए। वे कभी-कभी सामान्य "वीडियो" को ढूंढ सकते थे, लेकिन विशिष्ट "क्लिप" को ढूंढना बहुत कठिन था।
  • सीमा: यह पता चला है कि कंप्यूटर को केवल अधिक फ्रेम्स (प्रति सेकंड अधिक चित्र) खिलाना बहुत अधिक मदद नहीं करता है। यह अधिक देखने के बारे में नहीं है; यह लंबी कहानी को समझने के बारे में है।
  • अंतराल: सर्वश्रेष्ठ मॉडल अभी भी पूर्णता से बहुत दूर थे, जो यह दर्शाते हैं कि हम एक ऐसे कंप्यूटर के करीब होने से बहुत दूर हैं जो वास्तव में एक लंबी फिल्म को वैसे ही "देख" और "समझ" सकता है जैसे एक इंसान करता है।

निष्कर्ष

LoVR एक नया, कठिन मानक है। यह एक ड्राइविंग टेस्ट को पार्किंग लॉट से अपग्रेड करके व्यस्त राजमार्ग पर रश ऑवर के दौरान चलाने जैसा है। यह हमें दिखाता है कि वर्तमान तकनीक कहाँ विफल हो रही है और शोधकर्ताओं को एक स्पष्ट लक्ष्य देता है: ऐसे सिस्टम बनाना जो वास्तव में लंबी, जटिल वीडियो कहानियों को समझ सकें, न कि केवल छोटे अंशों को।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →