← नवीनतम पेपर
💻 computer science

MVEB: Massive Video Embedding Benchmark

यह शोध पत्र MVEB को प्रस्तुत करता है, जो कि 184-टास्क के एक बड़े पूल से व्युत्पन्न एक व्यापक 23-टास्क बेंचमार्क है जो विविध मोडैलिटीज़ और कार्यों में 33 वीडियो एम्बेडिंग मॉडलों का मूल्यांकन करता है, यह प्रकट करते हुए कि कोई भी एकल मॉडल सभी श्रेणियों में हावी नहीं है और प्रदर्शन पर ऑडियो के महत्वपूर्ण, संदर्भ-निर्भर प्रभाव को उजागर करता है।

मूल लेखक: Adnan El Assadi, Roman Solomatin, Isaac Chung, Chenghao Xiao, Deep Shah, Manan Dey, Shriya Sudhakar, Zacharie Bugaud, Wissam Siblini, Ayush Sunil Munot, Yashwanth Devavarapu, Rakshitha Ireddi, Michell
प्रकाशित 2026-06-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Adnan El Assadi, Roman Solomatin, Isaac Chung, Chenghao Xiao, Deep Shah, Manan Dey, Shriya Sudhakar, Zacharie Bugaud, Wissam Siblini, Ayush Sunil Munot, Yashwanth Devavarapu, Rakshitha Ireddi, Michelle Yang, Márton Kardos, Niklas Muennighoff, Kenneth Enevoldsen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही व्यस्त, हाई-टेक लाइब्रेरी (पुस्तकालय) में एक नया कर्मचारी काम पर रखने की कोशिश कर रहे हैं। इस लाइब्रेरी में केवल किताबें (टेक्स्ट) ही नहीं हैं, बल्कि इसमें फिल्में (वीडियो) और साउंडट्रैक (ऑडियो) भी हैं। आपको किसी ऐसे व्यक्ति की आवश्यकता है जो इस लाइब्रेरी में कुछ भी तुरंत समझ सके, व्यवस्थित कर सके और ढूंढ सके।

लंबे समय तक, इन "AI लाइब्रेरियन" का परीक्षण करने वाले लोग केवल एक समय में एक ही प्रकार का टेस्ट देते थे। एक दिन, वे पूछते, "क्या तुम बिल्ली को पहचान सकते हो?" (एक्शन रिकग्निशन)। अगले दिन, वे पूछते, "क्या तुम खाना पकाने के बारे में कोई वीडियो ढूंढ सकते हो?" (रिट्रीवल)। समस्या यह थी कि एक AI बिल्ली पहचानने में जीनियस हो सकता है लेकिन खाना पकाने के वीडियो खोजने में बहुत खराब हो सकता है। यह ऐसा था जैसे किसी शेफ को इसलिए काम पर रखना क्योंकि वह प्याज काटने में माहिर है, बिना यह जांचे कि क्या वह वास्तव में पूरा भोजन बना सकता है।

MVEB का आगमन: "सर्व-समावेशी" वीडियो परीक्षा

इस शोध पत्र के लेखकों ने MVEB (मैसिव वीडियो एम्बेडिंग बेंचमार्क) बनाया है। MVEB को एक विशाल, 23-अध्याय वाली अंतिम परीक्षा के रूप में समझें, जिसे वीडियो AI मॉडल का एक साथ सब कुछ टेस्ट करने के लिए डिज़ाइन किया गया है।

यहाँ शोध पत्र का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. परीक्षा की संरचना (23 कार्य)

केवल एक प्रश्न के बजाय, MVEB 23 अलग-अलग प्रकार के प्रश्न पूछता है ताकि यह देखा जा सके कि AI वीडियो को कितनी अच्छी तरह समझता है। ये प्रश्न छह श्रेणियों में आते हैं:

  • वर्गीकरण (Classification): "इस वीडियो में क्या हो रहा है?" (जैसे, क्या कोई नाच रहा है या खाना बना रहा है?)
  • जीरो-शॉट वर्गीकरण (Zero-Shot Classification): "क्या हो रहा है?" बिना यह बताए कि उसे विशेष रूप से उस गतिविधि के बारे में पहले सिखाया गया था या नहीं।
  • क्लस्टरिंग (Clustering): "इन 100 वीडियो को उनके बीच की समानताओं के आधार पर एक साथ समूह में रखें," बिना उन्हें श्रेणियों के बारे में बताए।
  • पेयर क्लासिफिकेशन (Pair Classification): "क्या ये दो वीडियो एक ही गतिविधि दिखा रहे हैं?"
  • रिट्रीवल (Retrieval): "इस टेक्स्ट विवरण से मेल खाने वाला वीडियो खोजें" (या इसके विपरीत)।
  • प्रश्न उत्तर (Question Answering): "इस वीडियो को देखें और इसके बारे में एक विशिष्ट प्रश्न का उत्तर दें।"

2. बड़ी खोज: कोई "सुपर-स्टूडेंट" नहीं

शोधकर्ताओं ने 33 अलग-अलग AI मॉडल (छात्रों) का परीक्षण किया।

  • परिणाम: कोई भी एकल मॉडल हर चीज़ पर "A+" प्राप्त नहीं कर सका।
  • उपमा: एक स्पोर्ट्स टीम की कल्पना करें। एक खिलाड़ी गोल करने में सर्वश्रेष्ठ है (Classification), दूसरा गेंद पास करने में सर्वश्रेष्ठ है (Retrieval), और तीसरा रक्षा करने में महान है (Clustering)। अभी तक कोई एक "परफेक्ट प्लेयर" नहीं है।
  • विजेता:
    • लार्ज लैंग्वेज मॉडल्स (MLLMs) पर आधारित मॉडल जटिल प्रश्नों को समझने और वीडियो को समूह में बांटने में सबसे अच्छे थे।
    • विभिन्न इंद्रियों को जोड़ने वाले (Multimodal Binding) मॉडल टेक्स्ट के आधार पर वीडियो खोजने में सबसे अच्छे थे।
    • महत्वपूर्ण चेतावनी: जो मॉडल मूल रूप से नए वीडियो या टेक्स्ट बनाने (Generate करने) के लिए बनाए गए थे (Generative MLLMs), वे केवल वीडियो को समझने और इंडेक्स करने के लिए पूछे जाने पर बुरी तरह विफल रहे। यह एक कवि को लाइब्रेरियन बनने के लिए कहने जैसा है; वे सुंदर कहानियाँ लिख सकते हैं, लेकिन उन्हें अलमारियों को कुशलतापूर्वक व्यवस्थित करने के लिए प्रशिक्षित नहीं किया गया है।

3. "ध्वनि" का कारक: जब ऑडियो मदद करता है (और नुकसान पहुँचाता है)

शोध पत्र का एक सबसे दिलचस्प हिस्सा यह है कि उन्होंने ऑडियो ट्रैक का परीक्षण कैसे किया। कई वीडियो के लिए, उन्होंने AI का दो बार परीक्षण किया: एक बार केवल चित्र के साथ, और एक बार चित्र प्लस ध्वनि के साथ।

  • निष्कर्ष: ऑडियो मदद करेगा या नहीं, यह पूरी तरह से इस बात पर निर्भर करता है कि टेस्ट के प्रश्न कैसे लिखे गए थे
    • परिदृश्य A (ऑडियो-विजुअल ग्राउंडेड): यदि टेस्ट प्रश्न उन मनुष्यों द्वारा बनाए गए थे जिन्होंने ध्वनि को सुना और वीडियो को देखा (जैसे, "कौन सा वाद्य यंत्र बज रहा है?"), तो AI को ध्वनि जोड़ने से सही उत्तर पाने में मदद मिली
    • परिदृश्य B (विजुअल-ओनली ग्राउंडेड): यदि टेस्ट प्रश्न केवल वीडियो को देखकर बनाया गया था (जैसे, "क्या व्यक्ति कूद रहा है?"), तो ध्वनि जोड़ने से वास्तव में AI के प्रदर्शन को नुकसान पहुँचा। ध्वनि "शोर" बन गई जिसने मॉडल को भ्रमित कर दिया।
  • सीख: ऑडियो अपने आप में "बेहतर" नहीं है। यह केवल तभी उपयोगी है जब कार्य के लिए वास्तव में सुनने की आवश्यकता हो।

4. "छोटा" बनाम "लंबा" एग्जाम

संभावित परीक्षणों की पूरी सूची (MVEB+) में 184 कार्य थे, जिन्हें चलाने में बहुत समय लगता। लेखकों ने 23 सबसे महत्वपूर्ण कार्यों (MVEB) को चुनने के लिए एक स्मार्ट फ़िल्टर का उपयोग किया।

  • उपमा: यह एक डॉक्टर द्वारा 184 रक्त परीक्षणों के पूर्ण पैनल का आदेश देने जैसा है। उन्होंने महसूस किया कि यदि वे केवल 23 सबसे महत्वपूर्ण परीक्षण करते हैं, तो उन्हें रोगी के स्वास्थ्य के बारे में 99% समान जानकारी मिल जाएगी, लेकिन इसमें 10 गुना कम समय और पैसा लगेगा।

5. "वीडियो-ओनली" बनाम "फुल-स्टैक" लीडरबोर्ड

शोध पत्र ने उन मॉडलों के लिए विशेष लीडरबोर्ड भी बनाए जो ऑडियो को नहीं संभाल सकते (वे केवल वीडियो देखते हैं) या टेक्स्ट को नहीं संभाल सकते (वे केवल वीडियो देखते हैं)।

  • आश्चर्य: जब आप समीकरण से ऑडियो को हटा देते हैं, तो रैंकिंग पूरी तरह से बदल जाती है। एक मॉडल जो पूर्ण परीक्षा में #5 पर था, वह "वीडियो-ओनली" परीक्षा में #1 पर पहुँच गया। यह साबित करता है कि विभिन्न मॉडल समझ के अलग-अलग "फ्लेवर्स" के लिए बनाए गए हैं।

सारांश

यह शोध पत्र वीडियो AI का परीक्षण करने का एक नया, निष्पक्ष और व्यापक तरीका पेश करता है। यह हमें दिखाता है कि:

  1. विशेषज्ञता मायने रखती है: अलग-अलग AI मॉडल अलग-अलग चीजों में अच्छे होते हैं; अभी तक कोई "एक आकार सभी के लिए उपयुक्त" (one size fits all) नहीं है।
  2. प्रशिक्षण महत्वपूर्ण है: आप केवल कहानियाँ लिखने के लिए बने मॉडल को लेकर यह उम्मीद नहीं कर सकते कि वह वीडियो को व्यवस्थित करने में अच्छा होगा; उसे उस काम के लिए विशिष्ट प्रशिक्षण की आवश्यकता होती है।
  3. संदर्भ (Context) सर्वोपरि है: वीडियो में ध्वनि जोड़ना केवल तभी मदद करता है जब कार्य के लिए वास्तव में सुनने की आवश्यकता हो। यदि कार्य पूरी तरह से दृश्य (visual) है, तो ध्वनि केवल एक व्याकुलता बन सकती है।

लेखकों ने अपना सारा कोड और डेटा जारी कर दिया है ताकि समुदाय नए AI मॉडल के आविष्कार के साथ इस "परीक्षा" को अपडेट करना जारी रख सके, जिससे यह सुनिश्चित हो सके कि परीक्षण पुराना न हो जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →