← नवीनतम पेपर
💻 computer science

HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding

यह शोध पत्र HAVEN को प्रस्तुत करता है, जो एक नवीन पदानुक्रमित रूप से संरेखित (hierarchically aligned) मल्टीमॉडल बेंचमार्क है, जो मौजूदा खंडित वीडियो मूल्यांकन विधियों की सीमाओं को दूर करने के लिए एक एकीकृत, पूर्णतः सूक्ष्म (fully granular) डेटासेट और व्यापक मूल्यांकन सुइट प्रदान करता है ताकि जटिल वीडियो सारांश और तर्क करने में मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की क्षमताओं का कड़ाई से आकलन किया जा सके।

मूल लेखक: Mengqi Shi, Haopeng Zhang

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mengqi Shi, Haopeng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को फिल्म समझना सिखाने की कोशिश कर रहे हैं। आप उसे एक फिल्म दिखाते हैं और पूछते हैं, "क्या हुआ?" रोबोट आपको एक बहुत ही सहज, व्याकरण की दृष्टि से सटीक सारांश देता है। यह सुनने में बहुत अच्छा लगता है! लेकिन यदि आप पूछते हैं, "किस विशिष्ट दृश्य में नायक कूद रहा था?" तो रोबोट गलत दृश्य की ओर इशारा कर सकता है, या ऐसा दृश्य बना सकता है जो कभी हुआ ही नहीं।

यह वह समस्या है जिसे HAVEN पेपर संबोधित करता है। लेखक तर्क देते हैं कि वर्तमान AI मॉडल उन अभिनेताओं की तरह हैं जो स्क्रिप्ट को पूरी तरह से याद तो कर सकते हैं लेकिन वास्तव में कथानक या पात्रों को नहीं समझते। वे "सुवक्ता" (fluent) तो हैं लेकिन "ग्राउंडेड" (grounded) नहीं हैं।

यहाँ एक सरल विवरण दिया गया है कि उन्होंने क्या किया और उन्हें क्या मिला:

1. समस्या: "टूटा हुआ पहेली" (The "Broken Puzzle")

वीडियो AI के मौजूदा परीक्षण ऐसे हैं जैसे किसी छात्र को एक ऐसी पहेली देना जहाँ टुकड़े बिखरे हुए हैं और आपस में फिट नहीं बैठते।

  • पुराना तरीका: परीक्षण आमतौर पर AI को एक वीडियो देखने और उसका सारांश लिखने, या कुछ महत्वपूर्ण चित्र चुनने के लिए कहते हैं। वे इन्हें अलग-अलग कार्यों के रूप में मानते हैं।
  • दोष: वास्तविक वीडियो श्रेणीबद्ध (hierarchical) होते हैं। एक वीडियो फ्रेम्स (व्यक्तिगत चित्र) से बना होता है, जो शॉट्स (छोटे क्लिप) में समूह बनाते हैं, जो पूरे वीडियो (कहानी) का निर्माण करते हैं। पुराने परीक्षण इस संरचना को अनदेखा करते हैं। वे यह भी जाँच नहीं करते कि AI के शब्द वास्तव में वीडियो के विशिष्ट क्षणों से मेल खाते हैं या नहीं। AI भाषा के काम करने के तरीके को जानकर सही शब्दों का अनुमान लगा सकता है, बिना वास्तव में वीडियो को "देखे"।

2. समाधान: HAVEN (द "मास्टर ब्लूप्रिंट")

लेखकों ने HAVN (Hierarchically Aligned Multimodal benchmark for unified Video undErstandiNg) नामक एक नया बेंचमार्क बनाया है। HAVEN को एक इमारत के मास्टर ब्लूप्रिंट के रूप में समझें।

केवल तैयार घर (वीडियो) को देखने के बजाय, HAVEN AI को एक साथ ईंटों (फ्रेम्स), दीवारों (शॉट्स) और पूरे घर (वीडियो) को समझने के लिए मजबूर करता है।

  • पूर्ण संरेखण (Full Alignment): AI द्वारा लिखे गए प्रत्येक वाक्य के लिए, HAVEN जाँचता है कि वह वाक्य वीडियो के किस हिस्से से आया है। यह एक ऐसे अनुवादक की तरह है जिसे हर शब्द का अनुवाद करने के लिए मूल भाषा में सटीक शब्द की ओर इशारा करना होगा।
  • तीन स्तर: यह AI का तीन स्तरों पर परीक्षण करता है:
    1. फ्रेम स्तर (Frame Level): क्या आप इस एकल चित्र का वर्णन कर सकते हैं?
    2. शॉट स्तर (Shot Level): क्या आप इस छोटे क्लिप का वर्णन कर सकते हैं और जान सकते हैं कि कौन से चित्र इसके अंतर्गत आते हैं?
    3. वीडियो स्तर (Video Level): क्या आप पूरी कहानी का सारांश दे सकते हैं और जान सकते हैं कि कौन से क्लिप सबसे महत्वपूर्ण हैं?

3. परीक्षण: चार अलग-अलग चुनौतियाँ

लेखकों ने केवल AI को सारांश लिखने के लिए नहीं कहा। उन्होंने इसे चार अलग-अलग चुनौतियाँ दीं ताकि यह देखा जा सके कि क्या यह वास्तव में स्मार्ट है या केवल बात करने में अच्छा है:

  • सारांश (Summarization): "इस वीडियो के बारे में एक कहानी लिखें।"
  • टाइम ट्रैवल (Temporal Reasoning): "यहाँ एक वीडियो के क्लिप हैं, लेकिन मैंने उन्हें इधर-उधर कर दिया है। उन्हें वापस सही क्रम में रखें।"
  • डिटेक्टिव (Grounding): "यहाँ कहानी का एक वाक्य है। वीडियो में उस सटीक क्लिप की ओर इशारा करें जो इस वाक्य से मेल खाता है।"
  • एडिटर (Saliency Ranking): "यहाँ 10 क्लिप हैं। उन्हें 'कहानी के लिए सबसे महत्वपूर्ण से लेकर 'सबसे कम महत्वपूर्ण' के क्रम में रखें।"

4. परिणाम: "क्षमता का भ्रम" (The "Illusion of Capability")

जब उन्होंने उपलब्ध सबसे स्मार्ट AI मॉडल (जैसे GPT-4, Qwen, और अन्य) का HAVN पर परीक्षण किया, तो उन्हें एक चौंकाने वाला अंतर मिला:

  • बातूनी (The Talkers): मॉडल सहज, सुवक्त सारांश लिखने में उत्कृष्ट थे। वे ऐसे लगते थे जैसे वे फिल्म को समझ रहे हों।
  • अंधे (The Blinders): जब उनसे विशिष्ट दृश्यों की ओर इशारा करने (Grounding) या क्लिप के महत्व को रैंक करने (Saliency) के लिए कहा गया, तो वे बुरी तरह विफल रहे।
  • टेक्स्ट ट्रैप (The Text Trap): उन्होंने एक "केवल टेक्स्ट" (Text-Only) संस्करण का भी परीक्षण किया (एक AI जो चित्रों को नहीं बल्कि केवल फ्रेम के विवरण को पढ़ता है)। आश्चर्यजनक रूप से, यह टेक्स्ट-ओनली AI अक्सर पूर्ण वीडियो AI की तुलना में सही दृश्यों को खोजने में बेहतर प्रदर्शन करता था। यह साबित करता है कि वीडियो AI केवल भाषा के पैटर्न के आधार पर अनुमान लगा रहा था, न कि वास्तविक दृश्य साक्ष्य का विश्लेषण कर रहा था।

5. निष्कर्ष

लेखक निष्कर्ष निकालते हैं कि हमने वीडियो को समझने की AI की क्षमता को बहुत अधिक आँक दिया है। सिर्फ इसलिए कि एक AI किसी वीडियो के बारे में एक महान कहानी लिख सकता है, इसका मतलब यह नहीं है कि उसने वास्तव में वीडियो को "देखा" है।

HAVEN एक नया, सख्त परीक्षण है जो AI को यह साबित करने के लिए मजबूर करता है कि वह अपने शब्दों को वास्तविक दृश्य साक्ष्य से जोड़ सकता है, जिससे यह सुनिश्चित होता है कि भविष्य के AI मॉडल केवल अच्छे वक्ता ही नहीं, बल्कि दृश्य दुनिया के वास्तविक समझकर्ता भी बनें।

(नोट: पेपर विशेष रूप से वीडियो समझ मॉडल के मूल्यांकन पर केंद्रित है। यह इस तकनीक के लिए विशिष्ट चिकित्सा, औद्योगिक या भविष्य के अनुप्रयोगों का प्रस्ताव नहीं करता है, न ही यह दावा करता है कि ये मॉडल उन क्षेत्रों में वास्तविक दुनिया के उपयोग के लिए तैयार हैं।)

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →