← नवीनतम पेपर
💻 computer science

ViMU: Benchmarking Video Metaphorical Understanding

यह शोध पत्र ViMU को प्रस्तुत करता है, जो हिंट-मुक्त, मल्टीमॉडल साक्ष्य-आधारित प्रश्नों के माध्यम से शाब्दिक दृश्य बोध से परे निहित रूपक, विडंबना और सामाजिक उपपाठ का अनुमान लगाने की सीमावर्ती वीडियो समझ मॉडल की क्षमता का व्यवस्थित रूप से मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है।

मूल लेखक: Qi Li, Xinchao Wang

प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qi Li, Xinchao Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छोटा वीडियो क्लिप देख रहे हैं। सतह पर, आप एक लड़की को अजीब तरह से नाचते हुए देखते हैं, या एक आदमी को पक्षी की तरह अपने हाथ फड़फड़ाते हुए देखते हैं। एक मानक वीडियो AI कह सकता है, "मैं एक लड़की को नाचते हुए देख रहा हूँ," या "मैं एक आदमी को हिलते हुए देख रहा हूँ।" यह केवल शाब्दिक (literal) तथ्यों को देखता है।

लेकिन इंसान अधिक समझदार होते हैं। हम जानते हैं कि वह नाच रही लड़की वास्तव में एक गहरा राजनीतिक मजाक कर रही हो सकती है, या वह हाथ फड़फड़ाने वाला आदमी भौतिक विज्ञान (physics) पर एक मजाकिया टिप्पणी हो सकती है। हम उपपाठ (subtext) को समझते हैं—छिपा हुआ अर्थ, विडंबना, सांस्कृतिक मजाक, या सामाजिक आलोचना जो स्क्रीन पर स्पष्ट रूप से नहीं लिखी होती है।

यह शोध पत्र ViMU (वीडियो मेटाफोरिकल अंडरस्टैंडिंग) पेश करता है, जो एक नया "अभ्यास" (exam) है यह परीक्षण करने के लिए कि क्या AI मॉडल इन छिपी हुई परतों को समझ सकते हैं, न कि केवल सतही तथ्यों को।

यहाँ सरल उपमाओं का उपयोग करके इस शोध पत्र का विवरण दिया गया है:

1. समस्या: AI एक शाब्दिक अनुवादक की तरह है

वर्तमान वीडियो AI मॉडल को एक बहुत ही शाब्दिक अनुवादक के रूप में सोचें जो केवल शब्दों की शब्दकोश परिभाषाएँ जानता है। यदि आप उन्हें किसी व्यक्ति का आँखें घुमाते हुए और "Great job" कहते हुए दिखाते हैं, तो AI केवल "एक व्यक्ति सिर हिला रहा है" और "शब्द 'Great job'" देख सकता है। वह व्यंग्य (sarcasm) को मिस कर देता है।

लेखकों का तर्क है कि जबकि AI वस्तुओं (एक बिल्ली, एक कार) और क्रियाओं (दौड़ना, कूदना) को पहचानने में अच्छा हो रहा है, यह वीडियो के पीछे के "वाइब" या "मजाक" को समझने में बहुत खराब है। यह उपपाठ (subtext) को समझने में विफल रहता है।

2. समाधान: ViMU परीक्षा

इसे ठीक करने के लिए, शोधकर्ताओं ने ViMU नामक एक नया परीक्षण बनाया।

  • डेटासेट: उन्होंने इंटरनेट (जैसे टिकटॉक या यूट्यूब मीम्स) से 588 पेचीदा वीडियो एकत्र किए। ये वीडियो विडंबना, व्यंग्य और सांस्कृतिक संदर्भों से भरे हुए हैं।
  • नियम: परीक्षण इस तरह डिज़ाइन किया गया है कि AI को कोई संकेत (hint) नहीं मिलता। आप यह नहीं पूछ सकते, "क्या यह वीडियो व्यंग्यात्मक है?" आपको पूछना होगा, "यहाँ क्या हो रहा है?" और AI को अपने आप छिपे हुए अर्थ को समझना होगा।
  • कार्य (Tasks): इस परीक्षा के चार भाग हैं:
    1. खुला व्याख्यात्मक कार्य (Open-Ended Interpretation): "मजाक को अपने शब्दों में समझाएं।"
    2. तर्क की जाँच (Rhetoric Check): "वीडियो किस तरह की चाल चल रहा है? (जैसे, क्या यह अतिरंजना कर रहा है? क्या यह गंभीर होने का नाटक कर रहा है?)"
    3. सामाजिक संकेत की जाँच (Social Signal Check): "वीडियो समाज के बारे में क्या कह रहा है? (जैसे, क्या यह किसी नियम का उपहास कर रहा है? क्या यह किसी समूह के प्रति बुरा है?)"
    4. साक्ष्य की जाँच (Evidence Check): "मुझे बिल्कुल दिखाएं कि वीडियो का कौन सा हिस्सा (संगीत, टेक्स्ट, संपादन) आपके उत्तर को सिद्ध करता है।"

3. परिणाम: AI परीक्षा में फेल हो गया

शोधकर्ताओं ने 16 सबसे स्मार्ट उपलब्ध AI मॉडलों (OpenAI, Google और अन्य के बड़े नामों सहित) का इस परीक्षा पर परीक्षण किया। परिणाम आश्चर्यजनक थे:

  • स्कोर: लगभग हर मॉडल का स्कोर 50% से नीचे था। यहाँ तक कि "सुपर-स्मार्ट" क्लोज्ड-सोर्स मॉडल भी संघर्ष करते दिखे।
  • "सुरक्षित" जाल (The "Safe" Trap): मॉडल सुरक्षित खेलने की कोशिश करते थे। जब वे गहरे मजाक को नहीं समझ पाते थे, तो वे जटिल, छिपे हुए अर्थ पर जोखिम उठाने के बजाय एक उबाऊ, शाब्दिक उत्तर (जैसे "यह सिर्फ एक नृत्य है") का अनुमान लगाते थे।
  • विच्छेद (The Disconnect): वीडियो का वर्णन करने में कुशल होना (जैसे, "एक कुत्ता दौड़ रहा है") इस बात का प्रमाण नहीं है कि AI वीडियो के अर्थ को समझने में भी कुशल है (जैसे, "कुत्ता एक रूपक संबंधी तूफान से बचने के लिए दौड़ रहा है")।

4. यह क्यों महत्वपूर्ण है

शोध पत्र निष्कर्ष निकालता है कि हम एक दीवार से टकरा रहे हैं। हमने ऐसे AI बनाए हैं जो वीडियो को "देख" तो सकते हैं, लेकिन वे वीडियो को "समझ" नहीं सकते। यह एक ऐसे छात्र की तरह है जो किताब के हर शब्द को पढ़ सकता है लेकिन कहानी, हास्य या नैतिक शिक्षा को नहीं समझ पाता।

AI को वास्तव में वास्तविक दुनिया के कार्यों (जैसे समाचार, मीम्स या सामाजिक टिप्पणी को समझने) के लिए उपयोगी बनाने के लिए, हमें इसे सतह से परे देखना और पिक्सेल के पीछे के छिपे हुए संदेशों, सांस्कृतिक संदर्भों और मानवीय इरादों को समझना सिखाने की आवश्यकता है।

संक्षेप में: ViMU एक रिपोर्ट कार्ड है जो दिखाता है कि हमारे सर्वश्रेष्ठ वीडियो AI वर्तमान में वीडियो के "वास्तविक" अर्थ को समझने में विफल हो रहे हैं, अक्सर मजाक, विडंबना और सामाजिक टिप्पणी को पूरी तरह से मिस कर देते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →