ViMU: Benchmarking Video Metaphorical Understanding
यह शोध पत्र ViMU को प्रस्तुत करता है, जो हिंट-मुक्त, मल्टीमॉडल साक्ष्य-आधारित प्रश्नों के माध्यम से शाब्दिक दृश्य बोध से परे निहित रूपक, विडंबना और सामाजिक उपपाठ का अनुमान लगाने की सीमावर्ती वीडियो समझ मॉडल की क्षमता का व्यवस्थित रूप से मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है।