← 最新论文
💻 computer science

ViMU: Benchmarking Video Metaphorical Understanding

本文介绍了 ViMU,这是首个旨在通过无提示、多模态证据支撑的提问方式,系统评估前沿视频理解模型在超越字面视觉理解之外推断隐含隐喻、讽刺及社会潜台词能力的基准测试。

原作者: Qi Li, Xinchao Wang

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Qi Li, Xinchao Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一段短视频。表面上,你看到一个女孩笨拙地跳舞,或者一个男人像鸟一样挥动双臂。标准的视频人工智能可能会说:“我看到一个女孩在跳舞”,或者“我看到一个男人在移动”。它看到的是字面事实。

但人类更聪明。我们知道,那个跳舞的女孩可能实际上是在讲一个黑暗的政治笑话,或者那个挥动双臂的男人是在对物理学进行愚蠢的评论。我们理解潜台词——那些没有明确写在屏幕上的隐藏含义、讽刺、文化笑话或社会批评。

本文介绍了ViMU(视频隐喻理解),这是一项新的“考试”,旨在测试人工智能模型是否能够理解这些隐藏层面,而不仅仅是表面事实。

以下是使用简单类比对本文的拆解:

1. 问题所在:人工智能就像一个字面翻译者

将当前的视频人工智能模型想象成一个非常字面化的翻译者,它只知道单词的字典定义。如果你给它看一段视频,视频中一个人在翻白眼的同时说着“干得好”,人工智能可能只会看到“一个人移动头部”和“文字‘干得好’"。它错过了讽刺

作者认为,虽然人工智能在识别物体(猫、汽车)和动作(跑、跳)方面越来越擅长,但它非常不擅长理解视频背后的“氛围”或“笑话”。它错过了潜台词

2. 解决方案:ViMU 考试

为了解决这个问题,研究人员建立了一项名为ViMU的新测试。

  • 数据集:他们从互联网(如 TikTok 或 YouTube 梗图)收集了 588 个棘手的视频。这些视频充满了讽刺、戏谑和文化典故。
  • 规则:该测试的设计使得人工智能没有任何提示。你不能问:“这个视频是讽刺的吗?”你必须问:“这里发生了什么?”然后人工智能必须自己找出隐藏的含义。
  • 任务:考试分为四个部分:
    1. 开放式解读:“用你自己的话解释这个笑话。”
    2. 修辞检查:“这个视频使用了什么技巧?(例如:它是夸张吗?它是在假装严肃吗?)”
    3. 社会信号检查:“这个视频在说什么关于社会的内容?(例如:它是在嘲笑某条规则吗?它是在针对某个群体吗?)”
    4. 证据检查:“向我展示视频中确切证明你答案的部分(音乐、文字、剪辑)。”

3. 结果:人工智能未能通过考试

研究人员在 16 个最先进的人工智能模型(包括来自 OpenAI、Google 和其他机构的大型模型)上测试了这项考试。结果令人惊讶:

  • 分数:几乎每个模型的得分都低于 50%。即使是“超级聪明”的闭源模型也举步维艰。
  • “安全”陷阱:模型倾向于求稳。当它们不理解深层笑话时,它们会猜测一个无聊的字面答案(例如“这只是一个舞蹈”),而不是冒险去猜测复杂、隐藏的含义。
  • 脱节:擅长描述视频(例如“一只狗在跑”)并不意味着人工智能擅长理解视频的含义(例如“这只狗正在奔跑以逃离一场隐喻的风暴”)。

4. 为什么这很重要

该论文的结论是,我们正在撞上一堵墙。我们已经构建了能够完美“看见”视频的人工智能,但它无法“领会”视频。这就像有一个学生能读懂书中的每一个字,却不理解故事、幽默或寓意。

为了让人工智能真正适用于现实世界的任务(如理解新闻、梗图或社会评论),我们需要教会它超越表面,理解像素背后的隐藏信息文化背景人类意图

简而言之:ViMU 是一份成绩单,显示我们目前最好的视频人工智能无法理解视频的“真实”含义,往往完全错过了笑话、讽刺和社会评论。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →