← 最新论文
💻 computer science

MetaphorVU: Towards Metaphorical Video Understanding

本文介绍了首个隐喻视频理解综合基准 MetaphorVU-Bench,揭示了当前多模态大语言模型在跨域映射方面的不足,并提出了 MetaphorBoost,这是一个利用隐喻知识图谱在推理阶段显著提升性能的新框架。

原作者: Zhuoqun Li, Boxi Cao, Guiping Jiang, Fangrui Lv, Ruotong Pan, Jianan Wang, Xiangyu Wu, Hongyu Lin, Yaojie Lu, Yong Du, Ruyin Jia, Liyan, Tingting Gao, Han Li, Xianpei Han, Le Sun

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhuoqun Li, Boxi Cao, Guiping Jiang, Fangrui Lv, Ruotong Pan, Jianan Wang, Xiangyu Wu, Hongyu Lin, Yaojie Lu, Yong Du, Ruyin Jia, Liyan, Tingting Gao, Han Li, Xianpei Han, Le Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一段短视频。表面上,你看到一群穿着华丽燕尾服的猪在奢华的宴会上进食,而猫则在桌下 scavenging 残羹剩饭。

人类观众会立刻理解其真实故事:这并非关于动物,而是对腐败统治阶级(猪)从穷人(猫)手中窃取财富的批判。这就是隐喻:用一事物来代表完全不同的另一事物。

这篇名为MetaphorVU的论文指出,虽然人工智能(AI)在描述视频中有什么(例如,“有一只猪”)方面已经非常擅长,但在理解视频意味着什么(例如,“这是一则政治讽刺”)方面却表现糟糕。

以下是他们研究发现与解决方案的简要概述:

1. 问题所在:AI 过于“字面化”

研究人员构建了一个名为MetaphorVU-Bench的新测试。你可以将其视为 AI 的“期末考试”,包含 860 个依赖隐喻(如上述猪的宴会)的真实世界视频。

他们测试了当今最先进的人工智能模型(包括 GPT-5 和 Gemini 等巨头)。

  • 结果:AI 模型惨败。得分约为 64 分(满分 100),而人类得分约为 83 分。
  • 诊断:AI 的失败并非因为它无法看见猪或猫。它失败是因为无法建立联系。它看到了“视觉元素”,却无法将其映射到“潜在概念”。
    • 类比:这就像一位熟记字典中每个单词的翻译,却不理解笑话或习语。他们可以字面翻译“下着猫和狗(It's raining cats and dogs)”,却不明白这仅仅意味着“雨下得很大”。

2. 解决方案:给 AI 一张“小抄”

研究人员意识到,AI 并不愚蠢,只是缺乏进行此类联想所需的特定“文化知识”。为了解决这个问题,他们构建了MetaphorBoost

  • 隐喻知识图谱:想象一个连接概念的巨大数字网络。在这个网络中,“猪”与“贪婪”相连,“燕尾服”与“权力”相连,“宴会”与“奢侈”相连。这不仅仅是一份事实清单;它是一张关于隐喻如何运作的地图。
  • 工作原理:当 AI 观看视频时,MetaphorBoost不会独自猜测含义,而是暂停并询问这个“知识图谱”:“嘿,我看到一只穿着燕尾服的猪。在人类文化中,这通常象征什么?”图谱回答:“权力与贪婪。”
  • 结果:有了这张“小抄”(或外部支架),AI 的性能显著提升。它不仅在猜测方面变得更好,而且在推理方面也有所提高,因为它拥有了连接线索的正确工具。

3. 八种隐喻类型

该论文还将这些棘手的视频整理为 8 个类别,表明隐喻有多种形式:

  1. 肢体语言:利用夸张的动作(如学生跳舞后瘫倒)来表现希望转变为绝望。
  2. 氛围:利用昏暗的灯光或悲伤的音乐来表现孤独。
  3. 文化符号:利用特定物体(如灯笼)来代表对成功的祝愿。
  4. 自然主义符号:利用枯萎的花朵来代表濒临死亡的关系。
  5. 因果蒙太奇:展示因果关系(例如,戴上戒指 \rightarrow 扫地),以此暗示“婚姻带来辛劳”。
  6. 类比蒙太奇:将两件相似的事物并置(例如,童年游戏与成年工作),以表现我们对青春的怀念。
  7. 超现实叙事:利用不可能的事物(如会说话的动物)来讲述关于现实生活故事。
  8. 表演性叙事:利用演员在短剧中的表现来批评社会行为。

核心结论

该论文总结道,当前的人工智能擅长感知(观察世界),但在认知(理解世界的深层含义)方面却很薄弱。

为了让 AI 真正理解人类交流,我们不能仅仅扩大模型规模;我们必须为它们提供更好的“地图”,以展示人类如何连接思想。通过添加隐喻知识图谱,他们证明了 AI 可以学会“get the joke(get the joke)”并理解我们视频中隐藏的含义。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →