← 最新论文
💬 NLP

What's Missing in Vision-Language Models? Probing Their Struggles with Causal Order Reasoning

本文介绍了两个新的基准测试,VQA-Causal 和 VCR-Causal,旨在揭示当前的视觉语言模型由于训练数据中缺乏因果表达,而在因果顺序推理方面存在困难,同时证明了通过使用硬负样本进行针对性微调可以有效提升这一能力。

原作者: Zhaotian Weng, Haoxuan Li, Xin Eric Wang, Kuan-Hao Huang, Jieyu Zhao

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhaotian Weng, Haoxuan Li, Xin Eric Wang, Kuan-Hao Huang, Jieyu Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一个非常聪明的学生,他读过数百万本书,看过数十亿张图片。这个学生非常擅长命名事物:“那是狗”、“那是红色的球”、“那是一个正在跑步的人”。如果你问:“那个人在做什么?”他能瞬间给出正确答案。

但这份论文揭示了一个令人惊讶的盲点:这个学生并不理解事情为什么会发生。 他可以描述场景,但他无法理清因果关系背后的故事。

以下是使用简单类比对研究进行的拆解:

1. 问题所在:“聪明但天真”的学生

研究人员观察了现代人工智能模型(称为视觉语言模型,即 VLM)。这些模型就像上述描述的聪明学生一样。它们非常擅长识别物体和动作。

然而,当你要求它们理解因果关系(什么是原因,什么是结果)时,它们会感到困惑。

  • 测试: 想象一张女人在雨中撑着伞的照片。
    • 正确的逻辑: “雨导致了女人撑起伞。”
    • 错误的逻辑: “女人撑着伞导致了下雨。”
  • 结果: AI 模型通常无法区分这两者。它们的表现接近随机猜测,正确率仅为 50% 左右(这并不比抛硬币好多少)。尽管它们能完美识别“女人”、“雨伞”和“雨”,但它们无法将这些元素联系起来。

2. 陷阱:旧的测试太容易了

研究人员发现,之前的测试在误导 AI。

  • 类比: 想象一个选择题,问题是“这个人为什么要拉绳子?”
    • 选项 A:为了系住船。
    • 选项 B:为了穿过铁轨。
    • 选项 C:为了防止被冲走。
  • 捷径: AI 不需要理解其中的“故事”。它只需要观察图片并说:“嘿,这张图片里没有铁轨!”于是它排除了选项 B。它不需要理解原因,只需要识别出缺失的物体即可。
  • 修正方案: 研究人员构建了两个新的测试(VQA-CausalVCR-Causal),专门设计用于封堵这些捷径。在这些新测试中,唯一的得分方式是真正理解事件之间的关系。

3. 诊断:AI 的“图书馆”缺少正确的书籍

为什么 AI 表现得这么差?研究人员进入了“图书馆”(用于训练这些 AI 模型的海量数据集)去查看它们都在读什么。

  • 发现: 他们发现训练数据就像一个充满了图片说明的图书馆,比如“一只狗在奔跑”或“一只猫在睡觉”。
  • 缺失的部分: 几乎没有任何说明解释了“为什么”。
    • 在 4 亿张图片中,只有约 0.08% 的图片配有解释原因的说明(例如:“这只狗在奔跑,因为它看到了松鼠”)。
  • 结论: 如果你从未给学生提供过解释因果关系的书,你就无法教会他们理解因果关系。AI 并不是“笨”,它只是从未学习过这个概念,因为数据中根本没有它。

4. 解决方案:专业的导师

研究人员尝试通过给 AI 提供一位“导师”来解决这个问题。

  • 方法: 他们提取了一小部分数据,并创建了“硬负例”(hard negative)样本。这就像向学生展示两个几乎完全相同的故事,并说:“其中一个是真实的,另一个是虚假的。两者之间唯一的区别在于因果顺序。哪一个才合乎逻辑?”
  • 结果: 经过这种针对性训练,AI 的表现大幅提升。它学会了区分“雨导致了撑伞”和“撑伞导致了下雨”。
  • 额外收获: 这种训练并没有破坏 AI 原有的其他技能。它仍然可以像以前一样出色地命名物体和描述场景,只是增加了解释“为什么”的能力。

总结

  • 当前的 AI: 擅长命名事物,但不擅长理解事情为什么会发生。
  • 原因: 用于训练它们的数据很少解释事情为什么会发生。
  • 解决方法: 通过让它们专门针对“因果关系”谜题进行训练,它们可以习得这项技能,且不会丧失原有的能力。

论文得出结论,虽然这些模型功能强大,但它们目前还缺少人类推理的一个基本要素:理解导致结果的一系列事件链。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →