← 最新论文
💻 computer science

Learning to Deny: Action Denial in Multimodal Large Language Models

本文介绍了 UCF101-AD,这是一个揭示了最先进的多模态大语言模型尽管拥有强大的上下文线索却仍难以拒绝动作行为的基准测试,并证明了引入因果推理可以显著提高它们验证动作是否真实发生的能力。

原作者: Raiyaan Abdullah, Shehreen Azad, Yogesh Singh Rawat

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Raiyaan Abdullah, Shehreen Azad, Yogesh Singh Rawat

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:只会说“是”的视频侦探

想象一下,你雇佣了一名视频侦探来监视监控录像。他们的任务是告诉你是否发生了特定的事件,比如“有人正在偷自行车”。

在过去,这些 AI 侦探在识别事件正在发生时表现得非常出色。如果他们看到自行车、人和手抓向车把的动作,他们会自信地断定:“是的,正在偷车!”

但这里有一个缺陷: 这些侦探非常不擅长说“不”。

如果视频显示一个人站在自行车旁边,手扶着车把,但只是站着而已,并没有真的去偷,AI 仍然会说:“是的,正在偷车!”它看到了自行车和人,就直接假设了最坏的情况。它太渴望认同线索了,以至于忽略了最重要的部分:实际发生的动作。

论文将这种现象称为**“肯定偏差”(Affirmative Bias)**,或者说是一个“唯唯诺诺的人(Yes-Man)”。这些模型太擅长识别模式了,以至于即使动作并未发生,它们也会产生幻觉,认为动作正在进行。

新的测试:UCF101-AD(“陷阱”数据集)

为了证明这个问题确实存在,研究人员创建了一个名为 UCF101-AD 的新测试。

你可以把这个测试看作是一场针对 AI 的“陷阱题”考试。

  • 设定: 他们选取一段标准视频(比如有人在打篮球),并创造出一个“负面”版本。
  • 陷阱: 在负面版本中,球场还在,球还在,球员也在,他们也在运球……但从来没有人完成扣篮。
  • 问题: AI 被问到:“是否有人正在扣篮?”

结果显示:

  • 当扣篮真的发生时,AI 的正确率超过 90%。
  • 当扣篮没有发生(但其他一切看起来都一样)时,AI 表现得很糟糕,出错率超过 50%。它会自信地回答:“是的,正在扣篮!”尽管球从未离开过球员的手。

这证明了 AI 观察的是背景(球场、球),而不是动作(跳跃和扣篮)。

解决方案:CausalAct(“逻辑清单”)

研究人员意识到,AI 需要停止瞎猜,开始检查一个逻辑清单。他们引入了一种名为 CausalAct 的方法。

想象一下,AI 是一位试图制作蛋糕的厨师。

  • 旧方法(走捷径): 厨师看到台面上放着面粉和鸡蛋,就立刻说:“我正在烤蛋糕!”即便烤箱还是冷的,食材也只是静静地摆在那里。
  • 新方法(CausalAct): 厨师被迫遵循一个“食谱图”。他们必须检查:
    1. 食材在不在?(在)
    2. 它们是否正在被搅拌?(在)
    3. 面糊真的进烤箱了吗?(不在) \rightarrow 停止。 不要说“正在烘焙”。

研究人员将这个“食谱”转化为了一个因果图(Causal Graph)。他们教会 AI 将视频分解为以下步骤:

  1. 上下文(Context): 场景中有谁、有什么物体?
  2. 交互(Interaction): 他们是否正在接触或使用这些物体?
  3. 运动(Motion): 是否真的发生了位移/动作?
  4. 动作(Action): 只有当步骤 1、2、3 完全吻合时,才判定该动作正在发生。

效果如何?

有效,但也有个前提。

  • 仅仅是礼貌地询问(零样本学习/Zero-Shot): 当他们只是简单地告诉大型 AI 模型,“请检查你的逻辑图”时,那些具备强大语言能力的较大模型在学会说“不”方面表现得更好。
  • 教授这项技能(微调/Fine-tuning): 对于较小的模型,他们必须通过“逻辑图谜题”来实际训练它们。他们没有给模型看视频答案,而是教它们如何阅读逻辑图。一旦学会了阅读地图,它们在拒绝那些并未发生的动作时表现得好多了。

“思考”的转折

论文还测试了“思考型模型”(即在给出答案前会进行推理过程的 AI)。令人惊讶的是,这些模型往往表现得更差

为什么?因为当它们尝试“思考”时,会被背景线索分散注意力。它们会说:“我看到了篮球,我看到了篮筐,所以某人一定正在扣篮”,然后自信地写下一大段话来解释为什么它是对的,即便根本没人扣篮。它们太擅长解释一件事情为什么可能发生,以至于忘记了检查这件事是否真的发生了

总结

这篇论文表明,目前的 AI 视频观察者擅长发现“存在的东西”,但不擅长意识到“不存在的东西”。它们太有礼貌了,以至于很难说出“不”。通过教它们遵循严格的“因果关系”清单(CausalAct),我们可以帮助它们学会一项艰深的技能——否定(Denial):即意识到仅仅因为场景看起来对了,并不代表动作就在发生。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →