← 最新论文
🤖 AI

INFACT: A Diagnostic Benchmark for Induced Faithfulness and Factuality Hallucinations in Video-LLMs

本文提出了名为 INFACT 的诊断基准,通过包含近万条细粒度问答实例及四种诱导模式(如视觉退化、证据篡改等),系统评估了视频大语言模型在忠实度与事实性幻觉方面的可靠性,揭示了高基础准确率并不等同于高鲁棒性,且许多开源模型在事实性时序问题上表现出显著的惯性缺陷。

原作者: Junqi Yang, Yuecong Min, Jie Zhang, Shiguang Shan, Xilin Chen

发布于 2026-03-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Junqi Yang, Yuecong Min, Jie Zhang, Shiguang Shan, Xilin Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 INFACT 的新工具,它的任务就像是给现在的“视频大语言模型”(Video-LLMs)做一场全方位的“体检”和“压力测试”

为了让你更容易理解,我们可以把现在的视频 AI 想象成一个刚毕业、记忆力超群但有点“想当然”的实习生

1. 核心问题:这个实习生爱“瞎编”

虽然这些 AI 看视频的能力进步很快,但它们有个大毛病:幻觉(Hallucination)

  • 忠实度幻觉(Faithfulness): 就像实习生看着视频说:“视频里那个穿红衣服的人手里拿的是苹果。”其实视频里明明是个梨。它没看清眼前的证据,却信口开河。
  • 事实性幻觉(Factuality): 就像实习生看着视频里有人在切蛋糕,然后说:“这肯定是在庆祝春节。”其实视频里明明是在过生日,或者根本和节日无关。它没搞懂常识,用脑子里的旧知识乱套。

以前的测试就像是在安静的图书馆里考这个实习生,题目很简单,视频也很清晰。实习生只要背背题库就能拿高分。但论文作者发现,一旦把环境变复杂(比如视频模糊了、字幕写错了、或者把视频顺序打乱了),这个实习生就立刻“露馅”了。

2. INFACT 是什么?一个“魔鬼训练营”

INFACT 就是一个包含 9,800 道考题 的超级题库,它不再只考“安静图书馆”里的题,而是设计了四种**“压力模式”**来测试实习生的真实水平:

  • 模式一:基础模式(Base)

    • 比喻: 在明亮的教室里考试。
    • 目的: 看看实习生在正常情况下的基础分是多少。
  • 模式二:视觉干扰(Visual Degradation)

    • 比喻: 把教室的灯关掉一半,或者给实习生戴上模糊的墨镜,甚至把视频压缩得像马赛克一样。
    • 目的: 测试当看不清的时候,实习生是还能坚持真理,还是开始瞎猜?
  • 模式三:证据污染(Evidence Corruption)

    • 比喻: 这是最狡猾的测试。视频里明明在“开门”,但旁边突然有人(或者字幕)大声喊:“他在关门!”或者给视频加了一些完全无关的噪音字幕。
    • 目的: 测试实习生能不能分清真假。当视频证据和文字提示打架时,它敢不敢相信眼睛看到的,还是会被文字带偏?
  • 模式四:时间干预(Temporal Intervention)

    • 比喻: 把视频里的动作顺序打乱。比如把“先穿鞋再系鞋带”的视频,剪辑成“先系鞋带再穿鞋”。
    • 目的: 测试实习生有没有时间观念。如果它不管顺序怎么变,都给出同一个答案,说明它根本没看懂动作的逻辑,只是在死记硬背。

3. 测试结果:高分不代表靠谱

作者用这个“魔鬼训练营”测试了 14 个最厉害的 AI 模型(包括 GPT-5.1、Gemini 等)。结果发现了一个惊人的现象:

  • 平时分高,不代表抗压能力强: 很多模型在“基础模式”下考 90 分,但在“证据污染”或“时间打乱”的模式下,分数暴跌。
  • 特别爱听“假话”: 当视频里出现错误的字幕(比如把“开门”写成“关门”)时,很多模型会立刻被带偏,放弃了视频里的真实画面。这说明它们太依赖文字提示,不够自信。
  • 时间感极差(惯性大): 这是最搞笑的发现。很多开源模型在遇到“打乱顺序”的视频时,完全没反应。哪怕视频里的人先倒立再走路,它们还是坚持说“这是正常的走路”。它们就像一辆没有刹车的车,一旦开起来(有了初始判断),就算路变了,它也停不下来,继续按原来的惯性跑。

4. 这个研究有什么用?

这就好比以前我们只关心汽车跑得快不快(准确率),现在 INFACT 告诉我们,我们更得关心汽车在暴雨、雪天、或者被坏人干扰时会不会失控(可靠性)。

  • 对于开发者: 这是一个诊断工具,能精准指出模型是“看不清”、“记不住常识”还是“太固执”。
  • 对于大众: 它提醒我们,现在的 AI 虽然看起来聪明,但在处理复杂、混乱或需要严格逻辑的视频时,千万别全信它,因为它可能会在关键时刻“掉链子”。

一句话总结:
INFACT 就像给视频 AI 装了一面哈哈镜和干扰器,专门用来照出它们“平时装得挺像,一遇事就露馅”的毛病,告诉我们要想真正信任 AI,光看它平时考多少分是不够的,还得看它在“混乱世界”里能不能稳住阵脚。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →