← 最新论文
💻 computer science

VidHal: Benchmarking Temporal Hallucinations in Vision LLMs

本文针对现有视觉大语言模型在视频输入下缺乏细粒度幻觉评估的问题,提出了 VidHal 基准,通过构建涵盖不同幻觉程度的视频描述排序任务,系统性地揭示了当前模型在时空动态理解中的幻觉局限性并推动相关研究。

原作者: Wey Yeh Choong, Yangyang Guo, Mohan Kankanhalli

发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Wey Yeh Choong, Yangyang Guo, Mohan Kankanhalli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 VidHal 的新工具,它的任务就像是给现在的“视频 AI 大脑”做一次专门的“幻觉体检”

为了让你更容易理解,我们可以把现在的视频大语言模型(VLLMs)想象成一群刚学会看视频的小学生。它们很聪明,能看懂视频里的人在做什么,也能用流利的语言描述出来。但是,它们有一个大毛病:爱“脑补”

1. 什么是“幻觉”?(The Hallucination)

想象一下,你给这个小学生看一段视频:“一个穿着红衣服的人,从左边走到右边,手里拿着一个苹果。”

  • 正常回答:“视频里有个穿红衣服的人,拿着苹果从左走到右。”
  • 幻觉回答:“视频里有个穿衣服的人,拿着香蕉,还跳着舞从右走到左。”

虽然它描述得很生动,甚至逻辑通顺,但和真实视频完全对不上。这就是“幻觉”。以前的研究主要检查它们看图片会不会瞎编,但看视频时,因为视频是动态的、有时间的,情况要复杂得多。

2. VidHal 是什么?(The Benchmark)

以前的考试(基准测试)就像做判断题

  • 问:“视频里是苹果还是香蕉?”
  • 答:“苹果。”(对/错)

这种考试太简单了,AI 只要猜对一半就行,而且很难发现那些细微的谎言。比如,AI 说“苹果是红色的”,其实视频里是“深红色”,这种细微差别以前的考试测不出来。

VidHal 就像是一场“找茬排序大赛”
研究者给 AI 看同一段视频,然后给它三张不同的描述卡片

  • 卡片 A(真相):完全符合视频。
  • 卡片 B(小谎言):大部分对,但有个小细节错了(比如把“走路”说成“慢跑”)。
  • 卡片 C(大谎言):完全瞎编(比如把“走路”说成“在飞”)。

任务不是让 AI 选哪个对,而是让 AI 给这三张卡片排个序:从“最像真的”到“最像瞎编的”。

  • 如果 AI 能分清 A、B、C 的差别,说明它真的看懂了视频。
  • 如果 AI 把 B 和 C 搞混了,或者觉得 C 比 B 更像真的,说明它的“幻觉”很严重,连细微的谎言都分辨不出。

3. 他们发现了什么?(The Results)

研究者用这个新考试测试了 23 种不同的 AI 模型(包括开源的和像 GPT-4、Gemini 这样的商业模型)。结果发现了一些有趣的现象:

  • 大家都爱“看图说话”:很多 AI 在看视频时,其实只盯着某一帧画面(就像看照片),然后就开始瞎编。它们忽略了“时间”这个维度。比如,视频里人先拿杯子再喝水,AI 可能只看到拿杯子的画面,就以为整个过程都在拿杯子,完全忽略了顺序。
  • 大模型不一定更聪明:有时候,参数更大的模型并没有比小模型少犯“时间顺序”的错误。
  • 擅长“静态”不擅长“动态”:AI 在识别“这是什么物体”(比如杯子、人)方面表现很好,但在识别“怎么动”(方向、速度、先后顺序)方面,经常犯迷糊。就像它能认出你在跑步,但分不清你是向左跑还是向右跑。

4. 为什么这很重要?(The Impact)

想象一下,如果未来的自动驾驶汽车或医疗监控 AI 有这种“幻觉”:

  • 它可能把“红灯”看成“绿灯”(方向幻觉)。
  • 它可能把“先刹车后转弯”看成“先转弯后刹车”(顺序幻觉)。

这不仅仅是说错话的问题,而是可能导致严重的现实事故

总结

这篇论文就像给视频 AI 设计了一套全新的“防忽悠”训练题。它不再满足于问“对不对”,而是问“有多离谱”。通过让 AI 给谎言排序,研究者发现现在的 AI 虽然能看懂画面,但在理解时间流逝和动作细节上,还像个容易做白日梦的小学生。

未来的方向就是教这些 AI 学会“慢下来”,真正去理解视频里每一秒发生了什么,而不是只盯着某一帧画面就急着瞎编。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →