Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks
本文引入了视觉依赖差距(Visual Dependency Gap, VDG)来证明视频大语言模型中的高基准测试准确率往往源于语言先验而非真正的视觉理解,从而揭示了时间顺序对性能的贡献微乎其微,而帧多样性则驱动了大部分增益。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人如何理解世界。你给了它一个摄像头和一个大脑,并向它提出关于它所见内容的问题。长期以来,科学家们通过给这些机器人进行测试来衡量它们有多“聪明”:给它们看一段视频,问一个问题,然后看它们是否得到了正确的答案。如果机器人的得分很高,我们就假设它真正地“看到”并理解了视频。但问题在于:仅仅因为机器人得到了正确答案,并不意味着它看了图片。它可能只是根据问题中的文字进行了猜测,就像一个知道老师在周二总是问关于“猫”的问题,于是不用看黑板就直接回答“猫”的学生一样。这篇论文深入探讨了“视频大语言模型”(Video Large Language Models)——即能够阅读文本并观看视频的超级聪明计算机——那混乱且令人困惑的世界,提出了一个可怕的问题:这些机器人是真的在看电影,还是仅仅通过文字巧妙地猜出了答案?
研究人员决定对二十种不同的视频观看机器人进行一个小小的恶作剧,这些机器人从微型机器人到拥有巨大大脑的庞然大物不等。他们采用了一个名为 MVBench 的标准测试,该测试包含数百个关于视频的问题,并且针对每个问题都运行了两次测试。第一次,他们向机器人展示真实的视频。第二次,他们向机器人展示完全相同的问题,但视频被替换成了一个纯黑色的屏幕。如果机器人是真的在“看”,那么当视频消失时,它的得分应该降至接近于零。如果机器人在面对黑屏时依然能答对,那就意味着它根本没有在观看,而是在利用语言技巧进行猜测。
结果令人震惊。团队发现,对于许多问题,无论机器人是在观看视频还是盯着一片漆黑的虚无,它们的表现几乎完全一样。他们引入了一种新的衡量方式,称为“视觉依赖差距”(Visual Dependency Gap,简称 VDG),这基本上是机器人观看视频的表现与不看视频的表现之间的差异。他们发现,对于某些类型的问题,比如“汽车是什么颜色的?”(属性感知),机器人确实需要视频才能答对。但对于其他类型的问题,比如“接下来会发生什么?”(时间推理),即使屏幕是黑色的,机器人也能答对。这意味着测试题目实际上并没有测试机器人对时间或序列的理解;它们只是在测试机器人是否能根据问题的措辞来猜出答案。
研究人员还试图弄清楚机器人为什么会得到这些答案。他们将视频分解成不同的部分:只有一个单帧、一堆顺序被打乱的帧,以及按时间顺序播放的完整视频。他们发现,机器人根本不在乎事件的顺序。无论视频是向前播放、向后播放,还是仅仅是一堆乱序的图片,机器人的得分都一样。唯一似乎有帮助的是看到“不同的图片”(帧多样性),而不是看到它们按正确的顺序出现。事实上,对于一些最新的、最先进的模型,视频输入似乎反而让它们感到困惑,导致它们的表现甚至比完全忽略视频仅靠文字猜测时还要稍差一点。
其中最有趣的发现之一是这些机器人如何处理压缩。通常情况下,如果你为了减小文件体积而压缩视频,质量会变差。研究人员原本预期,如果机器人是真的在“看”,那么模糊、压缩过的视频会让它们失败。但机器人的得分在视频被高度压缩时依然保持平稳。团队意识到,这并不是因为机器人具有超强的鲁棒性,而是因为问题太容易通过文本猜出来了,以至于机器人根本不需要视觉细节。这种“鲁棒性”是由糟糕的测试题目创造出的幻觉。
最后,他们观察了这些机器人是如何随着规模和智能度的提升而变化的。他们发现,虽然更大的模型通常变得更擅长使用视频,但一些最新的模型在依赖视觉信息方面反而退步了。其中一个模型 Qwen3-VL 似乎已经忘记了如何有效地利用视频帧,几乎完全依赖于从文本中进行猜测,尽管它的整体测试得分看起来很好。论文的结论是,我们不能再仅仅信任排行榜上的分数了。高分并不意味着机器人是一个优秀的观察者;它可能只意味着它是一个优秀的猜谜者。要判断一个机器人是否真的在看,我们需要检查当屏幕变黑时它是否会失败。如果它没有失败,说明它从一开始就没在看。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。