Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video
本文揭示了当前的视频大语言模型(Video-LLMs)在长视频中很大程度上无法真正追踪特定角色,而是依赖于浅层的性别线索,并且无法区分同性别的个体,这导致基准测试分数高估了它们实际的时间推理和身份追踪能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你雇佣了一个拥有 70 亿到 80 亿参数的超级聪明机器人侦探,去观看一整集《生活大爆炸》。你的任务对这个机器人来说很简单:“盯着谢尔顿(Sheldon),并告诉我在什么顺序下他的衣服发生了变化。”
你会预期这个机器人会像鹰一样敏锐,锁定谢尔顿的面部,追踪他在每个场景中的变化,并精准地记录下他的衣着更替。但转折点在于:这个机器人其实并没有在“看”谢尔顿。 它只是在利用一个非常偷懒的捷径进行猜测。
伟大的“谢尔顿”替换实验
为了弄清楚到底发生了什么,研究人员玩了一个聪明的把戏。他们使用了完全相同的视频和完全相同的多选题答案,只是简单地更换了问题中的名字。
- 原始问题: “谢尔顿以什么顺序更换了衣服?”
- 替换后的问题: “**莱纳德(Leonard)**以什么顺序更换了衣服?”(视频和答案保持不变)。
如果机器人真的在追踪角色,它应该会说:“等等,莱纳德穿的衣服和谢尔顿不一样!”并选择另一个答案。但你猜怎么着?机器人根本不在乎。
在大约 7% 到 17% 的同性别替换案例中(比如把谢尔顿换成莱纳德),机器人的答案发生了变化。这几乎跟掷骰子随机选答案没什么区别。它主要是在忽略名字,只是在挑选一个它喜欢的答案。
“性别”故障
那么,如果它不是在看那个人,它到底在看什么?研究人员发现,机器人使用的是一个非常粗糙、模糊的过滤器:性别。
当他们把一个男性角色换成女性角色时(比如从谢尔顿换成潘妮),机器人改变答案的可能性大大增加(20% 到 43%)。它似乎认为:“哦,问题从‘男人’变成了‘女人’,所以衣服肯定不一样了!”
但如果他们把一个男人换成另一个男人,机器人就彻底抓瞎了。它分辨谢尔顿和霍华德的能力,并不比分辨一只猫和一只狗的能力强多少。它能看到“男性”和“女性”,但它看不出“谢尔顿”。
“魔术盒”幻象
论文还检查了机器人是否通过记忆训练数据(比如提前读过剧本)来作弊。他们测试了仅给机器人看问题的文本和剧集的标题,而不提供任何视频的情况。结果显示,机器人的得分基本处于随机水平(大约 18–20%)。所以,它并不是靠剧本作弊,它只是视觉部分表现得很差。
他们还尝试给机器人更多的帧数(更多的“视频快照”),看看它是否只是需要看得更多。给它 32 帧 而不是 16 帧,虽然让它在识别衣服方面表现得稍微好了一点,但它仍然无法更好地追踪特定角色。这就像是给一个盲人一副更好的眼镜;他们能看得清衣服了,但他们仍然不知道是谁在穿。
多选题陷阱
这里是最令人惊讶的部分:机器人在标准测试中的正确率达到了 37–38%。这听起来很了不起!但这个分数其实是一个幻象。
当研究人员要求机器人用自己的话写出答案(开放式问题),而不是从列表中挑选(多选题)时,其得分骤降了 18 到 25 个百分点。
- 多选题得分: ~38%
- 开放式问题得分: ~13–19%
为什么会跌落这么多?因为多选题给了机器人一个“魔术盒”,即五个选项。即使机器人只是在瞎猜或者挑选它喜欢的答案(比如选“E”或“A”),它也有 1/5 的机会猜对。当被迫从头开始生成答案时,它没有任何安全网,并且彻底失败了。事实上,在 151 个来自开源机器人的开放式回答中,零个是完全正确的。
核心结论
论文得出结论,这些视频语言模型(Video-LLMs)并没有在真正追踪角色。它们是在“幻觉”出一种名字与视频之间的联系。它们擅长识别“一个人穿着一件衬衫”,但对于回答“哪个人”却极其糟糕。
研究人员指出,目前基准测试中的高分具有误导性。这些分数衡量的是模型如何根据性别线索进行猜测,或者如何通过幸运的多选题进行猜测,而不是它们如何真正理解并跟随一个故事。在模型能够通过“名字替换”测试和“开放式问题”测试之前,我们不能说它真正“观看”了视频。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。