TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models
本文介绍了 TOC-Bench,这是一个经过严格筛选和人工验证的基准测试,旨在评估视频大语言模型在遮挡、状态变化及交互过程中维持时间对象一致性的尚未被充分探索的能力,结果表明,尽管视频理解已取得普遍进展,但当前模型在身份敏感推理和事件排序方面仍存在显著困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正与一位从未看过某部电影的朋友一起观影。你问他:“那个红球是因为滚到了沙发后面而消失,还是彻底离开了房间?”
如果你的朋友是一个标准的 AI 视频模型,他可能会回答:“我看到了一个红球,后来我看到了一张沙发,所以它一定在沙发后面。”他们擅长识别单张快照中的物体。但如果你问:“在球藏起来之前弹跳了多少次?”或者“球是在狗跑进来之前还是之后弹跳的?”,他们往往会感到困惑。他们难以在时间推移中理清那个特定球的故事,尤其是当它被遮挡或稍后再次出现时。
本文介绍了一项名为TOC-Bench(时间对象一致性基准)的新测试,旨在确切评估这些 AI“观影者”在时间向前推进时追踪物体的能力。
问题所在:“健忘”的观影者
当前的 AI 模型就像一个对单张照片记忆极佳、但在照片之间患有失忆症的人。他们可以告诉你图片里有什么,但往往无法追踪:
- 身份:隐藏后再次出现的人是同一个人,还是另一个人?
- 连续性:物体是离开了房间,还是仅仅被遮挡了视线?
- 计数:那只猫上下跳了多少次?
- 顺序:杯子是在狗叫之前还是之后破碎的?
现有的测试大多提出诸如“这段视频里发生了什么?”或“主角是谁?”这类宽泛的问题。它们并未检验 AI 能否跟随特定物体在整个故事中的旅程。
解决方案:侦探的笔记本(TOC-Bench)
作者构建了一个名为TOC-Bench的特殊测试套件。不妨将其视为视频 AI 的“侦探笔记本”。
真实依据(地图):在向 AI 提问之前,研究人员利用专用工具为视频创建了一份完美的“地图”。他们逐帧追踪每个物体(如红球或人),精确记录它们何时出现、消失、被遮挡或与他人互动。
问题(谜题):他们仅基于这张地图生成了数千个问题。例如:“计算红球被蓝色盒子遮挡了多少次。”
“捷径”过滤器(陷阱):这是巧妙之处。研究人员希望确保 AI 无法作弊。他们使用了一个三步过滤器,剔除任何可以通过以下方式回答的问题:
- 仅阅读问题(语言技巧)。
- 仅查看单帧画面(静态图像技巧)。
- 随机查看帧序(忽略时间)。
如果一个问题可以在不按顺序观看视频的情况下解决,它就会被剔除。这确保了 AI 必须理解时间流和物体的历史才能给出正确答案。
结果:现实检验
研究人员用这项新测试评估了 23 种不同的 AI 模型(包括免费和昂贵的模型)。结果令人惊讶:
- 差距:人类的得分约为89%。表现最好的 AI 模型仅得47%。
- 薄弱环节:AI 在以下方面表现极差:
- 计数:“这件事发生了多少次?”(它们常将 4 次猜成 2 次)。
- 排序:“哪个先发生?”(它们常搞混时间线)。
- 幻觉:当被问及视频中从未存在的物体时,AI 往往会自信地编造一个关于它的故事,而不是说“那个物体不在那里”。
核心结论
该论文得出结论:擅长“通用视频理解”(如描述场景)并不意味着 AI 擅长“时间对象一致性”(在时间推移中追踪特定物体的故事)。
可以这样理解:你可以有一个朋友,他知道场景中每个演员的名字以及他们穿什么,但如果你让他追踪在十分钟的争吵中谁把秘密纸条传给了谁,他就会失败。TOC-Bench 证明,当前的 AI 模型在追踪物体随时间推移的具体旅程时,仍然是“健忘者”。
作者希望这项测试能帮助开发者构建更好的 AI,使其能够真正跟随故事,而不仅仅是识别快照。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。