Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models
本文介绍了STEMO-Bench,这是一个通过将查询分解为子问题来严格评估视频大语言模型时空监控能力的基准,并提出了STEMO-Track,这是一个以对象为中心的框架,通过显式的轨迹构建和时间聚合显著减少了幻觉并提升了推理一致性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在电视上观看一场复杂的足球比赛。你问朋友:“穿 66 号红衫的球员在 27 号进球之前,是否把球传给了 27 号?”
一台智能计算机(视频大语言模型)可能会查看视频并回答:“是的!”它答对了。但问题在于:它是如何得出这个答案的?
问题所在:“赌徒”与“裁判”
根据该论文,大多数当前的 AI 模型就像赌徒。它们观看视频后,要么基于过去在电影中看到的模式(例如“红衫队通常能进球”)来猜测答案,要么仅仅盯着球靠近球门的那一帧画面。它们靠运气或捷径答对了问题,但实际上并不理解比赛的来龙去脉。它们可能会认为 66 号球员传了球,即使他从未触球,仅仅因为最终结果是进球。
论文将这种现象称为"幻觉"。AI 很自信,但其内部构建的故事却是错误的。
作者认为,要真正理解视频,AI 需要像裁判或追踪者一样。它需要:
- 识别球员(对象身份)。
- 逐帧观察他们的行为(状态变化)。
- 持续记录谁在何时对谁做了什么(时空监控)。
解决方案第一部分:STEMO-Bench(“真相测试”)
研究人员建立了一项名为STEMO-Bench的新测试。他们不再仅仅向 AI 提出最终问题(“66 号是否传给了 27 号?”),而是将其拆解为一系列不可辩驳的小事实清单,就像侦探审问证人一样:
- 子问题 1:"66 号球员是否穿着红衫?”
- 子问题 2:"66 号球员是否真的触球了?”
- 子问题 3:"27 号球员是否接到了球?”
- 子问题 4:"27 号是否进球了?”
规则:如果 AI 给出了最终答案“是”,但在任何一个小问题上出错(例如,它认为 66 号穿的是蓝衫,或者 27 号从未触球),那么该 AI 判定为失败。
这阻止了 AI 靠猜测作答。它迫使 AI 证明它观看了整个序列,而不仅仅是结局。
解决方案第二部分:STEMO-Track(“笔记”系统)
为了纠正 AI 的坏习惯,作者创建了一个名为STEMO-Track的新系统。
想象你试图记住一部漫长而混乱的电影。
- 旧方法(黑盒):你试图一次性在脑海中容纳整部电影。你会感到不堪重负,混淆角色,忘记谁做了什么。
- STEMO-Track 方法(笔记):
- 分块:你将电影拆分成多个 15 秒的小片段。
- 状态提取:对于每个片段,你写下一条简单的笔记:"66 号球员持球。27 号球员正在奔跑。”
- 聚合(粘合剂):你将所有这些笔记拼接成一条单一、连续的故事线(轨迹)。你确保第 1 个片段中的"66 号球员”与第 10 个片段中的"66 号球员”是同一个人,即使他曾被树遮挡了一瞬间。
- 检索:当收到问题时,你不需要重看整部电影。你只需查看你的笔记(结构化故事),找到关于 66 号和 27 号的具体记录。
通过首先构建这种关于对象轨迹的“笔记”,AI 不再靠猜测,而是基于坚实的事件记录进行推理。
结果
当他们用这个新系统与现有的最佳 AI 模型(如 Gemini、GPT 等)进行测试时:
- 赌徒(旧模型):它们经常答对最终答案,但在“清单”问题上失败。它们是靠运气,而非聪明。
- 追踪者(STEMO-Track):它们不仅答对了最终答案,而且推理的每一步都正确。它们不只是猜测;它们追踪了真相。
核心结论
该论文声称,要阻止 AI 编造关于视频的故事,我们需要停止将视频仅仅视为一堆图片。相反,我们需要教导 AI 像一个持续追踪者那样行动,逐步记录谁是谁以及正在发生什么。通过在步骤上而非仅仅在最终答案上测试它们,我们最终才能看清它们是在真正“观看”视频,还是仅仅在猜测。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。