Towards Sparse Video Understanding and Reasoning
本文介绍了 \revise,一种用于视频问答的多轮智能体,它通过选择稀疏的信息帧、维护摘要状态以及采用提前停止机制来提高效率和准确性,并结合了用于强化微调的 EAGER 无标注奖励机制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图破解一个谜团,但你得到的不是单一的线索,而是一段 2 小时的监控录像。如果你看完整个过程,你的大脑会感到疲劳,你会因为无聊的部分(比如墙壁静止不动了 10 分钟)而感到不知所措,并且你可能会错过嫌疑人真正做出动作的那一秒钟。
这就是 REVISE 为计算机解决的问题。
问题所在:视频太多,脑力不足
目前的 AI 模型在观看视频时通常会采取两种方式之一:
- “盲目扫描”: 它们均匀地抽取帧(图片),比如每隔 5 秒拍一张照片。这种方式效率很低,因为其中 90% 的照片可能都是完全一样的,这浪费了 AI 的时间和内存。
- “信息过载”: 它们试图一次性处理整个视频,这会让 AI 感到困惑,并导致它错过重要的细节。
论文指出,视频具有“稀疏性”。这意味着只有极少数的帧才真正包含问题的答案,其余部分都只是噪音。
解决方案:REVISE(聪明的侦探)
作者创建了一个名为 REVISE(基于视频稀疏性的推理)的系统。你可以把 REVISE 不仅仅看作是一个视频播放器,而是一个被允许索要特定线索的聪明侦探。
它是这样工作的,这里使用了一个简单的类比:
1. “摘要即状态”(侦探的笔记本)
与其让 AI 尝试记住它见过的每一帧(这几乎是不可能的),REVISE 强制要求 AI 维护一个运行中的笔记本。
- 旧方法: AI 试图把整个视频都装进脑子里。
- REVISE 的方法: 在看了几帧之后,AI 会在笔记本上写下一段简短的摘要:“我看到乔治正在看货架。他看起来很好奇。我仍然不知道他发现了什么。”
- 神奇之处: 在下一轮中,AI 不再重看之前的视频,它只是阅读自己的笔记本。这保持了“上下文”的精简和清晰,防止 AI 被信息淹没。
2. 多轮对话(索要线索)
REVISE 不会立即做出猜测。它在与视频玩一场“二十个问题”的游戏:
- 第一轮: 它观察 3 帧随机的画面。它在笔记本上写道:“乔治正在看货架。我不确定原因。”
- 第二轮: 根据这条笔记,它问道:“请给我看第 3、5 和 6 帧。” 它观察了这些新帧,并在笔记本上更新道:“啊,他拿起了一个罐子。他看起来很高兴。”
- 第三轮: 它可能会决定:“我已经有足够的证据了,” 然后停止。或者它可能会要求看一帧特定的画面。
这就像一个侦探,他只在需要特定时刻的时候才打电话给警察请求查看,而不是盯着整段录像一直看。
3. “提前停止”的超能力
大多数系统要么观看整个视频,要么观看固定数量的帧。REVISE 则足够自信,能够说出:“我现在知道答案了,” 并及时停止。这节省了大量的计算时间和计算机资源。
“EAGER” 奖励(训练侦探)
为了教会 AI 变得如此聪明,作者发明了一种新的训练方法,叫做 EAGER。你可以把它看作是一个奖励 AI 高效表现的视频游戏评分系统:
- 置信度提升: 如果 AI 观察了一个新帧后,突然对答案变得更加确定,它就会获得分数。
- 摘要充分性: 如果 AI 仅凭其笔记本(而不重新阅读原始视频)就能正确回答问题,它就会获得分数。
- 正确且提前停止: 如果 AI 能快速(在更少的轮次内)得到正确答案,它会获得额外奖励。
他们发现了什么?
论文在许多视频测试(例如“视频中发生了什么?”或“那个人为什么那样做?”)中测试了该系统。
- 即插即用: 他们可以将 REVISE 与现有的强大 AI 模型(如 GPT-4o)配合使用,而无需改变这些模型的“大脑”。它就像一个智能接口一样包裹在模型周围。
- 结果: REVISE 在使用更少帧数的情况下,取得了比其他方法更好的成绩。
- 其他方法可能会观察 50 帧以上。
- REVISE 通常只需不到 10 帧(有时甚至只需 3 或 4 帧)就能解决问题。
- 效率: 因为它观察的帧数更少且能提前停止,所以它更快,占用的计算机内存也更少。
核心结论
REVISE 教会了 AI 不要只是“观看”整个视频,而是要“调查”视频。通过保持一份精简、有序的总结,并只请求它需要来填补空白的特定帧,它解决了视频问答问题,比那些试图吞下整个视频的系统更快速、更便宜、也更准确。
论文中提到的局限性:
- 它仍然依赖于底层 AI 良好的“视觉”能力。如果基础 AI 的视觉能力很差,REVISE 也无法修复这一点。
- 由于它必须逐个询问帧(就像打电话一样)而不是一次性下载整个视频,因此运行时间会稍长一些。
- 它观察的是完整的帧,而不是帧内的特定微小区域(例如人的手部)。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。