← 最新论文
💻 computer science

Act2See: Emergent Active Visual Perception for Video Reasoning

本文介绍了 Act2See,这是一个新颖的框架,通过使视觉语言模型能够在其思维链过程中主动交错动态帧检索与合成,从而增强视频推理能力,进而在多个基准测试中实现最先进的性能。

原作者: Martin Q. Ma, Yuxiao Qu, Aditya Agrawal, Willis Guo, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Martin Q. Ma, Yuxiao Qu, Aditya Agrawal, Willis Guo, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解开一个复杂的谜团,比如推断电影某个场景发生了什么。大多数当前的人工智能“侦探”(称为视觉 - 语言模型)在开始时只被提供几帧静态的电影快照,并被要求仅凭这些静止图像来解开整个谜题。这就像有人试图仅通过查看封面艺术和剧本的前两页来猜测电影的剧情。他们错过了所有的动作、对话以及随后发生的关键细节。

ACT2SEE 是一个新框架,它赋予了这些人工智能侦探一项超能力:主动视觉感知。ACT2SEE 不再让 AI 被困在初始快照中,而是教会 AI 意识到:“等等,我还没有足够的线索,”然后主动出击获取更多信息。

以下是其工作原理的简单步骤分解:

1. “询问与行动”方法

在旧方法中,AI 仅基于其最初看到的内容进行猜测。而在 ACT2SEE 中,AI 被训练为暂停其思考过程,并说出:“我需要看到这一特定时刻,”或者“我需要想象如果……会发生什么”。

  • 检索(时间旅行者): 如果 AI 需要看到视频中实际发生过但不在初始快照中的特定时刻,它会使用“检索工具”跳回视频中,提取它需要的确切帧。这就像请图书管理员从你正在阅读的书里抽出特定的一页。
  • 生成(白日梦想家): 有时,问题涉及未发生的事情,例如“如果火车在日落之前停在车站会怎样?”由于该场景在视频中不存在,AI 会使用“生成工具”创建该假设场景的全新图像。这就像一位艺术家勾勒出仅存在于你想象中的场景。

2. 训练营(监督微调)

他们是如何教会 AI 这样做的?他们并没有只是告诉它“更努力尝试”。他们利用一个非常智能的“前沿”AI(Gemini 2.5 Pro)建立了一个特殊的训练营。

  • 演练: 他们要求这个智能 AI 解决视频谜题。每当 AI 意识到它需要更多视觉线索时,它就被指示停下来并写下笔记,例如:“去给我拿一张 [X] 的图片”或“给我画一张 [Y] 的图片”。
  • 质量检查: 他们并没有接受任何答案。他们将 AI 的推理步骤与人类编写的“黄金标准”答案进行了比较。如果 AI 的推理混乱或与人类逻辑不符,他们就会将其丢弃。他们只保留高质量的“侦探工作”,即 AI 正确请求了所需视觉证据的情况。
  • 结果: 他们创建了一个包含这些高质量“侦探日志”的大型数据集(约 3,300 个示例),其中大约一半的情况下,AI 必须提取新图片或绘制新图片来解决案件。然后,他们使用此数据集训练了一个更小、更高效的 AI 模型(Qwen3-VL-8B)。

3. “涌现”魔力

最令人兴奋的部分是,当训练有素的 AI 在从未见过的新谜题上进行测试时会发生什么。它不仅仅遵循僵化的脚本。它会自发地决定何时要求获取更多图片。

  • 如果问题涉及事实细节(例如,“那辆车是什么颜色的?”),它知道要从视频中检索确切的帧。
  • 如果问题是一个“如果”场景(例如,“如果那辆车是红色的会怎样?”),它知道要生成一张新图像来可视化这种可能性。

这种“用图像思考”并动态收集证据的能力,就是作者所称的涌现能力。这就像 AI 突然学会了说:“仅凭我的眼睛无法解决这个问题;我需要看得更仔细,或者想象其余部分。”

4. 结果

在针对困难视频推理基准(如涉及视频的复杂逻辑谜题)进行测试时,ACT2SEE 的表现优于许多更大、更强大的模型。

  • 它击败了规模是它两倍的模型。
  • 它的表现优于其他试图将视频帧添加到推理中但未教会 AI 主动决定何时使用它们的方法。
  • 它在处理“反事实”问题(即“如果”场景)方面比任何人都好得多,证明了生成假设图像的能力对于深度推理至关重要。

总结

可以将 ACT2SEE 视为将 AI 从被动观察者(只是盯着几张照片看)升级为主动调查员(知道何时深入挖掘证据或利用想象力填补空白)。通过教会 AI 在思考过程中主动请求或创建所需的视觉信息,它以前所未有的理解水平解决了复杂的视频谜题,这是以前无法实现的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →