想象一下,你正在试图解开一个复杂的谜团,比如推断电影某个场景发生了什么。大多数当前的人工智能“侦探”(称为视觉 - 语言模型)在开始时只被提供几帧静态的电影快照,并被要求仅凭这些静止图像来解开整个谜题。这就像有人试图仅通过查看封面艺术和剧本的前两页来猜测电影的剧情。他们错过了所有的动作、对话以及随后发生的关键细节。
ACT2SEE 是一个新框架,它赋予了这些人工智能侦探一项超能力:主动视觉感知。ACT2SEE 不再让 AI 被困在初始快照中,而是教会 AI 意识到:“等等,我还没有足够的线索,”然后主动出击获取更多信息。
以下是其工作原理的简单步骤分解:
1. “询问与行动”方法
在旧方法中,AI 仅基于其最初看到的内容进行猜测。而在 ACT2SEE 中,AI 被训练为暂停其思考过程,并说出:“我需要看到这一特定时刻,”或者“我需要想象如果……会发生什么”。
- 检索(时间旅行者): 如果 AI 需要看到视频中实际发生过但不在初始快照中的特定时刻,它会使用“检索工具”跳回视频中,提取它需要的确切帧。这就像请图书管理员从你正在阅读的书里抽出特定的一页。
- 生成(白日梦想家): 有时,问题涉及未发生的事情,例如“如果火车在日落之前停在车站会怎样?”由于该场景在视频中不存在,AI 会使用“生成工具”创建该假设场景的全新图像。这就像一位艺术家勾勒出仅存在于你想象中的场景。
2. 训练营(监督微调)
他们是如何教会 AI 这样做的?他们并没有只是告诉它“更努力尝试”。他们利用一个非常智能的“前沿”AI(Gemini 2.5 Pro)建立了一个特殊的训练营。
- 演练: 他们要求这个智能 AI 解决视频谜题。每当 AI 意识到它需要更多视觉线索时,它就被指示停下来并写下笔记,例如:“去给我拿一张 [X] 的图片”或“给我画一张 [Y] 的图片”。
- 质量检查: 他们并没有接受任何答案。他们将 AI 的推理步骤与人类编写的“黄金标准”答案进行了比较。如果 AI 的推理混乱或与人类逻辑不符,他们就会将其丢弃。他们只保留高质量的“侦探工作”,即 AI 正确请求了所需视觉证据的情况。
- 结果: 他们创建了一个包含这些高质量“侦探日志”的大型数据集(约 3,300 个示例),其中大约一半的情况下,AI 必须提取新图片或绘制新图片来解决案件。然后,他们使用此数据集训练了一个更小、更高效的 AI 模型(Qwen3-VL-8B)。
3. “涌现”魔力
最令人兴奋的部分是,当训练有素的 AI 在从未见过的新谜题上进行测试时会发生什么。它不仅仅遵循僵化的脚本。它会自发地决定何时要求获取更多图片。
- 如果问题涉及事实细节(例如,“那辆车是什么颜色的?”),它知道要从视频中检索确切的帧。
- 如果问题是一个“如果”场景(例如,“如果那辆车是红色的会怎样?”),它知道要生成一张新图像来可视化这种可能性。
这种“用图像思考”并动态收集证据的能力,就是作者所称的涌现能力。这就像 AI 突然学会了说:“仅凭我的眼睛无法解决这个问题;我需要看得更仔细,或者想象其余部分。”
4. 结果
在针对困难视频推理基准(如涉及视频的复杂逻辑谜题)进行测试时,ACT2SEE 的表现优于许多更大、更强大的模型。
- 它击败了规模是它两倍的模型。
- 它的表现优于其他试图将视频帧添加到推理中但未教会 AI 主动决定何时使用它们的方法。
- 它在处理“反事实”问题(即“如果”场景)方面比任何人都好得多,证明了生成假设图像的能力对于深度推理至关重要。
总结
可以将 ACT2SEE 视为将 AI 从被动观察者(只是盯着几张照片看)升级为主动调查员(知道何时深入挖掘证据或利用想象力填补空白)。通过教会 AI 在思考过程中主动请求或创建所需的视觉信息,它以前所未有的理解水平解决了复杂的视频谜题,这是以前无法实现的。
技术摘要:ACT2SEE——面向视频推理的涌现式主动视觉感知
问题陈述
当前执行视频推理的视觉 - 语言模型(VLM)通常依赖静态初始帧或固定的每秒帧数(fps)采样。这种静态输入范式限制了模型在推理过程演进中整合关键动态信息的能力。尽管近期方法尝试通过额外帧信息(例如预定的关键帧或视觉工具调用)增强思维链(CoT)推理,但它们面临两个主要局限:
- 次优的 CoT 质量:现有方法通常从自动生成的 VLM 地面真值中推导帧增强的 CoT,缺乏严格的人工验证,导致推理轨迹存在噪声或不一致。
- 无法合成假设场景:当前方法无法在 CoT 中生成新的视觉帧以应对反事实或假设性问题(例如,“如果时间顺序被颠倒会发生什么?”)。它们仅限于检索现有的视觉证据,无法“想象”原始视频中不存在的情景。
方法论
作者提出了Act-to-See (ACT2SEE),这是一个旨在赋予 VLM主动视觉感知能力的框架。该能力使模型能够在推理过程中动态决定何时以及如何收集新的视觉信息——无论是通过检索现有帧还是生成假设性帧。
1. 通过监督微调(SFT)构建数据集
ACT2SEE 的核心是一个高质量的 SFT 数据集,包含交错式视频 - 文本 CoT。构建流程包括:
- 前沿模型提示:提示前沿 VLM(Gemini 2.5 Pro)执行视频推理。关键在于,当模型判定现有视觉信息不足时,被指示输出带有特定查询的专业工具调用令牌(
<retrieve> 或 <generate>)。
- 工具执行:
- 检索:使用 TFVTG(免训练视频时间定位)以更高的采样率(3 fps)搜索完整视频,查找与查询匹配的相關帧。
- 生成:使用 Stable Diffusion 3.5 Large 基于查询合成新帧,并以检索到的帧为条件以确保视觉一致性。
- 两轮完成:该过程分为两轮。第一轮中,模型生成推理直至工具调用。工具执行后,新帧被插入。第二轮中,模型利用新的视觉证据完成推理轨迹。
- 质量控制:为确保高质量的训练数据,生成的 CoT 会根据 MINERVA、CausalVQA 和 Social Genome 等基准中的人工标注地面真值 CoT 进行过滤。仅当文本嵌入相似度(BGE M3)超过 80% 时,才保留这些轨迹。导致错误答案的 CoT 会被重新生成。
2. 训练与推理
- 训练:使用构建的交错数据集对基础模型(Qwen3-VL-8B-Thinking)进行微调。损失函数计算整个展开过程中的令牌级损失,包括文本推理和工具调用查询,但排除实际检索/生成的图像令牌。
- 推理:训练后的模型遵循相同的算法流程。它生成响应;如果检测到
<retrieve> 或 <generate> 令牌,则执行相应的离线工具,将新帧注入上下文,模型继续推理以生成最终答案。
主要贡献
- 涌现式主动感知:ACT2SEE 使 VLM 能够在推理时将视频帧主动交错插入文本 CoT 中,允许它们动态搜索缺失的事实证据或合成反事实场景。
- 高质量交错数据集:作者整理了一个包含 3,373 条推理轨迹的数据集,其中 47.67% 包含检索或生成的帧。该数据集经过严格的人工标注过滤,以确保推理质量,解决了以往自动化 CoT 生成中的噪声问题。
- 双重能力(检索 + 生成):与仅专注于检索或静态关键帧的先前工作不同,ACT2SEE 在推理循环中整合了现有视频内容的检索和假设性视觉证据的生成合成。
实验结果
ACT2SEE 在五个多样化的视频推理基准上进行了评估:Video-MME、VideoEspresso、EgoNormia、VCR-Bench 和 ViTIB。
- 性能提升:ACT2SEE 在 VideoEspresso 和 ViTIB 上确立了新的最先进(SOTA)结果。它优于可比或更大的开源模型(例如 InternVL2.5-8B、Video-LLaMA3-7B、Qwen3-VL-8B-Thinking),甚至在 VideoEspresso 上超越了闭源的 GPT-4o,尽管使用的帧数更少。
- 与 SOTA CoT 方法的比较:该模型优于其他视频 - 文本交错 CoT 方法,如 Chain-of-Shot、FrameMind 和 ReWatch-R1。
- 消融研究:
- 数据源:使用人工标注的地面真值进行过滤(而非 VLM 生成的 CoT)显著提升了性能。
- 工具使用:结合检索和生成比单独使用任一工具产生更好的结果。
- 提示中的地面真值:在初始提示阶段排除地面真值 CoT 会增加工具调用的比率,从而带来更好的下游性能。
- 效率:与基线相比,ACT2SEE 在使用一半输入帧的情况下实现了更高的准确率、更低的延迟和更少的 FLOPs,展示了帕累托优势。
意义与主张
该论文声称,ACT2SEE 代表了在赋予 VLM主动视觉感知以进行复杂视频推理方面的重大进步。通过赋予模型主动决定何时搜索或合成视觉证据的能力,该框架克服了静态输入和次优推理轨迹的局限性。
作者强调了一种涌现能力:在推理时,模型自发地决定检索或生成帧以解决歧义或回答反事实问题,这种行为并非显式编程,而是通过 SFT 过程习得的。这种方法推动视频推理向更具因果基础且动态的理解方向发展,弥合了静态感知与复杂现实场景所需的细微时空动态之间的差距。该工作表明,解锁这些能力的关键在于高质量、经人工验证的交错数据,而非仅仅依赖自动数据合成。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。