✨ 要点🔬 技术摘要
想象一下,你手里拿着一部两小时长的纪录片,被问到一个非常具体的问题,比如:“那个男人在掉落花瓶时戴着什么颜色的帽子?”
旧方法(被动感知): 目前的 AI 模型通常通过从整部电影中随机抓取一小把帧来尝试回答这个问题——也许是均匀分布的 64 个快照。这就像试图通过随机抓起一把干草来在一堆干草中寻找一根特定的针。如果那根针不在这一把干草里,AI 就会进行猜测,由于错过了关键时刻,它经常会猜错。
新方法 (VSeek): 这篇论文介绍了一种名为 VSeek 的更聪明的 AI 智能体,它的行为更像是一名人类侦探。它不再是随机猜测,而是主动“回溯”视频时间轴。它会思考:“我需要找到花瓶掉落的部分,”然后利用自然语言去搜索那个特定的场景。这就像拥有一个聪明的助手,知道如何使用视频播放器的“查找”功能,直接跳转到相关的时刻,然后再进行回答。
问题所在:我们如何教会 AI 进行良好的搜索? 训练一个优秀的 AI 侦探是非常困难的。通常,我们只告诉 AI 最终答案是对还是错(就像老师在考试结束时评分一样)。但如果 AI 搜索了错误的内容却仍然因为运气好而得到了正确答案,它就会养成坏习惯。它需要关于其“如何搜索”的反馈,而不仅仅是最终结果的反馈。
解决方案:VETL(“视觉单元测试”) 为了解决这个问题,作者创建了一个名为 VETL (通过时序逻辑获取视觉证据)的系统。把这想象成将问题转化为一份清单 或一个食谱 。
拆解过程: 该系统将复杂的问题分解为微小的、不可辩驳的事实(原语)。
奖励机制: 当 AI 搜索视频时,系统会检查它的“收据”(即它找到的片段)。它找到了倒水的片段吗?它找到了酸奶吗?如果 AI 找到了与清单相匹配的片段,它就会获得一个“加分”(奖励),甚至在给出最终答案之前。
这就像一款视频游戏,你通过收集特定的物品来获得积分,而不仅仅是通过击败最终 Boss 来获得积分。这教会了 AI 变得细致且精准。
结果: 通过使用这种“清单”方法来训练 AI,VSeek 在长视频中寻找正确答案的能力变得更强了。
与那些只是猜测或随机搜索的模型相比,它的准确率显著提高。
它学会了提出更好的搜索问题(例如,搜索“草莓配料”而不是仅仅搜索“食物”)。
它变得更加高效,观察的帧数整体减少了,因为它知道确切要找什么,而不是盯着整部电影看。
总结: 这篇论文提出了 VSeek ,一种不再是被动观看视频,而是像侦探一样主动搜寻答案的 AI。为了教会它如何有效地搜寻,作者发明了 VETL ,一个将问题转化为严格的视觉事实清单的系统。这让 AI 能够获得关于其是否正在收集正确证据的即时反馈,从而在处理长视频时给出更聪明、更准确的答案。
tags。 2. 搜索: 通过 <search> 或 <search subtitle> 工具发出自然语言搜索查询,以检索候选片段。 3. 观察: 从检索到的片段中接收有限的帧预算(每轮 16 帧)。 4. 细化: 在制定最终答案之前,根据检索到的证据更新其上下文。
该系统利用双重索引基础设施:
语义视觉索引: 视频被分割成 8 秒的片段,并使用 ViCLIP 编码器进行嵌入。
字幕索引: 文本转录被映射到精确的帧窗口,允许智能体搜索特定的 spoken dialog(口语对话)或视觉嵌入可能遗漏的命名实体。
2.2 VETL:通过时序逻辑进行视觉验证
为了解决奖励稀疏问题,作者提出了 VETL ,这是一个连接开放式自然语言与离散视觉验证的神经符号流水线。
规范生成: 复杂的用户查询被编译为形式化的时序逻辑 (TL) 规范。LLM 生成器针对一组原子视觉原语(例如“女人”、“倒水”、“加入草莓”)提出一个 TL 公式 ϕ \phi ϕ 。评审模型验证该规范的实体覆盖范围和时序忠实度。
解耦语义与时间: TL 规范将视觉落地事件(原语)与其时序依赖关系解耦。这把长程问题转化为一个由所需视觉元素组成的精确清单。
密集奖励信号: 在强化学习(RL)后训练期间,智能体检索到的视频上下文会根据 TL 规范进行评估。确定性视觉检查器(使用 ViCLIP)检测特定原语是否存在于检索到的帧中。奖励 R V E T L R_{VETL} R V E T L 计算为在整个轨迹中成功观察到的所需原语的比例。这提供了密集的、逐步的反馈,激励智能体去收集特定的证据,而不是仅仅猜测最终答案。
2.3 强化学习
该框架采用群体相对策略优化 (GRPO) 进行后训练。总奖励是最终答案准确率(精确匹配,R E M R_{EM} R E M )和 VETL 证据奖励(R V E T L R_{VETL} R V E T L )的加权组合:R = λ 1 R E M + λ 2 R V E T L R = \lambda_1 R_{EM} + \lambda_2 R_{VETL} R = λ 1 R E M + λ 2 R V E T L 其中 λ 1 = 0.7 \lambda_1=0.7 λ 1 = 0.7 且 λ 2 = 0.3 \lambda_2=0.3 λ 2 = 0.3 。该目标鼓励模型学习一种严谨地在回答前验证上下文的搜索策略。
3. 核心贡献
论文概述了四个主要贡献:
VSeek 框架: 一个智能体系统,它将 LVQA 转换为一个主动的多轮发现过程,使用自然语言作为主要的搜索接口,绕过了对严格时间戳预测的需求。
VETL 流水线: 一种神经符号方法,将开放式问题转换为可验证的时序逻辑规范,有效地为上下文构建创建了“视觉单元测试”。
已验证的 RL 奖励: 一种新型奖励塑造机制,通过提取的视觉原语对智能体的证据收集轨迹进行评分,从而实现超越仅基于结果监督的可检查、逐步反馈。
经验验证: 证明了优化经过验证的上下文构建可以显著提升长视频理解的智能体推理性能。
4. 实验结果
作者在多个领域内(LongVideoBench, MLVU, Video-MME)和领域外(LVBench, CGBench-mini)基准测试上评估了 VSeek。
性能提升: 与基础模型(Qwen3-VL-4B-Thinking)相比,VSeek 变体显示出显著改进。具体而言,VSeek-VETL 在长视频理解基准测试中的 Pass@1 分数提升高达 8% ,Pass@4 分数提升达 15% 。
奖励有效性: 引入 VETL 奖励相比于仅使用精确匹配奖励(VSeek-EM)的模型具有明显的优势,特别是在证据覆盖至关重要的领域内数据集上。
长视频鲁棒性: 随着视频时长增加(例如 >10 分钟),VSeek 变体相比于 VideoTree 和 Naive RAG 等基准模型保持了更高的推理稳定性。VSeek-VETL 特别学会了生成高度具体的搜索关键词,避免了经常导致无关片段的泛泛查询。
效率: VSeek 变体在处理显著更少的帧(平均约 30–32 帧)的情况下,实现了最先进的性能,而标准 VLM 和 RAG 基准模型的固定预算为 64 帧。
算法鲁棒性: 已验证奖励的益处在 GRPO 和 RLOO 算法中是一致的,但在使用 GSPO 时观察到了性能下降。
5. 意义与主张
论文声称,面向智能体长视频 QA 的路径必须借鉴数学和编程领域 LLM 推理的突破,在这些领域,进步是由可验证奖励 催化的。
从被动到主动的转变: VSeek 将该领域从被动、均匀采样转向主动、迭代的证据寻求,承认人类并不依赖随机的帧采样来处理长文档。
弥合验证差距: 通过引入 VETL,作者声称解决了将 RL 应用于视频的关键瓶颈:缺乏用于验证上下文构建 的信号。这使得训练出的智能体被激励去寻找“正确”的视觉证据,而不仅仅是“正确”的最终答案。
未来智能体的基础: 作者将 VSeek 和 VETL 定位为更强大的视频智能体的基础,认为显式优化可验证的证据寻求行为对于扩展长视频理解能力至关重要。
论文总结道,尽管挑战仍然存在(例如顺序搜索限制和检索器瓶颈),但结合智能体搜索与神经符号验证,为解决复杂、长程视频推理任务提供了一条稳健的路径。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。