✨ 要点🔬 技术摘要
想象一下,你有一部两小时长的电影,你问电脑:“找到英雄拿起红色背包的确切时刻,并跟随他直到他离开房间。”
完成这项任务对于标准的 AI 来说极其困难。如果 AI 试图观察视频中的每一帧(比如每秒 30 张图片)来寻找那个瞬间,它会被压垮。这就像是通过阅读每一本书里的每一个字母来在一座图书馆里寻找一个特定的词。这太慢了,成本太高,而且 AI 经常会感到困惑,导致丢失目标或发生剧烈的跳变。
这篇论文提出了一种更聪明、更高效的方法来教 AI 完成这项工作。以下是他们解决方案的拆解,使用了简单的类比:
1. “秒级”捷径
与其强迫 AI 观察每一帧,作者让它一次观察一秒钟 。
类比: 想象你在读小说。你不是在分析每一个字母来理解情节,而是每次读一个句子(或一秒钟)。你获取了事情发生的概略,而没有陷入微小的细节中。
益处: 这极大地缩小了 AI 需要处理的数据量(例如,从每秒 30 帧减少到仅 1 个“秒级单元”)。这使得任务变得快速且可控。
修复方法: 为了确保 AI 在跳过帧数时不会看起来“跳跃”或断断续续,他们在最后增加了一个“平滑”步骤。这就像是在秒与秒之间连点成线,使动作看起来流畅且连续。
2. “三阶段训练营”
AI 并不是一夜之间学会这些的。作者通过三个特定阶段训练它,就像学生升学一样:
第一阶段:全能观察者 (CPT) AI 被展示各种视频、追踪游戏和物体搜寻任务。它学习基础知识:“这是一个人”、“这是一辆车”、“如何跟随一个移动的物体”。这就像是在教一个孩子识别物体并用眼睛跟随它们。
第二阶段:推理学生 (SFT) 在这里,AI 学习在行动之前先思考 。他们使用了一种“思维链”方法。AI 被要求写下它的推理过程:“我看到一个穿蓝色连帽衫的人。附近有一个穿红色衣服的人,但查询要求的是穿蓝色衣服的那位。动作大约在第 5 秒开始。”
关键技巧: AI 被允许写下它的推理过程,但当涉及到画出物体周围的框时,老师们(研究人员)会用完美的、正确的答案 来替换 AI 的猜测。这教会了 AI 如何进行逻辑思考,而不会因为在学习阶段画图的小失误而受到惩罚。
第三阶段:带着计分板的教练 (RL) 最后,AI 开始独自进行游戏。它做出一个猜测,然后由一个“验证器”(严格的教练)来检查答案。教练不仅仅是说“做得好”,它还会根据两点给出评分:
时间: 你是否选择了正确的开始和结束时间?
空间: 你是否正确地跟随了那个人而没有丢失目标? 如果 AI 做对了,它会获得奖励。如果失败了,它会学习尝试不同的策略。这就像是一个电子游戏,只有当你完美命中目标时才能升级。
3. 为什么这种方法更好
论文表明,这种方法是速度与准确性之间的“甜点位”(平衡点)。
结果: 他们的 AI 实际上规模很小(90 亿参数),但在标准视频测试中击败了规模大得多的、更昂贵的 AI 模型(有些拥有数千亿参数)。
启示: 这不在于拥有最大的大脑,而在于拥有正确的策略 。通过从“帧级”转向“秒级”,并教 AI 在猜测坐标之前进行逻辑推理,他们解决了长视频的问题,而无需超级计算机。
总结
作者构建了一个将长视频视为一系列短摘要而非原始数据流的系统。它教会 AI 去思考 它正在寻找谁以及什么,忽略 多余帧的干扰噪声,并进行练习 ,直到它能够以高精度定位事件的确切时刻和位置。这是让 AI 视频侦探变得更快、更便宜、更聪明的一种切实可行的方法。
技术摘要:通过二级追踪与 RL 验证实现高效的多模态大模型时空定位
1. 问题定义
时空视频定位(Spatio-temporal video grounding, STVG)要求模型在时间(识别事件区间)和空间(在整个区间内追踪所指目标)两个维度上定位自然语言查询。虽然多模态大语言模型(MLLMs)具备强大的推理能力,但直接通过逐帧推理来处理长视频在计算上是极其昂贵的,且表现不稳定。
确定的核心挑战包括:
计算成本: 密集的帧级采样导致视觉 Token 爆炸,使得长视频处理成本极高。
不稳定性: 直接生成密集坐标往往会导致“漂移”现象,即模型会丢失目标身份,或者由于文本生成的框存在微小的数值误差而导致轨迹抖动。
监督失配: 标准的有监督微调(SFT)优化的是 Token 的似然概率,而非任务特定的指标(如时间重叠度或空间轨迹一致性)。
2. 方法论
作者提出了一种实用的流水线,将推理单元从帧 转向秒 ,并结合了三阶段训练策略和强化学习(RL)验证。
A. 二级(Second-Level)表述形式 模型不再处理 T T T 帧,而是将视频转换为 K K K 个秒级单元(K = ⌈ T / F ⌉ K = \lceil T/F \rceil K = ⌈ T / F ⌉ )。
输入: 模型处理按秒聚合的视频单元。
输出: 模型预测一个时间跨度 [ t ^ s , t ^ e ] [\hat{t}_s, \hat{t}_e] [ t ^ s , t ^ e ] 和一条紧凑的轨迹 B ^ \hat{B} B ^ ,其中包含每秒一个边界框。
平滑处理: 在推理过程中应用轻量级的秒间平滑步骤,以恢复连续性并减少抖动,同时保留预测的时间边界。
B. 三阶段训练流水线 该方法使用了一种通过三阶段训练的 GLM-V 式架构。
持续预训练 (CPT):
目标: 构建广泛的时空定位能力。
数据: 混合了 STVG、多目标追踪(MOT)、单目标追踪(SOT)和分割数据。
策略: 以 1 FPS 进行视频采样,以匹配秒级表述形式。同时包含通用的视频描述和问答数据,以防止模型塌陷为单一的坐标预测任务,从而保留通用的对话和推理能力。
带有修正推理的有监督微调 (SFT):
目标: 教导结构化的目标选择和时间推理。
数据: 来自 VidSTG 和 HC-STG 的 20K 个样本。
机制: 使用高级 MLLM(如 Gemini)生成侧重于“追踪什么”以及“事件何时发生”的思维链(CoT)轨迹。
修正: 至关重要的是,最终输出中生成的空间坐标和时间跨度被替换为真实标签(Ground-truth) 。这实现了语义推理与不可靠几何生成的解耦,确保模型学习正确的推理过程,而不受训练数据中几何噪声的影响。
带有验证器的强化学习 (RL):
目标: 直接针对定位质量指标进行优化。
奖励函数: 验证器使用以下各项的加权和对预测进行评分:
tIoU: 时间交并比(预测时间窗口与真实时间窗口的重叠度)。
mvIoU: 运动感知空间 IoU(在匹配的时间交集上,所有框的平均 IoU)。
优化: 使用类 GRPO 的目标函数进行策略优化,并采用非对称剪切。组合奖励($tIoU + mvIoU$)提供了比仅使用运动感知奖励更密集的学习信号,帮助模型先定位正确的事件窗口,再精细化轨迹。
C. 推理 模型输出包含时间跨度和秒级轨迹的结构化答案。无效状态会被丢弃,并应用秒间平滑处理。输出可以保持在秒级粒度,或者根据基准测试的要求插值回帧级框。
3. 核心贡献
秒级追踪表述形式: 从帧级到秒级单元的转变,显著降低了序列长度和视觉 Token 成本,同时通过平滑处理维持了事件结构和追踪连续性。
修正推理监督: 一种利用生成的 CoT 轨迹进行语义推理,但用真实标签替换生成的坐标的训练策略,防止模型从有噪声的几何监督中学习。
验证器驱动的 RL: 使用基于 $tIoU + mvIoU$ 的验证器进行优化阶段,使模型的输出直接与 STVG 评估指标对齐,而非仅仅依赖 Token 似然。
高效高性能模型: 证明了一个 9B 参数的任务对齐模型可以在 STVG 任务上超越规模显著更大的通用型 MLLM(如 397B 的 Qwen3.5)。
4. 实验结果
该方法在 VidSTG 和 HC-STVG 基准测试上进行了评估,并在 Video-MME-v2 上评估了其通用的视频理解能力。
STVG 性能:
在 VidSTG 上,最终的 RL 模型实现了 mtIoU 为 31.35 和 mvIoU 为 23.79 ,超越了包括 397B 和 1T 参数模型在内的所有基线模型。
在 HC-STVG 上,模型实现了 mtIoU 为 60.04 和 mvIoU 为 40.99 ,同样超越了大型通用模型。
从 SFT 到 RL 的演进表明,虽然 SFT 适配了格式,但 RL 显著提升了指标对齐度。组合奖励($tIoU + mvIoU)比单独使用 )比单独使用 )比单独使用 mvIoU$ 收敛更快,且效果更好。
通用视频理解:
在 Video-MME-v2 上的评估显示,该模型在非线性推理(12.6 vs. 9.4)和简单准确率(28.0 vs. 23.7)方面均优于 GLM-4.1V-Thinking 基线,表明训练过程并未以牺牲通用推理能力为代价而过度拟合定位任务。
消融实验:
FPS 敏感度: 使用 1 FPS 进行训练取得了最佳结果,平衡了成本与时间证据。
奖励设计: 时间与运动感知奖励的结合至关重要;仅使用运动感知奖励会导致早期学习信号较弱。
5. 重要性与主张
本文认为,MLLM 在 STVG 任务中的瓶颈不仅在于模型规模,更在于任务的表述形式 和监督信号的设计 。通过将语义推理与几何生成解耦,并通过 RL 直接针对任务指标进行优化,作者证明了较小的专用模型可以比大规模通用模型实现更优越的长视频定位性能。
作者将这项工作定位为解决 MLLM 在 STVG 领域“缺失环节”的实用方案:即如何高效处理长视频,同时生成可用且稳定的时空定位。他们指出,虽然该方法行之有效,但未来的工作可以将这些推理能力扩展到更广泛的任务中,如事件解析和交互式视频智能体,或将该方法应用于实时性和噪声更高的开放世界场景。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。