← 最新论文
💻 computer science

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

本文介绍了 OraRL,这是一个用于视频多模态大语言模型(MLLM)的可扩展强化学习框架,它通过将标注视为解耦优势估计机制中的预言回溯(oracle rollouts)来克服优势反转问题,从而在时空基准测试中实现更优越的性能,并且与现有方法相比具有显著更高的训练效率和更快的推理速度。

原作者: Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:将标注作为展开(OraRL)

问题陈述

统一视频感知要求多模态大语言模型(MLLMs)具备执行细粒度任务的能力,例如时序定位、空间接地(grounding)、目标跟踪和分割。虽然近期的通用型 MLLM 集成了这些能力,但它们的表现往往不及特定任务的专家模型,这表明仅靠模型规模是不够的,后训练阶段的对齐才是关键瓶颈。

目前的后训练范式面临两个主要局限:

  1. 监督微调(SFT): SFT 将标注视为极大似然目标,仅强制执行输出格式,却无法区分“接近正确”与“明显错误”的预测。它缺乏任务层面的监督来引导模型实现精确的区间或掩码。
  2. 基于组相对策略优化(GRPO)的强化学习(RL): 现有的视频强化学习方法(如 GRPO)针对每个提示词采样多个在策略(on-policy)展开(rollouts),并比较它们的奖励。然而,这些方法完全依赖于采样在策略组的质量。由于在策略展开很少能恢复出由真值(GT)标注指定的精确区间、框或掩码,许多训练组缺乏可靠的正向锚点。
  3. 思维链(CoT)的局限性: 虽然 CoT 生成被用于提升推理能力,但它延长了展开过程,增加了训练和推理成本,且无法保证在细粒度感知任务中获得性能增益。

直接尝试将 GT 标注纳入 RL 展开组作为“神谕(oracle)”展开会导致优势反转(advantage inversion)。当一个高奖励的神谕被纳入组归一化时,它会抬高基准奖励。因此,对于那些比原始策略更好(但比神谕差)的在策略展开,其获得的优势值会变为负数,从而抑制了有效的探索,并导致学习向简单的模仿坍缩。

方法论:OraRL

本文引入了 OraRL(Annotation-as-Rollout Reinforcement Learning,将标注作为展开的强化学习),该范式将每条标注视为可靠的正向目标(即“神谕展开”),同时防止导致优势反转的基准偏移问题。

核心机制

  1. 构造“标注即展开”:
    OraRL 不仅仅将标注作为评分参考,而是将每条标注 yy 序列化为模型的响应格式,以创建神谕展开 ogto_{gt}。该神谕被附加到 nn 个在策略展开的组中,形成一个大小为 n+1n+1 的增强组。这为每个查询提供了一个可靠的正向目标,且不会减少在策略探索。

  2. 解耦优势估计:
    为了解决优势反转问题,OraRL 解耦了优势计算:

    • 策略基准: 基准 μop\mu_{op} 和标准差仅通过在策略奖励进行计算,不包含神谕。这确保了任何优于当前策略的在策略展开都能获得非负的优势。
    • 方向性增益: 神谕奖励与在策略分布之间的差距被编码为方向性增益 gqg_q。该增益会缩放那些高于在策略均值的在策略展开的优势,当神谕显著优于当前策略时,会放大信号。
    • 脱离式神谕优势: 为神谕展开计算一个独立的、有界的优势项 AgtA_{gt}。其规模由权重 wqw_q(基于策略与神谕之间的剩余差距)进行校准,并受限于最强的在策略信号,以防止神谕主导更新。
  3. 符号平衡剪枝:
    为了提高效率,OraRL 在反向传播前对展开组进行剪枝。不同于仅基于幅度的剪枝(可能会仅保留正向或仅保留负向样本),OraRL 采用了符号平衡剪枝

    • 始终保留神谕。
    • 其余位置通过保留最强的正向和负向在策略展开来填充,确保梯度更新既保留了增强信号也保留了抑制信号。
    • 应用**后选择矩校正(post-selection moment correction)**来重新中心化优势值并对其进行缩放,使其与剪枝前的统计特性相匹配,从而防止更新幅度产生偏差。
  4. 效率:
    通过剪枝展开组(例如,从 9 个展开中保留 4 个)并避免 CoT 生成,OraRL 的单步耗时仅为 SFT 的 2.2×2.2\times,而带有 CoT 的 GRPO 则为 4.9×4.9\times

核心贡献

  1. 将标注作为展开: 一种与任务无关的机制,可将标注转换为神谕展开,在无需 CoT 或牺牲在策略探索的情况下提供可靠的正向监督。
  2. 优势反转分析: 识别了朴素混合神谕时的“优势反转”现象,并通过解耦优势估计提出了解决方案,实现了策略优势与神谕引导的分离。
  3. 符号平衡剪枝: 一种既能保留优势符号又能保留神谕的剪枝策略,结合矩校正,实现了比全组优化快 1.48×1.48\times 的速度。
  4. Video-ORA: 一个使用 OraRL 训练的统一视频感知模型,在不同模型规模(0.8B 到 9B)和数据预算下均展现出一致的改进。

实验结果

作者训练了 Video-ORA(基于 Qwen3.5 主干网络),并在七个任务族中进行了评估:时序接地、空间接地、分割、视觉跟踪、时空接地、视频问答和空间智能。

  • 性能增益:

    • 时序接地: Video-ORA-9B 在三个 TimeLens 基准测试上分别取得了 61.8、63.6 和 72.5 的 mIoU,超越了时序专家模型 TimeLens2-8B 以及 GPT-5 和 Gemini-3-Pro 等专有模型。
    • 视觉跟踪: 在 GOT-10k 上,Video-ORA-9B 达到了 78.2 的平均重叠度(AO),超过了之前的最佳开源模型 OneThinker-8B 5.2 个百分点。
    • 分割: 在 RefCOCO(cIoU 79.4)和 MeViS(J&F 61.3)上取得了领先成绩。
    • 空间智能: 在 VSI-Bench 上,Video-ORA-9B 得分为 73.1,优于 GPT-5 (55.0) 和 Gemini-3-Pro (55.1)。
    • 视频问答: 在七个视频问答基准测试中,有五个排名第一。
  • 扩展性与效率:

    • 模型扩展: Video-ORA 在所有规模(0.8B, 2B, 4B, 9B)上都优于其主干模型,且宏平均增益随模型规模增大而提升。
    • 数据扩展: 在高达 10 万个提示词的数据预算下,OraRL 的表现优于 GRPO 和 SFT。
    • 推理延迟: 由于不使用 CoT,Video-ORA-9B 将 10 分钟视频的中值端到端延迟从 29.0 秒(CoT 主干)降低到了 24.3 秒。

重要性与主张

论文声称 OraRL 确立了“将标注作为展开”这一高效且可扩展的统一视频感知强化学习原则。作者认为:

  • 视频感知的细粒度精度主要由任务对齐的后训练决定,而非单纯取决于模型规模。
  • 正确处理后的直接神谕集成(通过解耦优势)提供了一个可靠的正向目标,克服了高质量在策略展开稀缺的问题。
  • 对于这些任务,CoT 推理并非必要;直接的神谕监督能带来更高的准确性和效率。
  • 该方法在不同主干系列(Qwen3-VL, Qwen3.5)和不同任务类型(定位、跟踪、问答、空间推理)之间具有通用性。

作者也指出了局限性,具体包括:目前的公式假设标注可以被序列化为有效的神谕展开并由标量奖励进行评估,且尚未评估在模糊或噪声监督下的表现。他们还承认,尽管 Video-ORA 在许多开源对比中处于领先地位,但在某些复杂的空间推理任务上仍落后于最强的专有模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →