← 最新论文
💻 computer science

SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation

该论文介绍了 SeeQ,这是一个通过自回归地预测自然语言形式的活跃子任务来训练通用价值函数的框架,旨在克服长时程信用分配问题,并利用离线数据提升在复杂、长时程机器人操控任务中的策略引导能力。

原作者: Saksham Singh, Zheyuan Hu, Max Sobol Mark, Jeffrey Yu, Zackory Erickson, Aviral Kumar

发布于 2026-09-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Saksham Singh, Zheyuan Hu, Max Sobol Mark, Jeffrey Yu, Zackory Erickson, Aviral Kumar

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:SeeQ:为长程机器人操控训练通用价值函数

问题陈述

通用机器人策略(通常通过模仿学习进行训练)在处理复杂的长程操控任务时表现挣扎。这些任务通常涉及多个阶段,或者需要在特定阶段进行重复尝试和深思熟虑才能成功。在这种设定下,误差会随时间累积,且恢复行为在专家数据集中代表性不足。虽然 Q 值函数提供了一种通过对候选动作进行排序来引导策略的机制,但为长程任务学习 Q 函数仍面临挑战。标准方法主要面临三个障碍:

  1. 长信用分配时界(Long Credit-Assignment Horizons): 从稀疏的任务级奖励(任务结束时的成功/失败)中学习需要将信号传播到长序列中,这导致了困难的贝尔曼回溯(Bellman backups)。
  2. 数据覆盖范围: 离线数据集通常缺乏对长轨迹中遇到的多样化状态-动作对的充分覆盖,使得时序差分(TD)学习变得不可靠。
  3. 脆弱性: 如果缺乏有效的价值学习,策略无法区分哪些动作是在取得进展,哪些动作会导致失败,尤其是在对精度要求高或多阶段的任务中。

现有方法要么避免 TD 学习(使用蒙特卡洛回报,这限制了超越数据分布的策略改进),要么依赖于全任务时界的 TD 学习,而后者会受到误差累积的影响。

方法论:SeeQ(子任务启发式 Q 函数)

作者提出了 SeeQ,一个用于训练通用 Q 值函数的框架,该框架通过专注于当前活跃的子任务而非整个任务,从而缩短了学习时界。

核心架构与训练

SeeQ 利用预训练的视觉语言模型(VLM)骨干网络(具体为 3B 参数的 PaliGemma 模型),并引入了一个两阶段训练过程:

  1. 通用预训练: 模型在包含子任务标注的多样化开源机器人操控数据集(如 RoboCOIN)上进行预训练。这一阶段使模型能够正则化其对任务进度和动作条件的理解,并跨越各种具身形态。
  2. 下游微调: 模型在特定的目标任务上进行微调。

关键技术创新

  • 子任务级价值预测: Q 函数并不预测返回最终任务完成的收益,而是估计当前活跃子任务 (l~t\tilde{l}_t) 的预期收益。这降低了预测时界,使 TD 学习更加稳定且有效。
  • 自回归子任务解码: 为了消除在测试时需要人工标注或外部子任务预测器的需求,Q 函数架构被修改为在估计价值之前,以自然语言自回归地预测活跃子任务
    • 在训练期间,模型通过对真实子任务标注进行下一个 token 预测损失进行监督。
      \quad * 在推理期间,模型根据当前状态和任务指令生成子任务文本 (l^t\hat{l}_t),然后基于生成的文本进行价值预测。
  • TD-BoN(带有 Best-of-N 的时序差分)学习: 训练目标结合了子任务级 TD 学习和“Best-of-N”回溯策略。
    • 从基础策略 (πbase\pi_{base}) 中采样候选动作块(action chunks)。
    • 目标值使用 NN 个候选动作中估计价值最高的那个动作块来计算。
    • 这种方法使训练回溯与测试时的转向程序保持一致,并允许 Q 函数评估比数据集中观察到的更好的动作。
  • 不跨越边界进行 Bootstrapping: TD 目标不会跨越子任务边界进行 bootstrapping。如果一个子任务在动作块时界内结束,则回溯项将被清零,从而确保价值函数严格反映当前子任务的进度。

总损失函数结合了子任务价值的 TD 损失和子任务文本的下一个 token 预测损失:
LSeeQ(θ)=LTD(θ)+λsubtaskLsubtask(θ) \mathcal{L}_{SeeQ}(\theta) = \mathcal{L}_{TD}(\theta) + \lambda_{subtask}\mathcal{L}_{subtask}(\theta)

测试时推理

在部署时,SeeQ 通过 Best-of-N 选择来引导基础策略 (πbase\pi_{base}):

  1. 给定状态 sts_t 和任务指令 ll,模型自回归地预测活跃子任务 l^t\hat{l}_t
  2. 基础策略提出 NN 个候选动作块。
  3. Q 函数在以 sts_tll 和预测的 l^t\hat{l}_t 为条件的情况下,为每个动作块评分。
  4. 执行得分最高的动作块。

核心贡献

  1. 子任务级公式化: 本文引入了一种方法,将长程价值学习重新构建为短程、子任务级的学习,有效地规避了长时界下稀疏奖励带来的挑战。
  2. 语言调节的子任务推理: 一种新颖的架构,它能显式地用自然语言预测活跃子任务,从而无需在测试时使用模块化的子任务预测系统或人工标注。
  3. 通用预训练策略: 证明了在多样化机器人数据上对 VLM 骨干进行预训练对于学习鲁棒的动作调节以及减少下游微调期间对特定图像特征的过拟合至关重要。
  4. 实证验证: 在两个机器人平台上,针对四个涉及变形物体、精确对齐和多阶段协作的真实世界双臂操控任务(挂衣服、封盖、装杂货、拆乐高)进行了广泛评估。

结果

作者在涉及变形物体、精确对齐和多阶段协作的四个真实任务上评估了 SeeQ。

  • 策略转向性能: SeeQ 显著提高了基础策略在所有任务中的成功率。
    • 挂衣服 (Shirt-hang): 从 10/24 (41.7%) 提高到 22/24 (91.7%)。
    • 封盖 (Lid-sealing): 从 10/24 (41.7%) 提高到 15/24 (62.5%)。
    • 装杂货 (Grocery-packing): 从 9/24 (37.5%) 提高到 17/24 (70.8%)。
    • 拆乐高 (Lego-disassembly): 从 5/24 (20.8%) 提高到 10/24 (41.7%)。
    • 总体而言,平均成功率从 35.4% 提高到 66.7%(提升了 1.88 倍)。
  • 消融实验:
    • 预训练: 去除机器人数据预训练会导致性能大幅下降(在挂衣服任务中从 22/24 降至 8/24),凸显了多样化数据对于泛化能力的必要性。
    • 子任务调节: 显式解码并基于子任务进行调节至关重要。移除子任务预测会导致性能低于基础策略(8/24),而仅添加预测而不进行调节则将其提升至 15/24。完整的 SeeQ 达到了 22/24。
    • 与基准对比: SeeQ 优于任务级蒙特卡洛回归、任务级 TD 学习以及子任务级 SARSA(后者使用数据集中的动作进行回溯,而非 Best-of-N 采样)。

意义与主张

本文主张,在训练通用 Q 函数时,子任务级价值提供了一个比稀疏的长程成功信号更有效的学习目标。通过利用操控任务分解为中间里程碑的特性,SeeQ 实现了有效的 TD 学习,而不会产生长时界通常伴随的误差累积问题。

作者强调,其方法允许进行通用价值学习,只要任务可以分解为子任务,即可在极少微调的情况下应用于新任务。使用语言来预测子任务,使价值估计与 VLM 的文本生成能力相契合,从而提高了在子任务转换附近的鲁棒性。

这项工作表明,将短时界学习目标语言结构化推理相结合,是实现更鲁棒的长程机器人操控的一条可行路径,特别是在利用大规模多样化机器人数据进行预训练时。作者承认了一些局限性,例如子任务边界的模糊性以及对基础策略候选动作质量的依赖,但认为其框架为使价值函数在复杂的现实世界机器人应用中变得实用迈出了重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →