← 最新论文
🤖 machine learning

Intrinsic Robot Rewarding: Reusing VLA Representations for Autonomous Evaluation and Policy Improvement

本文提出了内在机器人奖励(Intrinsic Robot Rewarding, IRR),该方法利用现有的视觉-语言-动作(VLA)表示和成功的演示端点,在不需要单独评估器或额外感知主干网络的情况下,自主评估机器人结果并引导策略改进。

原作者: Tobias Schaffer, Mohab Elkhayat, Daniela Nicklas, Mustafa Almohamad, Elham Al-Fuqara

发布于 2026-09-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Tobias Schaffer, Mohab Elkhayat, Daniela Nicklas, Mustafa Almohamad, Elham Al-Fuqara

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:内在机器人奖励 (Intrinsic Robot Rewarding, IRR)

问题陈述

视觉-语言-动作 (VLA) 模型(如 OpenVLA)通过将视觉观测和语言指令连接到动作,为机器人操控奠定了基础。然而,将这些策略适配到新的工业任务通常需要外部奖励信号来促进通过经验进行的学习(例如,通过强化学习)。目前的方法通常依赖于:

  • 专门的奖励基础模型或独立的视觉-语言评估器。
  • 额外的感知骨干网络。
  • 大量用于生成奖励信号的结果人类标注。

这种分离增加了集成工作量、计算开销以及循环的人类监督成本。本文认为,VLA 流水线中现有的资源——特别是冻结的视觉编码器以及用于模仿学习的成功演示端点——在评估机器人性能方面尚未得到充分利用。核心问题在于如何利用这些现有的内部表示来生成用于策略改进的内在奖励,而不引入新的模型或显著的外部监督。

方法论:内在机器人奖励 (IRR)

IRR 提出了一个框架,使机器人能够使用其用于动作生成的相同感知资源来评估自身结果。该方法由四个主要部分组成:

1. 任务条件参考库

IRR 并非训练单独的奖励模型,而是从已为模仿学习收集的成功演示端点中构建一个参考库 (Zg+Z^+_g)。

  • 特征提取: 利用 VLA 的冻结检查点视觉编码器 (ϕ\phi) 从摄像机观测 (oto_t) 中提取特征向量 (ztz_t)。
  • 参考库构建: 成功的演示轨迹 (τi\tau_i) 提供了一组代表有效任务结果的参考嵌入。该库可以容纳多个有效结果(例如,不同的物体姿态),而不是强制要求单一的视觉原型。

2. 基于相似度的评分

机器人的新尝试根据其与参考库的相似度进行评分。

  • 距离度量: 系统计算当前观测的嵌入与其在参考库中的 kk-最近邻之间的平均平方欧几里得距离 (dgd_g)。
  • 评分函数: 使用受任务特定温度参数 (τg\tau_g) 控制的指数衰减函数导出得分 (sgs_g)。
  • 持久性: 为了避免瞬时视觉匹配,持久性得分 (sgperss^{pers}_g) 会在尝试后的一个短观测窗口内取最小得分。
  • 奖励信号: 最终的内在奖励 (rTIRRr^{IRR}_T) 是一个基于持久性得分的二值或缩放值,应用于回合的终止时间步。

3. 通过残差强化学习进行策略改进

该框架将 IRR 与残差强化学习 (RL) 控制器相结合。

  • 架构: 基础策略 (π0\pi_0) 是经过模仿学习训练的 VLA。残差策略 (πθ\pi_\theta) 学习根据 IRR 反馈输出笛卡尔修正量 (δat\delta a_t)。
  • 执行: 最终动作是基础策略动作与残差修正量的有界之和。这使得系统可以在不立即重新训练整个 VLA 骨干网络的情况下学习改进。
  • 学习算法: 提出使用离策 (off-policy) 演员-评论家方法(如 Soft Actor-Critic)来处理随机学习机制。

4. 校准与验证

  • 仅正向 vs. 已校准: 系统可以运行在“仅正向”模式下(仅使用成功演示来构建库)或“已校准”模式下(使用一小组带标签的失败案例来调整决策阈值或训练小型奖励头)。
  • 独立审计: 为了确保可靠性,用于评估的成功/失败标签由人类评估员通过查看同步视频生成,该过程与奖励生成过程是分离的。

核心贡献

本文概述了以下具体贡献:

  1. 资源复用: 一种设计,旨在重新利用 VLA 现有的冻结视觉编码器和演示数据来进行动作执行和结果评估,从而消除了对单独奖励模型或额外感知骨干网络的需求。
  2. 奖励公式化: 一种基于与成功端点参考库相似度的任务条件奖励生成的具体数学公式。
  3. TRL 4 演示器: 展示了一个操作性的实验室基础,使用 COMAU Racer 3 工业臂、Robotiq Hand-E 夹持器和 OpenVLA-7B,目前在“方块入盒”任务上实现了 56% 的任务成功率。
  4. 研究框架: 一套结构化的研究问题 (RQs) 和评估指标,用于评估表示复用、物理策略改进以及效率提升的效果。

当前结果与实验基础

本文并未报告 IRR 学习循环的最终结果,因为拟议的研究重点是将奖励公式化与物理策略改进联系起来。然而,它提供了一个经过验证的基准:

  • 系统: 一个带有第三人称摄像机和 ROS 控制栈的 COMAU Racer 3 机械臂。
  • 基准性能: 在一项包含 50 次物理试验(将绿色方块放入容器)的研究中,经过模仿学习训练的 OpenVLA-7B 策略实现了 56% 的成功率(50 次试验中的 28 次)。
  • 失败分析: 主要失败模式(22 次失败中的 8 次)是末端执行器未能对准物体中心,这为残差 RL 修正指明了特定的目标。
  • 数据可用性: 提供 245 个演示回合用于构建参考库。

意义与主张

本文将 IRR 定位为实现工业机器人自我评估和自我改进的一条切实路径。其意义围绕三个维度展开:

  1. 降低集成难度: 通过复用现有的 VLA 编码器和演示数据,该方法避免了训练和维护单独的奖励基础模型或额外感知骨干网络的复杂性。
  2. 提高监督效率: 其目标是减少学习阶段进行结果评分所需的循环性人力投入,因为系统可以根据内部表示自主评估成功与否。
  3. 可扩展性: 该方法提供了一种通过使用新的成功演示来更新参考库,从而轻松适应新任务(新零件、夹具或条件)的机制,而无需重新训练核心感知模型。

作者保持了审慎的态度,承认虽然理论基础和 TRL 4 演示器已经建立,但关键的下一步是实证验证这种内在奖励信号是否能有效地驱动物理策略的改进,以及内部评估的可靠性是否与独立的人类审计相匹配。这项工作是一篇立场论文和研究方向的提议,而非对已完全解决问题的报告。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →