想象一下,你正在教机器人执行一项任务,比如往杯子里倒水或接住一个球。传统的方法被称为行为克隆(Behavior Cloning)。这就像一位严厉的老师,在地图上指出一个确切的位置,然后说:“你必须精确地走到这里。”
这种方法的弊端在于,人类并非完美无缺。有时我们会疲惫,手会颤抖,或者只是给出了略微错误的方向。如果机器人将每一条人类指令都视为不可更改的完美法则,它就开始死记硬背我们的错误。它会变得“脆弱”——只要人类犯下微小的错误,机器人就会困惑并失败。这就像一个学生死记硬背了试卷上错误答案的精确坐标,结果因为无法应对任何变化而不及格。
另一方面,有些方法试图通过告诉机器人“这个动作比那个动作好”来教导它。这就像老师说:“往左走比往右走好”,却不说具体要往左走多远。虽然这种方法更灵活,但往往过于模糊。机器人可能会因此漫无目的地徘徊,因为它不知道“好”行为的边界在哪里。
新想法:“安全区”
这篇论文的作者提出了一种折中方案,称为CLIC(基于交互式校正的对比策略学习)。他们不是给机器人一个单点或一个模糊的比较,而是教它寻找一个**“安全区”或目标集合**。
这里的类比是:
- 旧方法(点对点): 老师说:“就站在这个特定的瓷砖上。”如果老师指错了稍微偏一点的瓷砖,机器人就会站在那儿并失败。
- 旧方法(成对比较): 老师说:“站在左侧比站在右侧好。”机器人知道不该站在右侧,但它不知道是应该站在最左侧、中间,还是仅仅稍微偏左。这太宽松了。
- CLIC(集合值): 老师说:“不要站在红色瓷砖上(机器人出错的地方),但你可以站在绿色瓷砖周围这个蓝色圆圈内的任何地方。”
在这种新方法中,当人类纠正机器人时,他们不仅仅是在给出一个新的坐标。他们是在定义一个可接受动作的区域。
- 如果人类将机器人的手臂稍微向左推以纠正错误,机器人会学到:“好的,正确的动作大致在这个方向,不一定精确在你推我的那个位置。”
- 如果人类给出的校正带有噪声或手在颤抖,机器人会理解“安全区”有点模糊,但它仍然知道什么不该做(错误的一侧)以及什么大致是可接受的(该区域)。
实际运作方式
论文通过两种主要方式测试了这一想法:
模拟仿真: 他们在计算机上运行了数千次模拟,任务包括推动 T 形块、拿起罐子或用两只机械臂举起物体。
- 结果: 当人类数据完美时,CLIC 的表现与旧方法一样好。但当人类数据存在噪声、颤抖或不完整时(例如,人类只纠正了双机械臂机器人中的一只手臂),CLIC 仍能正常工作,而旧方法则崩溃或完全失败。
- 原因? 因为 CLIC 没有试图死记硬背那些颤抖的手部动作。它学习的是正确行为的形状。
真实机器人: 他们在真实机器人上测试了这项技术,执行的任务包括:
- 将 T 形物插入 U 形物: 这是一个需要精确移动的复杂拼图。
- 接住球: 这是一个快速、动态的任务,人类很难给出完美的演示,因此他们只是给出快速的方向性轻推。
- 倒水: 这是一项需要精细控制瓶子的任务。
- 结果: 机器人学得更快、更可靠。在接球任务中,机器人从很少接住球,变成了在两次尝试内就能稳定接住球,尽管人类只给出了粗略的方向提示。
关键要点
该论文声称,通过将人类校正视为可能性的区域而非精确目标,机器人会变得更加稳健。它们能够处理人类的错误、颤抖的双手和不完整的指令,而不会感到困惑。
这就好比一个死记硬背单个错误答案的学生,与一个理解正确答案概念的学生之间的区别。CLIC 教给机器人的是概念(“安全区”),而不仅仅是坐标,这使得它在人类参与时成为一个更好的学习者。
以下是论文《从动作标签到集合:重新思考基于纠正反馈的模仿学习中的动作监督》的详细技术总结。
1. 问题陈述
本文解决了**交互式模仿学习(IIL)和行为克隆(BC)**中的一个根本性局限:**点对点监督(pointwise supervision)**的脆弱性。
- 问题所在: 传统的 BC 将人类演示或纠正反馈视为精确的点对点动作目标(a∗)。虽然这种方法在数据完美时有效,但在人类反馈存在噪声、次优或相对性(指示方向但未指示幅度)时会失效。
- 后果: 当使用表达性强的策略类(如基于能量的模型(EBMs)或扩散模型)时,点对点监督会导致策略过拟合到特定且可能带有噪声的标签上。这会在提供的动作周围产生尖锐的局部极小值,将策略引离真正的潜在最优行为。
- 替代方案的局限性:
- 成对偏好学习: 虽然比点对点标签更鲁棒,但成对比较(例如“动作 A 优于动作 B")仅约束了两个动作的相对顺序。在高维连续空间中,这导致动作空间的其余部分基本不受约束,允许策略将高概率分配给次优区域,同时仍满足偏好约束。
- 差距: 需要一种监督目标,它比点对点 BC 更鲁棒(以处理噪声/次优性),但又比成对比较更具信息量(以有效约束动作空间)。
2. 方法论:CLIC
作者提出了CLIC(基于交互式纠正的对比策略学习),这是一个从点对点标签转向**集合值监督(set-valued supervision)**的框架。
核心概念:期望动作集合
CLIC 不再将人类纠正视为单一目标动作,而是将其解释为定义了一个期望动作集合(A^)。该集合包含所有与反馈一致的动作,同时排除已执行的(次优)动作。
- 绝对纠正: 如果人类提供一个新的动作 ah,期望集合是 ah 周围的一个区域(例如,一个球体或多面体)。
- 相对纠正: 如果人类提供一个方向 h 以改进当前动作 ar,期望集合是该方向上的一个锥体或半空间,而不承诺特定的幅度。
关键组件
A. 期望动作集合的构建
本文定义了这些集合的两种具体几何构建方法:
- 多面体集合(CLIC-Half): 通过相交从数据增强中导出的多个“半空间”约束构建。
- 单个纠正 (ar,ah) 被增强为多个对比对 (ai−,ai+)。
- 每一对定义了一个半空间,其中更接近 ai+ 的动作更受青睐。
- 这些半空间的交集形成一个多面体(趋近于锥体)。
- 参数: 方向确定性(α)和幅度确定性(ϵ)控制集合的形状和大小。
- 圆形集合(CLIC-Circular): 专门用于绝对纠正。
- 定义一个以人类动作 ah 为中心、半径与机器人动作和人类动作之间距离成正比的球体。
- 这捕捉了最优动作位于纠正动作邻域内的直觉。
B. 聚合与收敛
- 迭代细化: 单个纠正通常不足以 pinpoint 最优动作。CLIC 在时间上聚合多个纠正。
- 交集: 状态的整体期望动作集合是反馈缓冲区中所有从反馈导出的单个集合的交集(A^Ds=⋂A^i)。
- 收敛: 理论上,随着更多反馈的聚合,这些集合的交集收敛到最优动作集合(As∗),前提是教师对次优动作提供反馈,且集合始终包含至少一个最优动作。
C. 策略塑造目标
为了训练策略 πθ 与这些集合对齐,CLIC 最小化当前策略与目标分布(πtarget)之间的KL 散度:
ℓKL=E[KL(πtarget(⋅∣s)∥πθ(⋅∣s))]
- 目标分布: 通过贝叶斯规则使用观测模型定义。
- 观测模型: 一个软成员函数(sigmoid),为期望集合内的动作分配高概率,为集合外的动作分配低概率。
- 先验: 使用当前策略作为先验(πθ),而不是均匀先验。这产生了一种“策略加权贝叶斯损失”,确保更新是保守且渐进的,防止策略偏离之前学到的行为太远。
- 隐式与显式:
- 隐式(EBM): 损失使用对比采样(InfoNCE 风格)进行优化,其中目标分布根据样本的集合成员资格对其加权。
- 显式(高斯): 对于单峰任务,该方法简化为铰链损失,确保策略均值位于多面体内。
3. 主要贡献
- 集合值监督视角: 提出了一种新颖的公式,其中纠正反馈定义了一个可接受动作的区域,而不是单个点,弥合了点对点 BC 和成对偏好学习之间的差距。
- CLIC 框架: 引入了一种实用算法,构建并聚合这些集合以迭代细化策略。它支持绝对和相对反馈,并通过隐式策略(EBMs)自然地处理多模态行为。
- 理论分析: 提供了收敛条件,表明聚合的集合值反馈可以恢复最优动作集合,即使单个反馈信号是有噪声的或相对的。
- 全面评估: 在仿真和真实机器人(KUKA iiwa)上进行了广泛验证,证明了其在各种反馈类型下的鲁棒性。
4. 实验结果
仿真实验:
- 准确反馈: CLIC 的表现与最先进(SOTA)方法(如 Diffusion Policy, IBC)具有竞争力,证明当数据完美时,集合值监督不会牺牲性能。
- 噪声反馈: CLIC 显著优于基线(IBC, Diffusion Policy, PVP)。虽然点对点 BC 方法会过拟合噪声并无法收敛,但 CLIC 的基于集合的方法吸收了噪声,保持了高成功率。
- 相对与部分反馈:
- 相对纠正: CLIC-Half 和 CLIC-Explicit 成功从方向性反馈中学习,而点对点 BC 方法完全失败(由于“同策略”问题,即过去的纠正变得次优)。
- 部分反馈: 在人类仅纠正一只手臂的多机器人任务中,CLIC-Half 通过仅约束被纠正的维度表现出色,而试图模仿完整(部分次优)动作向量的基线方法则失败。
真实机器人实验:
- Insert-T(多模态): CLIC-Half 在困难任务上达到了80% 的成功率,显著优于 Diffusion Policy(30%)和 IBC(10%)。这突显了 CLIC 处理复杂、多模态决策而不发生过拟合的能力。
- 接球(动态/部分): 成功使用相对和部分反馈学习了高频任务,在两次尝试内达到了 100% 的成功率。
- 倒水(精度): 展示了在训练过程中在绝对纠正和相对纠正之间切换的能力,将策略从粗略控制细化到精细控制。
消融研究:
- 确认了策略加权先验对稳定性至关重要。
- 表明控制集合几何形状的超参数(α,ϵ)必须针对反馈信号的不确定性进行调整。
- 可视化显示,随着集合半径缩小到零,CLIC 退化为过拟合的 IBC,验证了“集合”公式的必要性。
5. 意义与影响
- 对人类错误的鲁棒性: 主要意义在于使模仿学习能够抵御人类教师固有的不完美(疲劳、遥操作限制、认知负荷)。
- 统一框架: CLIC 在单一的数学框架下统一了从绝对演示、相对纠正和部分反馈中学习。
- 扩展到复杂任务: 通过避免表达性强的模型对噪声标签的过拟合,CLIC 使得强大的隐式策略(EBMs)能够在数据很少完美的现实世界交互式设置中使用。
- 实际适用性: 该方法降低了人类教师的认知负荷(他们可以提供粗略的方向而不是精确的轨迹),并加速了复杂机器人任务的学习过程。
总之,CLIC 将模仿学习中的基本监督单元从单点重新思考为集合,为从不完美的人类反馈中学习提供了数学上合理且经验上鲁棒的解决方案。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。