想象一下,你正在教一个机器人完成一项复杂的任务,比如折叠一篮衣物或打一个结,而你只需演示几次即可。这被称为“模仿学习”(imitation learning),就像一名学生观察名厨烹饪并尝试复制其食谱一样。为了让这些机器人的动作平滑且自然,科学家们使用了“动作分块”(action-chunking)技术。与其告诉机器人“手臂向上移动,然后向左,然后抓取”,不如让机器人一次性预测出一整段短促的动作序列,就像舞者在思考时会预先构思好后三步,而不只是下一步。这有助于机器人的动作更加流畅。然而,这里有一个隐患:如果机器人因为一个奇怪的角度或一个滑溜的物体而产生轻微的困惑,它可能会偏离航线。由于它对自己预先规划好的“动作块”过于自信,它可能会在保持动作流畅的同时,直接撞向错误的方向,而无法意识到自己已经不再是在执行训练时的动作了。科学家们面临的大问题是:我们如何阻止机器人“自信地失败”,以及如何在不需要人类全程监督的情况下让它重回正轨?
于是有了 AutoIntervene,这是一个聪明的系统,它扮演着这些机器人的智能副驾驶角色。把机器人想象成一名背熟了特定路线的学生司机。如果学生开始驶入路边的水沟,通常需要人类教练来接管方向盘。但有了 AutoIntervene,汽车内置了一个“安全监控器”,它知道学生何时即将出错,并能适时温柔地接管控制权,同时也能准确判断何时可以将驾驶权还给学生。
该论文将这一系统介绍为一种让机器人学习更加可靠的方法。在现实世界中,它是这样运作的:机器人尝试完成一项任务,比如折叠毛巾或装箱。在移动过程中,AutoInterвоne 会不断检查两件事:“机器人当前的视野看起来是否像它学习过的那些成功案例的图像?”以及“它即将进行的动作是否与它在那些成功案例中看到的动作相似?”如果机器人开始陷入一种情况,即它的动作与任何训练示例都不匹配(例如,试图折叠一条已经以奇怪方式皱缩在一起的毛巾),系统会自动将控制权切换给人类操作员。人类修复这个混乱局面,而机器人则在一旁观察并学习这次纠正。一旦机器人回到一个动作逻辑通顺的“安全区”,系统就会将方向盘还给机器人。
其特别之处在于,这是一个带有记忆的双向过程。当机器人驾驶时,系统仅观察任务当前所在的“邻域”来决定是否安全。但当人类接管以解决问题时,系统则会查看整个成功任务的“地图”,以观察机器人何时准备好重新驾驶。这防止了机器人陷入一种循环:要么在不安全时误以为自己很安全,要么在不需要帮助时却不断请求帮助。
研究人员在两个机器人手臂上,针对九种不同的现实任务对该系统进行了测试,其中包括折叠毛巾、装箱甚至处理电缆等棘手工作。他们发现,使用 AutoIntervene 的机器人只需经过几轮练习就能更好地完成任务,成功率通常超过 80%。至关重要的是,与直接从头开始记录更多完整的演示过程相比,它们对人类帮助的需求量大大降低。事实上,该系统节省了大约 74% 的人工控制时间。此外,它在不同的机器人“大脑”上都能表现良好,证明了其作为一种灵活工具的特性。
该论文反对这样一种观点,即认为机器人应该在感到困惑时仅仅尝试自我修复,或者认为人类应该手动决定每一次接管的时机。相反,它表明一种自动化的、数据驱动的切换方式更快且更准确。研究结果表明,通过让机器人专门从它卡壳的时刻进行学习,而不是仅仅重新学习整个任务,我们可以教导机器人变得更加独立且可靠,从而应对杂乱且不可预测的现实世界。
技术摘要:AutoIntervene
问题陈述
动作分块(Action-chunking)视觉运动策略通过预测短序列的未来动作而非单步指令,提高了模仿学习中的时间一致性。然而,这些策略在部署时的分布偏移(distribution shifts)面前仍然非常脆弱。微小的感知误差、接触丢失或累积的执行漂移,都可能使机器人进入演示数据覆盖较少的状态。一旦处于这些不支持的状态,动作分块策略往往会继续生成与观察到的现实不一致的平滑动作序列,从而导致任务失败,例如抓取对齐错误或子任务转换不完整。现有的方法如 DART 通过注入噪声来提高覆盖率,但缺乏部署时的检测机制来识别不支持的行为或请求纠正控制。此外,标准的交互式模仿学习(如 DAgлог/DAgger)通常会在学习器访问的所有状态下查询专家,这效率低下;而其他运行时监控器则侧重于特定的失败模式(例如轨迹级 OOD 或局部扰动),缺乏用于双向控制转移和针对性数据聚合的统一框架。
方法论:AutoIntervene
AutoIntervene 是一个在线框架,旨在通过在自主策略与人类操作员之间选择性地转移控制权,来提高动作分块策略的部署可靠性。它通过两个主要阶段运行:干预循环(Intervention Loop)和策略自适应(Policy Adaptation)。
1. 干预循环
该循环监控部署中的策略,并基于从成功任务执行中构建的**视觉-动作支持记忆(Visual-Action Support Memory)**来管理控制权。该过程包含三个模块:
- 视觉-动作查询构建: 在每个评估步骤,系统构建一个查询 Qt,结合当前的多视图视觉嵌入(Et)和策略提出的动作块前缀(At)。
- 视觉-动作支持评估: 该查询针对记忆 M 进行评估,以生成两个标量分数:
- 视觉支持分数(sβ,t): 衡量当前观测值与存储的视觉嵌入之间的最小跨视图余弦相似度。
- 动作风险分数(rˉβ,t): 衡量提议动作与存储的动作块之间的归一化欧几里得距离,并在近期评估中取平均值。
- 特定模式检索: 系统采用两种不同的检索范围来处理不同的控制状态:
- 全局支持(操作员控制): 当操作员处于控制状态时,系统从整个记忆中进行检索。这使得策略能够从操作员恢复后的任何有效任务阶段重新获得自主权。
- 相位局部支持(策略控制): 当策略处于控制状态时,系统将检索限制在 J 个最佳匹配轨迹的“前向窗口”内。这可以防止系统错误地将当前状态匹配到视觉相似但在时间上错误的阶段。
- 双向控制权限选择: 控制切换由两个方向分别校准的阈值控制:
- 策略 → 操作员: 如果视觉支持低于阈值或动作风险超过阈值,则触发此切换,表明策略正在进入不支持的状态。
- 操作员 → 策略: 仅在操作员已恢复状态且策略随后的提议在全局范围内持续满足支持标准后触发。
- 校准: 阈值并非手动调优,而是通过在持留的成功专家演示集(Dcal)上计算得分的经验分位数离线推导得出,确保准则针对当前的自适应轮次和检索范围具有特异性。
- 持久性: 切换需要连续的一致决策(Lpol 或 Lop),以防止由于分数的短暂波动而产生振荡。
2. 策略自适应
来自成功展开(rollouts)的干预片段(即操作员控制机器人的时期)被保留为独立的轨迹(ΔD(k))。它们被添加到下一轮的训练集中。新策略通过行为克隆进行训练,数据混合了原始数据和新的干预数据。随后使用更新后的策略编码器重建视觉-动作记忆,并在重新部署前重新校准阈值。这创建了一个选择性的 DAgger 式循环,将监督重点放在学习器诱发的失败状态上。
核心贡献
本文概述了三个主要贡献:
- 双向干预框架: 一个利用相位局部支持来管理策略到操作员转移(检测策略何时失效)以及利用全局支持来管理操作员到策略返回(确保策略能从任何恢复的有效状态重新开始)的系统。
- 特定模式的视觉-动作校准: 一种利用持留的成功演示来自动计算每一轮自适应中独立的干预和恢复阈值的程序,消除了手动调整分数截断值的需求。
- 高效的迭代改进: 实证证据表明,针对性的干预轨迹通过比收集额外的完整演示更少的操作控制时间,支持了策略的迭代改进。
实验结果
作者在 9 个现实世界的双臂操纵任务上评估了 AutoIntervene,包括易变形物体处理(毛巾、袋子)和精密组装(销钉拆卸、装箱)。
- 成功率 vs 基准: 在七项任务的主要基准测试中,AutoItervene 在两轮自适应(R2)后实现了 80.0% 的平均成功率,优于初始策略(30.9%)、人工干预(68.6%)以及收集额外的完整演示(56.0%)。
- 数据效率: 为了达到更高的成功率,AutoIntervene 比收集额外的完整演示所需的操作控制时间减少了约 74%。与手动切换相比,它也减少了操作员时间,因为它能自动终止干预,直到策略重新获得支持,从而避免了在已受支持区域收集“额外尾部”数据。
- 长程任务: 在两个长程任务上,AutoIntervene 展示了经过三轮迭代的持续改进,最终成功率(88% 和 48%)显著高于使用额外完整数据训练的策略(52% 和 28%)。
- 泛化性: 该框架成功地在不同的动作生成头(ACT、Diffusion Policy 和 Flow Matching)之间进行了迁移,无需修改动作头,表明其监控层与策略架构是解耦的。
- 可靠性: 在“带盖箱子装填”任务的受控交接对比中,AutoIntervene 在切入(cut-in)和切出(cut-out)转换方面均实现了完美的召回率和精确度(1.00),且误触发率为 0.00。相比之下,先前的监控器(LazyDAgger, RND-DAgger)存在漏掉失败、过早返回策略控制或高误触发率的问题。消融研究证实,视觉支持和动作风险对于可靠的双向交接都是必要的。
意义与主张
本文声称 AutoIntervene 解决了部署模仿学习策略的一个关键差距:缺乏一种鲁棒、自动的机制来检测策略何时脱离了演示分布,并安全地将控制权交还给人类进行纠正。通过将监控逻辑与动作生成头解耦,并利用双向的、基于支持的切换机制,AutoIntervene 实现了:
- 针对性数据收集: 它将人类监督严格限制在不支持的状态上,使得数据聚合过程比标准的 DAgger 或完整的演示收集更高效。
- 自主恢复: 它允许策略在操作员纠正后立即重新获得控制,前提是状态受到支持,而不是要求操作员完成整个任务。
- 部署可靠性: 它为在现实世界中部署脆弱的动作分块策略(特别是在涉及频繁接触的环境中)提供了一个实用的解决方案,因为在这些环境中,分布偏移是不可避免的。
作者将 AutoIntervene 定位为底层策略架构的补充组件,而非替代品,它是一个增强了模仿学习系统鲁棒性和数据效率的必要部署层组件。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。