← 最新论文
🤖 machine learning

AutoIntervene: Calibrated Intervention for Action-Chunking Imitation Learning Policies

AutoIntervene 是一个在线框架,它通过自动校准阈值,基于视觉-动作一致性来选择性地在策略与人类操作员之间转移控制权,从而增强动作分块模仿学习,以此纠正执行漂移并提高现实世界双臂操作的任务成功率。

原作者: Jinhe Tang, Weiming Zhi

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinhe Tang, Weiming Zhi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人完成一项复杂的任务,比如折叠一篮衣物或打一个结,而你只需演示几次即可。这被称为“模仿学习”(imitation learning),就像一名学生观察名厨烹饪并尝试复制其食谱一样。为了让这些机器人的动作平滑且自然,科学家们使用了“动作分块”(action-chunking)技术。与其告诉机器人“手臂向上移动,然后向左,然后抓取”,不如让机器人一次性预测出一整段短促的动作序列,就像舞者在思考时会预先构思好后三步,而不只是下一步。这有助于机器人的动作更加流畅。然而,这里有一个隐患:如果机器人因为一个奇怪的角度或一个滑溜的物体而产生轻微的困惑,它可能会偏离航线。由于它对自己预先规划好的“动作块”过于自信,它可能会在保持动作流畅的同时,直接撞向错误的方向,而无法意识到自己已经不再是在执行训练时的动作了。科学家们面临的大问题是:我们如何阻止机器人“自信地失败”,以及如何在不需要人类全程监督的情况下让它重回正轨?

于是有了 AutoIntervene,这是一个聪明的系统,它扮演着这些机器人的智能副驾驶角色。把机器人想象成一名背熟了特定路线的学生司机。如果学生开始驶入路边的水沟,通常需要人类教练来接管方向盘。但有了 AutoIntervene,汽车内置了一个“安全监控器”,它知道学生何时即将出错,并能适时温柔地接管控制权,同时也能准确判断何时可以将驾驶权还给学生。

该论文将这一系统介绍为一种让机器人学习更加可靠的方法。在现实世界中,它是这样运作的:机器人尝试完成一项任务,比如折叠毛巾或装箱。在移动过程中,AutoInterвоne 会不断检查两件事:“机器人当前的视野看起来是否像它学习过的那些成功案例的图像?”以及“它即将进行的动作是否与它在那些成功案例中看到的动作相似?”如果机器人开始陷入一种情况,即它的动作与任何训练示例都不匹配(例如,试图折叠一条已经以奇怪方式皱缩在一起的毛巾),系统会自动将控制权切换给人类操作员。人类修复这个混乱局面,而机器人则在一旁观察并学习这次纠正。一旦机器人回到一个动作逻辑通顺的“安全区”,系统就会将方向盘还给机器人。

其特别之处在于,这是一个带有记忆的双向过程。当机器人驾驶时,系统仅观察任务当前所在的“邻域”来决定是否安全。但当人类接管以解决问题时,系统则会查看整个成功任务的“地图”,以观察机器人何时准备好重新驾驶。这防止了机器人陷入一种循环:要么在不安全时误以为自己很安全,要么在不需要帮助时却不断请求帮助。

研究人员在两个机器人手臂上,针对九种不同的现实任务对该系统进行了测试,其中包括折叠毛巾、装箱甚至处理电缆等棘手工作。他们发现,使用 AutoIntervene 的机器人只需经过几轮练习就能更好地完成任务,成功率通常超过 80%。至关重要的是,与直接从头开始记录更多完整的演示过程相比,它们对人类帮助的需求量大大降低。事实上,该系统节省了大约 74% 的人工控制时间。此外,它在不同的机器人“大脑”上都能表现良好,证明了其作为一种灵活工具的特性。

该论文反对这样一种观点,即认为机器人应该在感到困惑时仅仅尝试自我修复,或者认为人类应该手动决定每一次接管的时机。相反,它表明一种自动化的、数据驱动的切换方式更快且更准确。研究结果表明,通过让机器人专门从它卡壳的时刻进行学习,而不是仅仅重新学习整个任务,我们可以教导机器人变得更加独立且可靠,从而应对杂乱且不可预测的现实世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →