← 最新论文
🤖 AI

Bidirectional Tutoring for Developmental Motor Learning in Robots: Co-Developed Interaction Dynamics Support Stable Learning

本文证明,通过在基于自由能原理的发展框架内利用过往经验作为先验约束,双向辅导(即机器人与导师进行动态相互适应)比传统的单向方法能更有效地促进类人机器人的稳定且具泛化性的运动学习。

原作者: Rui Fukushima, Jun Tani

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Rui Fukushima, Jun Tani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教一个蹒跚学步的幼儿如何堆叠积木。

旧方法(单向辅导):
在许多机器人研究人员使用的传统方法中,老师(导师)抓住孩子的手,物理性地移动它的手,使其完美地堆叠积木。孩子是消极被动的;他们只是坐在那里,任由手臂被移动。机器人通过模仿这些被迫的动作来进行学习。问题在于,每当老师移动孩子的手时,动作可能略有不同——有时快,有时慢,有时带有晃动。因为孩子从未尝试过自己移动积木,他们无法建立起强大且一致的“肌肉记忆”。当孩子稍后尝试独自完成时,由于他们看到的模式杂乱无章,他们会感到困惑。

新方法(双向辅导):
本文提出了一种不同的方法,其灵感源自人类婴儿是如何真正学习的。在这里,孩子(机器人)尝试自己堆叠积木。老师密切观察,只有在孩子即将掉落积木或伸手抓错地方时,才会介入进行轻微的纠正。

把它想象成与舞伴共舞

  • 单向: 老师领舞,而机器人就像一个被拖拽着的僵硬的人体模型。
  • 双向: 机器人尝试跳舞。老师感受机器人的节奏。如果机器人踩错了节拍,老师会轻轻引导它们回到节奏中。如果机器人表现良好,老师就让他们继续跳舞。他们在共同“开发”舞步。

研究人员做了什么

团队使用了一个名为 Torobo(一个小型类人机器人)的真实物理机器人,并给了它一个简单的任务:拿起一个红色圆柱体并将其放回中心。他们在 10 个“阶段”(类似于 10 天的不同练习阶段)中进行了测试,每次都会将积木移动到新的位置。

他们进行了两组实验:

  1. 人类导师: 由真人通过物理方式引导机器人。
  2. AI 导师: 一个计算机程序充当老师,利用智能算法来决定何时进行干预。

关键发现

结果在两组实验中都表现得清晰且一致:

  • “共舞”胜出: 通过双向辅导(即机器人尝试移动并获得纠正)学习的机器人变得更擅长这项任务。到最后,它的成功率达到了约 90%
  • “拖拽式”失败: 仅仅由老师移动手臂的机器人(单向)表现挣扎。它在学习过程中陷入停滞,并最终变得更差,成功率仅为 10-26%
  • 需求减少: 随着机器人通过“共舞”方法学习,它对老师的需求越来越少。随着时间的推移,老师施加的力量(或“干预”)越来越小,因为机器人正在逐渐掌握窍门。
  • 一致性至上: “共舞”机器人开发出了一种非常一致、平滑的运动方式。而“拖拽式”机器人则产生了一种混乱、不一致的运动方式,因为它从未需要去调和自己的尝试与老师的纠正之间的关系。

为什么这很重要(根据论文观点)

论文认为,如果机器人想要像人类一样真正学习,它不能仅仅是一个信息的被动接收者。它必须是一个积极的参与者。

机器人的过往尝试起到了“过滤器”或“约束”的作用。当老师进行干预时,他们不仅仅是在灌输新数据;他们是在塑造机器人自身现有的运动。这创造了一种稳定、一致的行为模式,使机器人以后可以依靠这一模式。

简而言之: 你不能仅仅通过移动机器人的肢体来强迫它学习。它必须尝试、失败、得到一次温柔的推动,然后再次尝试。这种来回互动的过程,才是构建一个稳定、智能机器人的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →