← 最新论文
🤖 machine learning

Trajectory First: A Curriculum for Discovering Diverse Policies

本文提出“轨迹优先”(Trajectory First),这是一种两阶段课程学习框架,它利用基于样条的轨迹先验来生成多样化的高奖励行为,随后将这些行为蒸馏为反应式策略,从而克服现有用于机器人操作等复杂任务的约束多样性强化学习方法中存在的探索受限和行为多样性不足的问题。

原作者: Cornelius V. Braun, Sayantan Auddy, Marc Toussaint

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Cornelius V. Braun, Sayantan Auddy, Marc Toussaint

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人把一只沉重的箱子推过房间。大多数标准的机器人训练师会教机器人找到一种完美的方法来完成它:“从左边推,向前滑动,搞定。”如果地板变滑了或者箱子移位了,这种单一的策略可能会失败,机器人就会卡住。

这篇论文认为,一个聪明的机器人应该学会多种不同的方法来解决同一个问题。也许一种策略是从左边推,另一种是从右边推,第三种则是把它抬起来搬运。拥有一个策略“工具箱”会让机器人更加稳健。

然而,教机器人保持多样性是极其困难的。如果你只是告诉机器人“要与众不同”,它往往会感到困惑。它可能会通过在空中挥舞手臂来试图变得不同(这确实不同但毫无用处),或者它可能会在试图寻找新方法时陷入困境,甚至意外撞到其他东西。

作者提出了一种名为“轨迹优先”(Trajectory First)的新训练方法。这就像一位大厨培训新学徒时的两步课程。

第一步:“飞行模拟器”阶段(探索)

作者并没有立即教机器人一步步地做出反应,而是首先将机器人带出“现实世界”,将其放入一个飞行模拟器中,让它能够一次性规划整个动作。

  • 类比:想象你试图在一个巨大、迷雾笼罩的迷宫中找到最佳路线。如果你只是像往常一样一步接一步地走并四处张望,你可能会被困死胡同里。
  • 论文的技巧:作者使用了一种名为B 样条的数学工具。把这想象成在迷宫中画一根平滑、灵活的导线。机器人不是一步步移动,而是仅仅调整这根导线的形状。
  • 目标:他们使用一种“搜索引擎”(一种进化策略)来扭动这些导线,直到找到许多不同的路径,这些路径都能成功地将机器人带到目标点。他们此时并不寻找完美的路径;他们只想要一大堆不同的成功路径。
  • 为何有效:因为他们是一次性移动整根“导线”,机器人可以瞬间从迷宫的一边跳到另一边,发现那些步步为营的机器人永远无法找到的路线,因为后者会因为害怕迈出第一步而止步不前。

第二步:“现实世界”阶段(蒸馏)

现在,机器人已经拥有了一个由成功的、多样化的“导线”(轨迹)组成的库,是时候教它如何在现实生活中驾驶了。

  • 类比:你利用所有那些完美的飞行模拟器路线,教学徒如何反应式地驾驶汽车。学徒学会了:“如果我看到左边有墙,我就向右转。如果我看到右边有墙,我就向左转。”
  • 挑战:通常,当你从模拟器切换到现实生活时,机器人会忘记它的多样性,退回到只有一种安全、枯燥的做事方式。
  • 论文的解决方案:他们引入了三种“稳定器”来保持机器人的多样性:
    1. 对称采样:他们将旧的模拟器数据与新现实世界数据按 50/50 的比例混合。这就像告诉学徒:“记住我们在模拟器中发现的那些酷路线吗?在学习新道路的同时,继续练习这些路线。”
    2. “迄今为止最佳”技巧:他们不断更新“成功”的定义。与其说“你必须完美”,不如说“你必须至少达到我们迄今为止所见到的最好水平”。这防止了机器人过早变得过于贪婪,从而扼杀其自身的多样性。
    3. 快速更新:他们让机器人以比平时快得多的速度从错误中学习。由于“多样性”的定义随着机器人的学习而变化,机器人需要快速更新其“大脑”以跟上不断变化的目标。

结果

作者在必须推方块、按按钮和穿越迷宫的机器人上测试了这种方法。

  • 旧方法:机器人找到了一两种完成任务的方法,通常被困在同一个“局部最优解”(即同一个安全但枯燥的解决方案)中。
  • 新方法:机器人发现了各种各样富有创意的解决方案。对于按按钮的任务,有些机器人用手肘,有些用手腕,还有些用整个身体去按按钮。它们都完成了工作,但方式截然不同。

总结

该论文声称,要让机器人真正具备多样性和稳健性,你不能在它一步步学习时仅仅要求它“与众不同”。你首先需要让它在安全、灵活的空间中构想出许多不同的成功计划(即“轨迹优先”阶段),然后仔细教导它如何在现实世界中执行这些计划,同时不丧失其创造力。

这种方法解决了机器人陷入局部循环的问题,并确保它们拥有一个丰富的策略“工具箱”,以应对环境中意想不到的变化。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →