← 最新论文
🤖 machine learning

Human-like autonomy emerges from self-play and a pinch of human data

本文提出了一种结合了自我博弈强化学习与极少量人类演示数据(仅30分钟)作为正则化目标的混合训练方法,从而能够高效地创建既安全又自然符合人类行为的自动驾驶策略,且无需大规模人类数据集或脆弱的奖励工程。

原作者: Daphne Cornelisse, Julian Hunt, Zixu Zhang, Waël Doulazmi, Kevin Joseph, Jaime Fernández Fisac, Eugene Vinitsky

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Daphne Cornelisse, Julian Hunt, Zixu Zhang, Waël Doulazmi, Kevin Joseph, Jaime Fernández Fisac, Eugene Vinitsky

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和创意类比对该论文进行的解释。

核心理念:“加了调料”的自我博弈("Spiced" Self-Play)

想象一下,你正在尝试教一个机器人如何开车。你有两种主要选择:

  1. “人类复刻”法(模仿学习): 你给机器人看成千上万小时的人类驾驶视频,并对它说:“完全照着他们做。”这种方法有效,但成本高、速度慢,且需要海量的数据。
  2. “自我博弈”法: 你把机器人放入一个视频游戏模拟器中,让它与自己的副本进行对抗。它通过试错来学习。这种方法既快又便宜,但有一个问题:机器人可能会根据自己奇特的逻辑学会开得“完美”,但其方式可能与人类完全脱节。例如,它可能会学会倒着开车,或者为了效率而切断其他车辆的路径——这对机器人来说很高效,但对人类乘客来说却极其恐怖。

论文的解决方案:
作者意识到,纯粹的自我博弈会创造出“外星人”般的司机,而纯粹的模仿学习又太依赖数据。他们的解决方案是**“加了调料的自我博弈”(Spiced Self-Play)**。

把训练机器人的过程想象成在熬一锅巨大的炖菜:

  • 底汤(自我博弈): 主要成分是机器人与自己对抗,模拟了长达60年的驾驶时间。这给了它“肌肉记忆”以及处理复杂交通的能力。
  • 那一抹调料(人类数据): 他们并没有加入整锅的人类数据,而是只加入了一小撮——30分钟的人类驾驶日志。

这一小撮人类数据起到了“风味锚点”的作用。它阻止了机器人漂移到那些奇怪、怪异的策略中去。它并不教机器人所有的事情,它只是引导机器人表现得更像人类驾驶员那样自然。

它是如何运作的(食谱)

  1. 锚点: 首先,他们提取少量的人类驾驶数据(仅30分钟),并训练一个简单的“锚点”策略。你可以把它想象成一个“优秀的驾驶指南”,它了解基本的道路社交规则。
  2. 游戏: 然后,他们使用自我博弈来训练主机器人。机器人在模拟器中与自己进行数百万次的对战。
  3. 调料: 在训练过程中,他们加入了一条“正则化”规则。这条规则规定:“你可以学习任何能让你在游戏中获胜的策略,但你必须保持与我们的‘优秀驾驶指南’的行为接近。”

如果机器人试图学习一种奇怪的策略(比如为了节省时间而开上人行道),“调料”就会对其进行惩罚,并将其拉回到类人行为的轨道上。

结果:为什么这很重要

论文将他们的“加了调料”的方法与另外两种方法进行了对比:

  • 纯自我博弈: 机器人效率很高,但开得像个外星人(激进、路径诡异)。
  • 纯模仿学习 (SMART): 机器人试图完美模仿人类,但它需要52天的人类数据才能达到良好的效果。

“加了调料”的胜出者:

  • 数据效率: 它仅使用了30分钟的人类数据。这比表现最好的模仿学习方法节省了2500倍的数据。
  • 安全性: 机器人不仅驾驶安全,而且驾驶得很有“社交感”。它会在路口耐心等待,并保持安全距离,就像人类一样。
  • 速度: 整个过程是在一台标准的消费级显卡(就是你家里那种类型的电脑)上,仅用15小时就完成了训练。

核心要点

  • 你不需要一个人类数据的图书馆。 你只需要一小撮“调料”来引导机器人的方向。
  • 自我博弈非常强大。 让机器人在模拟器中进行60年的自我对抗,可以建立惊人的技能。
  • 两者的结合是神奇的。 自我博弈提供了技能;而那一点点人类数据提供了“常识”和社会规范。

简而言之,作者发现,你不需要喂给机器人一辈子的驾驶视频才能让它成为一名好司机。你只需要让它练习很长时间,并给它一点点人类行为的“味道”,让它不至于走偏。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →