← 最新论文
🤖 machine learning

Position: RL Researchers Need to Distinguish Between Solving Simulators and Using Simulators as a Proxy

本文认为,强化学习研究人员必须明确区分“解决模拟器问题”与“将模拟器作为现实世界部署的代理”这两个本质不同的目标,因为混淆这些目标会导致不当的算法选择、误导性的评估指标以及错误的结论。

原作者: Matthew Vandergrift, Esraa Elelimy, Martha White

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Matthew Vandergrift, Esraa Elelimy, Martha White

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位正在训练新运动员的教练。你有两个截然不同的目标,但你使用的是同一个训练设施(模拟器)。这篇论文指出,强化学习(RL)领域的研究人员经常混淆这两个目标,从而导致了错误的建议和徒劳的努力。

以下是这两个不同的“训练营”的详细拆解,以及为什么混淆它们会产生问题。

两个不同的目标

1. “电子游戏冠军”目标(解决模拟器)

  • 目标: 你想要为特定的电子游戏或模拟程序找到最顶尖的玩家。你并不关心现实世界;你只想要在游戏中获得最高分。
  • “作弊码”: 由于这是一个电子游戏,你可以做一些在现实生活中不可能做到的事情。你可以暂停游戏、回溯时间、将角色重置到特定位置以尝试不同的动作,或者同时运行 100 个游戏副本以加快学习速度。
  • 衡量标准: 你只关心最终得分。如果一名玩家在第 100 次尝试时才打出了完美的一局,尽管之前失败了 99 次,那也是一次成功。你可以丢弃所有糟糕的尝试,只保留最好的那一个。

2. “现实世界驾驶员”目标(将模拟器作为代理)

  • 目标: 你正在训练一个机器人或 AI 来驾驶汽车或管理发电厂,以便在现实世界中运行。模拟器只是一个让你在真正上路前进行练习的安全场所。
  • 约束条件: 在现实世界中,你不能回溯时间,你不能生成 100 个汽车副本,你也无法重置一次碰撞。每一次错误都会造成金钱、时间或安全上的损失。
  • 衡量标准: 你关心的是他们在学习过程中的表现如何。如果机器人在学习过程中撞车了 99 次,那么这 99 次撞车是真实发生的,并且产生了实际的成本。你不能删除那些糟糕的日子。

问题所在:混淆规则

论文声称,研究人员经常使用“电子游戏冠军”的技巧来训练“现实世界驾驶员”,这造成了一种虚假的安全感。以下是四种具体出错的方式,并附带类比说明:

1. “平行宇宙”陷阱

  • 技巧: 在电子游戏目标中,研究人员会同时运行 1,000 个游戏副本以实现超快速学习。
  • 现实检查: 在现实世界中,你只有一辆车。如果你用 1,000 辆车来训练 AI,它在模拟器中会学得飞快。但当你把它放到单辆汽车中时,它会突然变得非常缓慢且困惑,因为它从未学会如何处理“一次只能有一辆车”的现实情况。
  • 结果: 研究人员认为他们拥有一个超级快速的算法,但当应用到单个现实环境时,它却失效了。

2. “回溯按钮”问题

  • 技巧: 在电子游戏目标中,如果智能体被卡住了,研究人员会按下“重置”键,将其送回特定位置重新尝试。这有助于它快速学习困难关卡。
  • 现实检查: 在现实世界中,你不能按重置键。如果机器人从桌子上掉下来,它就坏了。如果你训练的智能体依赖于在遇到困难时按下“重置”来学习,那么它在现实世界中将毫无用处,因为它从未学会如何在不依赖重置的情况下自行从错误中恢复。
  • 结果: 研究人员要么因为没有使用“重置”按钮而错失了寻找电子游戏中最优解的机会,要么创造了过于依赖重置而无法在现实中工作的智能体。

3. “重试”预算

  • 技巧: 在调整设置(超参数)时,研究人员可能会尝试 50 种不同的设置。如果其中 49 种失败了,他们只需删除那 49 次尝试,只保留成功的那一次。
  • 现实检查: 在现实世界中,你无法删除失败实验的成本。如果你在真实的发电厂上尝试了 49 种错误的设置,你可能会浪费数百万美元或导致停电。
  • 结果: 研究人员挑选出的算法看起来很棒,是因为他们通过“丢弃失败”进行了“作弊”。当这些算法用于现实世界时,由于它们没有学会处理错误的代价,因此会失败。

4. “练习 vs. 表现”评分

  • 技巧: 研究人员经常在智能体运行几分钟后停止它,并在其“冻结”状态下(不进行学习,仅进行表现)进行测试,以观察其水平。这通常会得到一个很高的分数。
  • 现实检查: 在现实世界中,智能体在工作时始终处于学习状态并会犯错。它无法暂停并展示一个“完美版本”的自己。
  • 结果: 一篇论文可能会展示一张图表,显示智能体表现惊人(“冻结”分数),但实际上,该智能体在运行过程中可能步履蹒跚、表现糟糕(“学习”分数)。

行动呼吁

作者要求研究界停止假装这两个目标是相同的。

  • 如果你是在解决模拟器问题: 请保持诚实!说:“我们正试图在这个特定的游戏中打破高分纪录。” 使用所有的作弊码(平行世界、重置)来获得最佳结果。
  • 如果你是在为现实世界做准备: 请保持诚实!说:“我们正在使用这个模拟器来为现实世界做准备。” 不要使用作弊码。训练智能体去应对错误,不要运行 1,000 个副本,并且要衡量它在学习过程中的表现,而不仅仅是最终结果。

简而言之: 不要用玩电子游戏的规则来训练驾驶员,然后期望他们在现实的交通堵塞中生存下来。这篇论文要求研究人员明确说明他们正在玩哪种“游戏”,以免我们被无法转化到现实世界的成果所误导。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →