← 最新论文
💻 computer science

How Should a Simulation-to-Reality Transfer Budget Be Spent?

本文认为,在从仿真到现实的迁移过程中,将测量预算用于识别特定的系统参数比广泛地随机化动力学更为有效,这表明流水线应当优先测量可识别的参数,并将随机化仅保留给剩余的不确定性。

原作者: Syed Hamzah Rizvi, Yash Vardhan Tomar

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Syed Hamzah Rizvi, Yash Vardhan Tomar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人完美地摆动单摆。你不能直接让机器人在真实的金属手臂上练习,因为那既昂贵又缓慢,还可能损坏设备。所以,你先在视频游戏(模拟器)中进行教学。

但问题在于:视频游戏并不完全等同于现实世界。真实的机器人可能稍微重一点,或者机械臂稍微长一点,而视频游戏里的设定却并非如此。如果你只在游戏中教它,当把它放到真实的机器上时,它可能会失败。这种差异被称为“现实差距”(reality gap)。

为了解决这个问题,工程师有两个主要工具,但它们消耗的是同样的珍贵资源:真实机器人的使用时间。你不能凭空变出更多的现实世界练习时间。因此,你必须决定如何分配你有限的“真实机器人分钟数”。

论文提出了一个问题:你应该把时间花在测量机器人以获取精确数值上,还是应该把时间花在教机器人应对各种各样的“假设”场景上?

两种策略

  1. 系统辨识(“测量者”): 你利用真实机器人的时间来进行测量。你找出了摆锤的精确重量和连杆的精确长度。然后,你更新你的视频游戏,使其匹配这些精确的数字。你的目标是让模拟器成为现实世界的完美孪生体。
  2. 领域随机化(“赌徒”): 你并不试图寻找精确的数字,而是利用真实机器人的时间来证明:在视频游戏中,每次变化的重量和长度都是随机的,以此来训练机器人。你希望机器人能学会一种“超能力”,无论数字如何变化都能应对自如。

实验:受控测试

作者设计了一个聪明的实验。他们没有使用真实的机器人(因为那太耗时),而是创建了一个“隐藏”模拟器作为“现实世界”,以及一个用于机器人训练的“训练”模拟器。他们知道(真实的)数字(质量为 2.0,长度为 1.5),但机器人并不知道。

他们给了机器人固定的“现实世界”练习轮数预算。然后,他们测试了不同的预算分配方式:

  • 选项 A: 花掉所有的轮数去测量隐藏的数字,以获得一个单一且精确的估计值。
  • 选项 B: 先花一些轮数进行测量,然后在该估计值周围的一个广泛范围内训练机器人。
  • 选项 C: 不花任何轮数进行测量,直接在一个巨大的随机范围内进行训练(希望真相就在其中某个地方)。

出人意料的结果

研究发现,测量几乎总是比猜测更好。

以下是使用简单类比进行的分析:

  • “测量者”获胜: 即使只有极少量的测量(仅仅 5 到 10 次练习轮数),也填补了游戏与现实之间的大部分差距。一旦机器人知道了大概的重量和长度,它的表现就会非常出色。
  • “赌徒”落败: 一旦机器人拥有了任何真实的观测数据,试图教它处理广泛的随机重量反而会让它的表现变差。这就像是在教一名驾驶员去应对世界上所有可能的汽车,而实际上他只需要学会如何驾驶他自己的那辆车。
  • “完美范围”的迷思: 即使作者创建了一个保证包含真实重量和长度的随机化范围,其效果仍然不如直接测量机器人。一个被训练成能处理“一切情况”的策略,最终在处理“任何特定情况”时都显得平庸。

核心结论

如果你在真实硬件上的测试时间有限,请先花时间测量你机器人的具体细节。

不要试图把机器人培养成一个能够应对任何随机变化的通才。相反,利用你的现实世界时间来获得对你机器人实际物理特性的最佳估计,然后让你的模拟器去匹配这个特定的估计值。

注意事项(局限性):
作者谨慎地指出,这一建议在机器人的物理特性是“可辨识的”(即:只要你拿到了正确的数字,模拟器就能够完美呈现真实机器人)时效果最好。如果真实的机器人有奇怪的、无法建模的问题(比如粘滞摩擦力或模拟器无法表示的损坏齿轮),那么这条规则可能会发生变化。但在处理标准的、表现良好的机器人时,先测量,后随机化。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →