← 最新论文
🤖 machine learning

REVERSAL-BENCH: A Reversibility Axis and Reset Oracle for Measuring the Reset-Free RL Cliff

本文介绍了 REVERSAL-BENCH,这是一个证明了自主强化学习智能体面临着剧烈的“无重置悬崖”的基准测试,即随着环境不可逆性的增加,智能体会陷入永久且无法恢复的状态,这与依赖外部重置的阶段性智能体不同。

原作者: Riyaaz Shaik, Chandru Venkataraman

发布于 2026-09-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Riyaaz Shaik, Chandru Venkataraman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人手臂正在学习如何在桌子上堆叠积木。在计算机模拟的理想世界中,如果机器人撞倒了积木,人类程序员只需按下按钮将积木放回原处,然后让机器人再次尝试。这种重置机制是一个安全网,它允许人工智能通过试错来进行学习,而不会造成现实世界的损坏。然而,机器人技术的终极目标是创造能够持续自主运行的机器,而无需人类按下那个重置按钮。挑战在于,现实世界充满了永久性的错误。如果机器人把杯子从桌子上推下去,杯子会破碎或滚远;如果它洒了一堆沙子,沙粒会散落开来,无法通过简单的动作反转重新聚集成整齐的一堆。这些都是不可逆的状态,是在这些时刻,回到起点的路径在物理上被阻断了。对于一个无法重置的机器人来说,进入这样的状态意味着学习过程将永远停止,陷入一个它无法逃脱的失败之中。

苹果公司的研究人员构建了一个名为 REVERSAL-BENCH 的新测试场,专门研究机器人在无法重置时是如何失败的。他们并没有将“可逆性”视为一个简单的“是或否”的问题,而是创建了一个连续的刻度盘,用来控制从错误中恢复的难易程度。在刻度盘的一端,环境是完全宽容的;机器人可以撞到任何东西并弹回起始位置。在另一端,环境是毫不留情的,布满了会让机器人永久无法完成任务的陷阱。通过转动这个刻度盘,团队可以观察不同的学习策略在面临永久性失败风险增加时表现如何。他们在五种不同的物理引擎(即模拟现实世界物体如何移动、碰撞和变形的复杂计算机程序)上测试了这些策略。

结果显示,性能出现了剧烈且突然的崩溃,作者称之为“可逆性悬崖”(reversibility cliff)。随着环境变得稍微难以恢复,那些依赖于无重置学习的机器人开始出现灾难性的失败。它们不仅仅是在任务上的表现变差了,而是陷入了永久性的困境。一旦机器人进入了一个不可逆区域——例如一个力量过强以至于它无法推回来的区域——它就永远无法返回安全的起始区域。由于无法重置,它被困在了那里,无法有效地学习或行动。这种情况在许多不同类型的机器人和任务中都一致地发生了,从简单的导航到复杂的物体操纵。相比之下,那些允许定期重置(即使只是每几分钟一次)的机器人则能持续稳定地学习,不会遭受这种永久性的困境。

为了确保这种失败是专门由“无法恢复”引起的,而不是仅仅因为任务变得更难,研究人员设计了一个巧妙的对照组。他们为每一个困难且不可逆的任务都配了一个外观完全相同但物理上可逆的孪生版本。在这些孪生世界中,障碍物是相同的,但通常会困住机器人的力量被削弱到了足以让其逃脱的程度。当机器人在这些可逆的孪生版本上进行测试时,即使面对巨大的障碍物,它们的表现也十分完美。这证明了性能的崩溃并非源于几何结构的复杂性或目标的难度,而纯粹是因为机器人失去了撤销错误的能力。这项研究表明,无论机器人使用的是简单的规则还是先进的学习算法,这种现象都会发生,并且即使在高度真实的刚体、软材料和颗粒状物质(如沙子)的模拟中依然存在。

该团队还开发了一个旨在作为“盾牌”的安全系统,用于预测机器人何时即将进入陷阱并引导其避开。他们发现,该系统可以准确地从摄像机图像和状态数据中检测到危险,通常能在跌落或倾洒发生之前做出预判。然而,该系统有一个硬性限制:它只能在机器人物理上有能力转向避开陷阱的情况下才能起到保护作用。在物理情况使得恢复变得不可能的情况下——例如一个物体滑向离机器人手臂够不到的桌边——安全盾牌虽然可以发出失败警告,却无法在物理上阻止失败。机器人仅仅是没有足够的机械杠杆力来阻止灾难的发生。这种区别至关重要:虽然我们可以制造出知道自己处于危险中的机器人,但我们并不总能制造出能从每一种危险中物理逃脱的机器人。

研究人员发布了一个包含近 4500 万个记录的机器人运动瞬间的大规模数据集,所有数据都标注了机器人是否可以从该特定时刻恢复。这一资源允许其他科学家使用已知的标准真相来测试他们自己的安全系统。研究结论指出,为了让机器人在现实世界中自主运行,我们必须承认有些错误是永久性的。未来的道路不仅涉及更好的学习算法,还涉及对恢复物理极限的根本理解。如果机器人要能够在没有人类帮助的情况下工作,它要么必须能够完全避免不可逆的陷阱,要么必须具备能够逃脱这些陷阱的物理能力,因为一旦它掉入一个无法逆转的状态,学习过程就会终止。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →