LePlanner: An Iterative Amortized Controller For World Models
LePlanner 是一种迭代摊销控制器,它在冻结的世界模型上通过到达并保持(arrival-and-hold)目标进行训练,以在接触密集型环境中实现快速且具备时界感知能力的规划,在显著降低计算延迟的同时,达到与高昂代价的搜索类方法相匹配的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在构建能够穿越现实世界的机器的探索过程中,科学家们长期以来一直依赖一种被称为“世界模型”(world models)的策略。想象一个机器人,它不仅仅是根据眼前所见做出反应,而是构建了一个关于世界运作方式的精神模拟。在它移动任何一寸肌肉之前,它会在脑海中运行数千种想象的情景,测试不同的动作,以观察哪一种能导致预期的结果。这种方法允许智能体进行提前规划,就像人类在迈出一步之前,会在脑海中构思一条穿过拥挤房间的路径一样。然而,这个过程中存在一个持久的瓶颈。为了使这些精神模拟变得有用,机器人要么必须花费大量的时间去计算每一种可能的路径,这会使其变得缓慢且迟钝;要么它必须依赖于一种简单的、预先学习到的习惯,这种习惯在简单情况下表现良好,但在任务变得复杂或需要精确物理接触时往往会失败。
印度理工学院鲁尔基分校(IIT Roorkee)的研究人员开发了一种名为 LePlanner 的新方法,填补了这一空白。他们创建了一个系统,该系统通过一系列快速的、迭代式的调整来学习优化自身的计划,而不是依靠暴力计算或僵化的模仿。团队在四种不同的模拟环境中训练了这个系统,范围从一个推着 T 形物体的机器人手臂,到一个在两个相连房间中导航的角色。在这些测试中,LePlanner 在某些任务上的成功率高达 100%,达到了与计算成本最高的规划方法相当的性能,但所需的预测器调用次数却减少了数百倍。成功的关键在于改变了教导系统达到目标的方式。系统不再是被告知要在固定的时间窗口结束时到达,而是因为尽可能快地到达目标并保持在那里而获得奖励。这种简单的训练转变防止了机器人出现犹豫或延迟到达的情况,使其能够在复杂的物理场景中做出快速、可靠的决策,而无需停下来重新计算每一个动作。
研究人员解决的核心挑战是人工智能规划中的一个基本权衡。一类被称为“基于搜索的规划器”(search-based planners)的方法,通过生成成百上千条潜在的未来路径并评估每一条来寻找最佳选项。虽然这些方法非常精确,但它们极其缓慢,因为对于机器人的每一个决策,它们都必须运行世界模型数千次。这种高延迟意味着机器人在处理实时任务时反应太慢。另一方面是“基于策略的方法”(policy-based methods),它们学习将情况直接映射到动作。这些方法很快,但很脆弱;当任务涉及复杂的物理交互(如推或抓取)时,它们经常失败,因为它们只是记忆了训练数据中看到的动作,无法在情况发生微小变化时进行适应。研究人员发现,这两种方法都无法提供可靠控制在学习到的精神空间中所需要的理想速度与鲁棒性的结合。
为了解决这个问题,团队引入了一个通过摊销规划过程的迭代控制器。系统不是进行大规模搜索或依赖单一猜测,而是从一个初始计划开始,然后对其进行几次精炼,就像一个人在地图上勾勒出路线,然后在更深入思考地形时调整转向一样。这种精炼是通过一个学习过程完成的,在这个过程中,系统观察它想象的未来,检查离目标的距离,并对计划进行微小的修正。至关重要的是,整个过程被训练得既快速又高效,每次决策仅需进行少量的计算。该系统使用一个冻结的世界模型,这意味着底层的物理和视觉理解是保持不变且预训练好的,而规划控制器则学习如何在这一固定的理解中进行导航。这种分离使得研究人员可以在不重新训练整个视觉系统的情况下改进规划策略,使过程既稳定又高效。
论文的一个重要部分集中在研究人员称之为“时界重置拖延症”(horizon-reset procrastination)的微妙但关键的失效模式上。在许多标准的规划设置中,系统被训练在固定的时间段结束时到达目标。当机器人在现实世界中执行计划时,它只执行前几步,然后就会停止并为下一刻重新规划。由于截止日期随着每一次新的计划而不断重置,系统学会了一种习惯:接近目标却从未真正到达,不断地将到达时间推向更远的未来。研究人员证明,即使机器人具备物理上的到达能力,这种行为也会导致其失败。为了解决这个问题,他们引入了一种新的训练目标,称为“到达并保持”(arrival-and-hold)。这种方法奖励系统在最早可能的时刻到达目标并保持在那里,而不是等待一个固定的截止日期。通过教导系统重视即时到达和稳定性,他们消除了这种拖延行为,使机器人能够执行一致且有效的计划,无论重新评估路径的频率如何。
实验结果令人瞩目。在涉及机器人手臂将 T 形物体推向特定位置的测试中,当系统在每一次移动后都重新规划时,实现了 98% 的成功率。这种性能与缓慢、沉重的搜索类方法相当,但实现的计算量却极小。具体而言,与传统的搜索方法相比,新系统在每次决策时减少了约 2,250 倍的预测器转换(潜变量展开)。在其他任务中,例如机器人手臂抓取目标或角色穿过门口,系统分别达到了 100% 和 92% 的成功率。这些数字表明,该系统不仅更快,而且在简单的模仿策略通常会失败的复杂、多接触环境中更加可靠。研究人员指出,即使重新规划的频率发生变化,系统的性能仍保持稳定,这表明其学习到的行为是鲁棒的,并不依赖于特定的时间调度。
研究还强调了将系统的动作保持在已见数据范围内的重要性。研究人员增加了一个约束,防止规划器提出过于偏离训练数据分布的动作。这起到了安全护栏的作用,确保机器人不会尝试执行世界模型可能产生的幻觉式不可能或危险动作。尽管有此约束,系统也并非仅仅是在复制训练数据中的动作;它在积极构建新的计划以达到目标。在一次测试中,系统预测的第一个动作与它所接受训练的专家演示显著不同,但它仍然高精度地达到了目标。这证明了系统是通过推理而非仅仅通过记忆动作序列来学习解决任务的。
研究人员通过在四个不同的环境中进行严格测试,并使用一组共享的起始条件,确保了新方法与现有方法之间的公平比较。他们不仅测量了成功率,还测量了做出每个决策所需的时间,发现根据任务的不同,新系统比传统的搜索方法快 3 到 49 倍。研究还包括了机器人想象未来的详细可视化,显示出系统的精神模拟足以引导现实世界的行动。在机器人穿过门口的案例中,系统正确预测了穿过门的路径,而其他方法往往会卡住或幻想到与墙壁碰撞。这些视觉检查确认了改进不仅仅是统计学上的伪影,而是反映了系统在理解和规划环境方面的真实进步。
最终,这项工作证明了进行规划所需的复杂推理过程可以被学习并压缩进一个轻量级的迭代策略中。通过将世界模型的预测能力与鼓励及时到达的精炼训练目标相结合,研究人员创造了一个既快速又鲁棒的控制器。该系统不需要在线优化或沉重的计算,因此适用于对速度要求极高的实时应用。虽然目前的实验是在模拟环境中进行的,但其原理为更高效、更强大的现实世界机器人控制指明了方向。LePlanner 的成功表明,机器人规划的未来可能不在于更快的计算机或更复杂的搜索,而在于更聪明、更高效的学习思考方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。