← 最新论文
🤖 machine learning

Test-Time Graph Search for Goal-Conditioned Reinforcement Learning

本文介绍了测试时图搜索(TTGS),这是一种轻量级且无需训练的规划封装方法,它利用现有离线目标条件强化学习策略固有的几何结构,在无需额外监督或参数更新的情况下,显著提升长程任务的成功率。

原作者: Evgenii Opryshko, Junwei Quan, Claas Voelcker, Yilun Du, Igor Gilitschenski

发布于 2026-05-26✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Evgenii Opryshko, Junwei Quan, Claas Voelcker, Yilun Du, Igor Gilitschenski

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你训练了一个非常聪明的机器人来穿越迷宫。你已经向它展示了成千上万条不同的路径,它学会了当起点和终点相距较近时如何从 A 点移动到 B 点。然而,当你要求它从迷宫的一侧穿越到另一侧时,它却感到困惑。它试图一步跨越巨大距离,却偏离目标、被困在角落,或耗尽时间。这是机器人学和人工智能中的一个常见问题:短期规划行之有效,但长期规划往往失败。

本文介绍了一种巧妙的“即插即用”解决方案,称为测试时图搜索(TTGS)。它无需重新训练机器人或教它新技能,而是在机器人开始移动之前,直接为其提供一张“地图”和一个“向导”。

以下是其工作原理,使用简单的类比说明:

1. 问题:“巨跃”陷阱

将训练好的机器人想象成一位对接下来 10 步内的地形了如指掌的徒步者。如果你让他们走 100 步到达一棵特定的树,他们可能会试图全程冲刺。由于他们无法清晰地看到那么远的地方,可能会绊倒在石头上或走进死胡同。用论文中的术语来说,机器人的“价值函数”(即其对某个动作好坏的内部猜测)在长距离上会变得嘈杂且不可靠。

2. 解决方案:“接力赛”策略

TTGS 不是让机器人一次性跑完整个马拉松,而是将旅程分解为一系列短小、可控的冲刺。它将机器人的旅程变成了一场接力赛

  • 地图(图结构): 系统查看机器人已经完成的庞大练习运行库(离线数据集)。它从这些旧运行中提取关键“路点”,并将它们像地图上的点一样连接起来。
  • 向导(最短路径): 当你给机器人设定一个新目标时,系统使用经典数学算法(Dijkstra 算法)来寻找起点和终点之间的最短、最安全路径,且仅使用来自旧练习运行的那些点
  • 交接(子目标): 机器人暂时不关注最终目的地,它只查看地图上的下一个“路点”。一旦到达该点,它会收到新指令,前往下一个路点。如此循环,直到抵达目标。

3. 秘诀:“软惩罚”

这里有一个陷阱:有时“地图”可能会建议一条看似捷径但实际上危险的路径(例如一座看起来坚固实则断裂的桥)。论文作者注意到,机器人内部对距离的“猜测”可能是错误的。

为了解决这个问题,他们添加了一个软惩罚。想象地图有一条规则:“如果某条路径看起来太长或太危险,我们不会删除它,而是对其征收巨额‘税’。”机器人的规划器仍然能看到这条危险路径,但它会更倾向于选择一条稍长但更安全、由可靠小步组成的路线。这防止了机器人尝试跨越它实际上无法跨越的鸿沟,同时保持了地图的连通性。

4. 为何它与众不同

  • 无需重新训练: 你无需教机器人任何新东西。只需将你已构建的机器人配上这个“地图包装”,它就能立即表现得更好。
  • 适用于“冻结”策略: 机器人的“大脑”是“冻结”的(在测试期间无法学习新事物),但这种方法能帮助它更有效地利用已有的知识。
  • 懂得何时停止: 如果地图没有足够的“路点”来弥合起点和目标之间的差距(就像试图在没有踏脚石的情况下跨越峡谷),该系统足够智能,会说出“我无法安全地规划此路径”,然后让机器人自行尽力尝试。它不会强行执行糟糕的规划。

结果

研究人员在名为OGBench的基准测试中测试了该方法,该测试包含针对蚂蚁和人形机器人等复杂迷宫。

  • 之前: 在最难的迷宫中,机器人经常完全失败(成功率为 0%)。
  • 之后: 使用 TTGS 后,在许多情况下成功率跃升至**90%**以上。
  • 对比: 这种性能匹配甚至超越了那些需要额外训练、昂贵计算机模型或在线练习的更复杂方法,而规划时间不到一秒。

总结

可以将 TTGS 想象成给一位技艺娴熟但目光短浅的徒步者配备了一个GPS,该 GPS 仅基于其他徒步者此前成功走过的路线,向他们显示接下来的几步安全路径。它将一段令人恐惧的长途旅程转化为一系列轻松、自信的短步,使机器人能够解决此前无法触及的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →