← 最新论文
🤖 AI

Traj-LeWM: Path-Aware World-Model Planning via Latent Trajectory Cost

Traj-LeWM 通过引入一个目标条件的潜在轨迹代价,在训练和规划过程中通过路径感知信息来补充端点距离,从而增强了轻量级视觉世界模型 LeWM,并在多个机器人操控基准测试中实现了显著的性能提升。

原作者: Xiaodi Huang, Ziyi Ding, Jingtian Wan, Yuchen Liu, Yuan Zhang, Xiao-Ping Zhang, Jiayu Chen, Zhang Zhang, Tao Huang

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaodi Huang, Ziyi Ding, Jingtian Wan, Yuchen Liu, Yuan Zhang, Xiao-Ping Zhang, Jiayu Chen, Zhang Zhang, Tao Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何穿越迷宫,或者将一个方块推到特定位置。在人工智能的世界里,这通常是通过一种被称为“世界模型”(World Model)的技术来实现的。你可以把世界模型想象成机器人的“内在白日梦”。它不仅仅是根据眼前所见做出反应,而是利用这个“白日梦者”来模拟未来:“如果我把手臂向左移动,一秒钟后世界会变成什么样?两秒钟后呢?”

长期以来,科学家们一直试图让这些“白日梦”变得更加准确。一种名为 LeWM(轻量级世界模型)的新方法取得了重大进展。它学会了直接从摄像机像素中预测未来,从而跳过了对复杂 3D 地图的需求。然而,即使是 LeWM 也有它的盲点。它就像一个只关心最终目的地的 GPS:它会查看一系列可能的路线,并选择一条看起来最接近目标的路线,但它并不真正检查中间的路段是否布满了坑洼、死胡同或交通拥堵。如果两条路线都通向同一个终点,机器人无法分辨哪一条路径实际上更安全或更平稳。这篇论文 Traj-LeWM 正试图通过教会机器人关注“整个旅程”,而不仅仅是“终点线”,来修复这个盲点。

问题所在:“终点线”陷阱

这篇论文的作者注意到,像 LeWM 这样的机器人进行决策时存在一个有趣的逻辑问题。想象一下你在玩一款电子游戏,目标是引导角色走向宝箱。你有两条路径可选:

  1. 路径 A: 一条笔直、清晰的道路,直接通往宝箱。
  2. 路径 B: 一条蜿蜒、危险的路径,穿过一片布满陷阱的森林,但最终也会到达宝箱旁边。

传统的 AI(如 LeWM)会观察这两条路径的终点,发现它们离宝箱的距离一样近,于是随机选择其一。它没有意识到路径 B 可能会在半路让角色撞上一棵树。论文指出,这是因为机器人只检查了“终点距离”(Endpoint Distance),而忽略了“中间路径”(Intermediate Path)——即行动过程中那些混乱、棘手的过程。

研究人员发现,在复杂任务中(例如推动一个 T 形物体或在障碍物中导航),两种不同的动作序列可能会结束在完全相同的位置,但其中一个会成功,而另一个则会惨败。旧有的机器人无法区分这两者,因为它太专注于终点线了。

解决方案:“全程”评分卡

为了解决这个问题,团队引入了 Traj-LeWM。他们保留了机器人预测未来的能力,但增加了一个新的“评分卡”,称为潜在轨迹代价(Latent Trajectory Cost, LTC)

可以将 LTC 想象成一位严厉的教练,他不仅看运动员最后站在哪里,还会观察整场比赛的过程。

  • 旧的方法: 教练说:“做得好!你离终点线还有 1 米。”
  • 新的方法 (Traj-LeWM): 教练说:“你虽然离终点线还有 1 米,但你踉跄了三次,撞到了墙,还绕了奇怪的远路。这是一次糟糕的表现。让我们看看另一位选手,他虽然也停在同样的位置,但跑得很平稳。”

新系统会为每条可能的路径学习一个“代价”。如果一条路径看起来会撞墙或走弯路,代价就会上升;如果路径平滑且符合逻辑,代价就会保持在较低水平。然后,机器人会将这个“平滑度分数”与旧有的“目标距离分数”结合起来,从而选出最佳动作。

他们是如何教机器人的

教会机器人去在意旅程的中间过程是非常困难的。你不能直接告诉它“不要撞墙”,因为它目前还不理解什么是“墙”。因此,研究人员使用了一种巧妙的技巧,叫做偏好学习(Preference Learning)

他们向机器人展示了成对的故事:

  1. 好故事: 一条完美的路径,机器人成功地将方块推向目标。
  2. 坏故事: 一条看起来很相似但有错误的路径(例如撞墙),或者是通往错误目标的路径。

机器人被要求猜测哪个故事更好。通过进行成千上上万次这种“这个比那个好”的练习,机器人学会了为好的路径分配低代价,为坏的路径分配高代价。他们甚至让机器人在模拟环境中进行规划,如果发生碰撞,他们就把那次碰撞作为一个“坏故事”记录下来进行学习。这就像游戏玩家通过死亡来学习如何避免跳下悬崖,只不过这次机器人是在从它自己的模拟错误中学习。

研究结果

团队在四个不同的模拟世界中测试了这个新机器人:

  • Push-T: 将 T 形物体推向目标。
  • OGBench-Cube: 将立方体移动到特定位置。
  • Reacher: 机械臂抓取目标。
  • Two-Room: 穿越两个房间的迷宫进行导航。

在这些模拟实验中,新的 Traj-LeWM 机器人明显优于旧的 LeWM 机器人。

  • Cube 任务中,成功率提升了 14 个百分点(从 74% 提高到 88%)。
  • Reacher 任务中,提升了 7 个百分点(从 86% 提高到 93%)。
  • Two-Room 任务中,提升了 7 个百分点(从 87% 提高到 94%)。
  • Push-T 任务中,提升了 3 个百分点(从 96% 提高到 99%)。

他们还在现实世界中使用真实的物理机器人(Franka FR3 手臂)进行了测试。在 20 个现实任务中,旧机器人成功了 10 次(50%),而新的 Traj-LeWM 机器人成功了 14 次(70%)。虽然这是一个小规模测试,但它表明该方法在计算机模拟之外也是有效的。

为什么这很重要

这篇论文表明,要让机器人变得真正聪明,它们不能只看目的地,还必须尊重旅程。通过教会机器人评估它所规划的整个路径,而不仅仅是最终的位置,它在避开陷阱和在复杂环境中导航方面表现得更加出色。

研究人员证实,这种进步源于两点:

  1. 更好的学习: 由于机器人被训练去关注整个路径而非仅仅终点,它学习到了更好的内部世界地图。
  2. 更好的规划: 即使机器人的未来预测略有偏差,这种“全程”评分也能帮助它选择更安全的选项。

简而言之,Traj-LeWM 证明了在机器人规划的世界里,重要的不仅是你最终到达了哪里,更在于你是如何到达那里的。通过赋予机器人一种能够欣赏平稳、安全路径而非颠簸、冒险路径的能力,作者们在让机器人应对复杂多变的现实世界方面迈出了重要的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →