← 最新论文
💻 computer science

DreamTrajectory: Trajectory-Guided Action Generation with World Model Alignment for Mobile Manipulation

DreamTrajectory 是一个用于移动操作的轨迹引导框架,它通过共同预测末端执行器轨迹和全身动作来引导协调运动,从而改进了现有的视觉-语言-动作策略,同时利用轻量级世界模型进行测试时优化,以使执行动作与规划轨迹保持一致,从而显著提升了在模拟环境和现实世界中接触密集型任务中的成功率。

原作者: Zheng Yang, Wenjie Zhang, Xiangyu Chen, Wenxuan Song, Xianpeng Wang, Yihang Kang, Wen Chen, Lujia Wang, Renjing Xu, Xiaowen Chu

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Zheng Yang, Wenjie Zhang, Xiangyu Chen, Wenxuan Song, Xianpeng Wang, Yihang Kang, Wen Chen, Lujia Wang, Renjing Xu, Xiaowen Chu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一种机器人:它不仅仅是困在桌子或工厂地面上,而是能在你的客厅里四处滚动,拿起一个咖啡杯并递给你。这就是**移动操作(mobile manipulation)**的梦想。这是机器人领域一个棘手的角落,因为机器人必须同时做两件事:既要驱动轮子到达正确的位置,又要移动手臂去抓取物体,而与此同时,它头部的摄像头还要面对着旋转和偏移的世界。把它想象成尝试在骑单轮车的同时玩杂耍;如果你只专注于杂耍,你可能会从车上摔下来;但如果你只专注于单轮车,你就会掉落手中的球。

长期以来,机器人通过观察一张图片和一个类似“拿起橙子”的指令,立即输出一套针对每个轮子和关节的电机指令来学习这种技能。但这就像是在没有情节大纲的情况下,试图通过猜测每一个字母来写一部小说。机器人经常会在海量的选择中迷失方向,导致动作笨拙或发生碰撞。此外,一旦机器人决定了要做什么,它就只是盲目地执行,并寄希望于最好的结果。如果地面很滑,或者物体比预想的要重,机器人在计划失败之前并不会意识到问题,直到它已经掉落了杯子。科学家们正试图通过给机器人一种更好的规划方式和一种在行动前检查工作的机制来解决这个问题。

于是有了 DreamTrajectory,这是一种全新的方法,它扮演着机器人表演中的“聪明导演”的角色。它不再仅仅是猜测最终的电机指令,而是首先为机器人的手(末端执行器)勾勒出一条“梦境”路径。这就像编舞者在舞者开始跳舞之前,先在白板上画出一段舞蹈动作。然后,机器人生成特定的轮子和手臂运动,以追踪那条草图。但最巧妙的部分在于:在机器人实际移动之前,它会进行一次快速的心理模拟。它会问自己:“如果我尝试这个特定的动作,我的手真的会到达我计划的位置吗?”它会测试几种不同的动作版本,挑选出与“梦境”路径最匹配的一个,然后才开始执行。

研究人员通过两种方式测试了这个想法。首先,他们在名为 MS-HAB 的计算机模拟中运行它,机器人在虚拟的桌子和冰箱前进行练习。他们发现,如果没有这种额外的规划和检查,机器人的成功率仅为 32.3%。通过加入“梦境”路径,成功率跃升至 47.5%。当他们加入了用于双重检查动作的心理模拟步骤后,成功率攀升得更高,达到了 54.8%。这种提升在涉及接触的复杂任务中尤为显著,比如打开冰箱门或关闭柜台,在这些任务中,机器人必须通过感知来引导动作。

他们并没有止步于电脑屏幕。他们还在现实世界中,在真实的 ARX LIFT 机器人上进行了测试。结果同样令人印象深刻。在采摘水果和打开抽屉等任务中,机器人的成功率从 63.3% 提升到了加入路径规划后的 81.7%,最后在加入心理双重检查后达到了 90.0%。该系统通过使用一个轻量级的“世界模型”——一个能够预测下一步发生什么的快速、小型大脑——来为不同的动作选择评分。它不需要每次都重新训练;它只需接入其中,即可帮助主机器人实时做出更明智的决策。

论文指出,这种方法解决了两个大问题:它阻止了机器人在巨大的可能动作空间中盲目猜测,并阻止了机器人在执行坏主意之前先对照计划进行检查。作者指出,该系统非常高效,仅增加了极小的额外计算开销(每步延迟约 11.75 毫秒)便获得了如此巨大的收益。虽然结果令人鼓舞,但它们是基于特定的模拟和有限的现实任务得出的,这表明虽然该方法对于这类移动机器人非常有效,但它是一个针对特定问题的工具,而非解决所有机器人问题的万能药。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →