← 最新论文
💻 computer science

Any House Any Task: Scalable Long-Horizon Planning for Abstract Human Tasks

该论文提出了 AHAT,这是一个可扩展的长时程规划框架,它利用通过一种新型强化学习算法(TGPO)训练的 LLM,将模糊的人类指令和场景图转化为 PDDL 子目标,从而使机器人能够在大型环境中为复杂的家庭任务生成最优规划。

原作者: Zhihong Liu, Yang Li, Rengming Huang, Cewu Lu, Panpan Cai

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhihong Liu, Yang Li, Rengming Huang, Cewu Lu, Panpan Cai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人去打扫你凌乱的房间。你不想给它一个步步紧扣的手册,比如“捡起袜子,然后走两步,再弯下腰”。那太枯燥了,而且太脆弱了;如果袜子移动了,机器人就会陷入混乱。相反,你只想说,“把这个房间收拾整洁”,然后让机器人自己搞定剩下的事。这就是机器人技术的终极目标:将人类模糊的愿望转化为完美的、物理层面的行动方案。

为了实现这一点,科学家经常使用两种不同的工具。第一种是大语言模型(LLM),它就像一位博学多才、阅历丰富的图书管理员,知道关于世界的无数事实,但有时会编造故事或忘记物理规则。第二种是符号规划器(Symbolic Planner),它就像一位严厉、刻板的数学老师,能完美地遵循规则,但完全不知道什么是“整洁”,也不会和人类交流。巨大的挑战在于,如何让这位爱聊天的图书管理员和这位严厉的数学老师协同工作,既不会让图书管理员把机器人困在死循环里,也不会让数学老师因为指令太模糊而拒绝开始工作。

这正是名为 TGPO(轨迹引导策略优化,Trace-Guided Policy Optimization)的一篇新论文所解决的问题。研究人员正在尝试教机器人如何将人类宏大且模糊的指令分解成一系列机器人可以实际执行的小型、可检查的步骤。他们发现,仅仅要求智能 AI “直接去做”往往会导致生成的计划在纸面上看起来很完美,但在现实世界中却会失败。相反,他们开发了一种巧妙的训练方法,让 AI 学习生成其思考过程的“轨迹”(trace),在出错时接受助手的纠正,然后再次尝试。这就像是在教学生时,不只是在最后给一个分数,而是在整个做题过程中引导他们,实时修正逻辑错误,并让他们反复练习直到掌握为止。其结果是,该系统在处理长距离、复杂任务(例如为一场派对准备整个房屋)时,比以往的方法表现得更出色,尤其是在指令模糊的情况下。

问题所在:会“折断”的魔杖

想象你有一个机器人管家。你告诉它:“我要举办一场节日聚会,所以把房子收拾一下。”人类能立刻理解这句话:他们知道要捡起垃圾、擦桌子,甚至可能摆放一些装饰品。但对于机器人来说,这是一个噩梦。如果你要求一个标准的 AI 直接“写一个计划”,它可能会产生幻觉。它可能会说:“把沙发移到厨房里”,即使沙发太重搬不动;或者“打开炉灶来清理地板”,这是一个极其糟糕的主意。

论文解释说,目前的 AI 模型擅长预测句子中的下一个词,但它们非常不擅长确保其计划的可行性。它们会在早期犯下微小的错误——比如忘记在移动桌子之前先拿起杯子——而这些错误会像多米诺骨牌一样堆叠起来,直到整个计划崩溃。另一方面,传统的机器人规划器非常安全,它们不会做任何不可能的事。但它们也很“笨”;你需要用非常具体的代码(称为 PDDL)来告诉它们每一步要做什么,它们无法理解“为派对做准备”这种细微的语境。

解决方案:TGPO(“轨迹引导型”教练)

作者提出了一种名为 TGPO 的新训练方式。不要把 TGPO 想成一个只会瞎猜的机器人,而要把它想成一个在严厉而有帮助的教练指导下学习的学生。

以下是这种训练的工作原理(使用简单的类比):

  1. 学生(AI 策略): 机器人的大脑尝试将你的命令(“为派对做准备”)分解为一系列子目标。它可能会说:“1. 捡起垃圾。2. 洗碗。3. 吸尘。”
  2. 教练(验证器): 一个严格的检查者会查看这个列表。它会问:“等等,如果水槽里塞满了食物,你真的能洗碗吗?你在吸尘之前记得挪开椅子了吗?”
  3. “轨迹”纠正: 如果学生的计划错了,教练不会只说“失败”。相反,它会观察其思考过程(即轨迹)并修正具体的错误。它可能会说:“你忘了先清空水槽。这是修正后的步骤列表。”
  4. 练习循环: 机器人随后会根据这个经过修正的列表尝试生成剩余的计划。它从纠正中学习,而不仅仅是从最终的“通过/失败”成绩中学习。

这与目前大多数 AI 的训练方式不同。通常,你让 AI 做某事,如果它失败了,你只需告诉它“做得不好”然后重试。这就像是在数学考试中不及格,却只得到了一个“F”,而没有看到显示你哪里出错的红笔批注。TGPO 就像是在你考试的过程中,一边做题一边得到红笔批注,这样你就能在交卷前修正自己的逻辑。

研究发现:机器人变得更聪明了

研究人员在各种任务上测试了这种新方法,从简单的“给我拿条毛巾”到极其复杂的“为节日聚会准备房屋”(涉及移动家具、清洁和按特定顺序整理)。

他们将他们的机器人与另外两种类型的规划器进行了对比:

  • “提示词驱动型”机器人: 这些是仅被要求编写计划的 AI 模型。论文发现,随着任务变得更难、更抽象,这些机器人的表现惨不忍睹。它们会被复杂性搞糊涂,并提出一些不可能实现的动作。
  • “标准学习型”机器人: 这些是使用标准强化学习(试错法)训练的机器人。它们比提示词驱动型机器人表现好一些,但在指令模糊或任务过长时仍然难以应对。

结果如下:
TGPO 机器人是明显的赢家。

  • 在简单任务上,它的成功率约为 88%。
  • 在复杂任务(长链条动作)上,它的成功率为 77%。
  • 在抽象任务(机器人需要猜测“收拾干净”的具体含义)上,它的成功率为 70%。

相比之下,表现最好的“提示词驱动型”机器人在同样的抽象任务上,成功率仅为 22% 左右。论文指出,TGPO 能够实时修正其思考过程的能力是成功的关键。它不只是在猜测,它在推理、检查、纠正,然后行动。

这为什么很重要

这篇论文表明,通过教机器人生成“可验证的子目标”(小型、可检查的步骤),并使用一个能够纠正其思考轨迹的系统,我们可以让它们在现实世界中变得更加可靠。作者指出,即使环境很乱或指令很模糊,这种方法依然有效。

然而,作者也谨慎地指出,这目前还不是解决所有机器人问题的万灵药。该系统仍然依赖于一个预定义的场景图(scene graph)和一个机器人已知的规则集。它并不会仅仅通过观察摄像头来从零开始学习如何感知世界;它需要这种结构化的地图来进行规划。但对于将人类语言转化为安全、可执行的机器人动作这一特定任务,TGPO 展示了一个重大的进步,证明了通过正确的“教练式教学”,AI 可以学得比自主探索时更好地进行规划。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →