← 最新论文
🤖 AI

Adaptive Domain Modeling with Language Models: A Multi-Agent Approach to Task Planning

本文介绍了 TAPAS,这是一个将大语言模型与符号规划相结合的多智能体框架,旨在无需手动定义环境的情况下,自动生成并适配用于复杂任务规划的领域模型,并在基准测试和模拟真实环境中均展示了强大的性能。

原作者: Harisankar Babu, Philipp Schillinger, Tamim Asfour

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Harisankar Babu, Philipp Schillinger, Tamim Asfour

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何做晚饭。在过去,科学家们必须为每一种可能发生的情景编写一份庞大且僵化的说明书:“如果锅是红色的,执行操作 X;如果锅是蓝色的,执行操作 Y。”如果机器人遇到了一个绿色的锅,或者一个它从未见过的任务,它就会因为说明书没有涵盖这种情况而陷入瘫痪。这就是**符号规划(symbolic planning)**的世界,即计算机遵循严格的、预先写好的规则。它很强大,但就像一个只知道 1990 年绘制的地图上的道路的 GPS;如果新开了一条路,GPS 就会迷路。

另一方面,我们现在有了大语言模型(LLMs),它们是能够聊天、写故事并理解人类语言的超级聪明 AI 大脑。它们极其灵活,即使你说得很奇怪,它们也能猜到你的意思。然而,它们也有点像一位才华横溢但丢三落四的艺术家:它们可能会构思出一个听起来很棒、但在物理上机器人无法实现的计划,或者它们可能会完全忘记物理定律。

科学家面临的大问题是:我们如何将旧式规则遵循机器人的严谨可靠性,与新型 AI 的灵活创造力结合起来?我们需要一个系统,能够理解像“用最大的积木做到底部来搭一个塔”这样混乱的现实世界请求,然后计算出如何建造它,即使机器人以前从未见过“最大的积木”是什么。这正是你即将阅读的这篇论文所提供的——它提供了一种让机器人能够边做边学的新方法。


认识 TAPAS:机器人的创意建筑师团队

认识一下 TAPAS(基于任务的自适应与规划代理系统)。把 TAPAS 看作不是一个单一的机器人大脑,而是一个在计算机内部高度组织化的微型施工队。TAPAS 并没有让一个人尝试做所有事情,而是将工作分配给三个专门的“智能体”(即小型 AI 工人),每个智能体都有特定的角色,并通过相互交流来构建一个计划。

以下是这个团队的工作方式,使用一个简单的类比:假设你想用积木搭一个塔,但你告诉团队:“我要把红色的积木放在蓝色的上面。”

1. 领域生成器(规则手册编写者)
首先,**领域生成器(Domain Generator)**会倾听你的请求。在过去,如果机器人不知道其规则手册中的“红色”或“蓝色”是什么意思,它只会说:“错误!我不认识这个词!”然后停止运行。但 TAPAS 不同。如果领域生成器意识到:“嘿,我们目前的规则手册中没有描述颜色的方法,”它不会惊慌。它会说:“好吧,我们需要在我们的规则手册中添加一个‘颜色’规则。”它会即时重写机器人的内部指令手册,以包含这个新概念。

2. 初始状态生成器(场景搭建者)
接下来,**初始状态生成器(Initial State Generator)**观察房间。它看到了桌子上的积木。如果规则手册刚刚更新以包含“颜色”,这个智能体会询问:“等等,每个积木是什么颜色的?”如果你没有告诉它,它可能会向你(或模拟环境)询问这些信息。它负责布置舞台,确保机器人准确知道每个积木的位置及其颜色,并符合新的规则。

3. 目标状态生成器(目标设定者)
最后,**目标状态生成器(Goal State Generator)**查看你的愿望:“红色的在蓝色上面。”它检查新的规则手册和场景。它会说:“明白了。目标是将它们堆叠,使红色的在上面。”

“工具调用”的魔力
最酷的部分是它们如何交流。它们不仅仅是猜测;它们使用“工具”。如果目标生成器发现了一个问题(例如,“我们无法按大小堆叠积木,因为我们还没有‘大小’规则”),它会调用一个名为 missing_fluent 的工具,并对领域生成器说:“嘿,我们需要一个关于大小的规则!”随后,领域生成器更新规则手册,整个团队便带着新的、更好的指令重新开始。这就像一群朋友在组装乐高套装,如果其中一个朋友意识到缺少某个特定的零件,另一个朋友就会跑去商店买回来,然后他们又一起继续组装。

从“是什么”到“怎么做”:执行团队

一旦计划写好,TAPAS 就必须让机器人实际移动。这很棘手,因为计划可能说“将积木 A 放在积木 B 上”,但机器人的物理手臂可能只知道如何“将机械爪移动到坐标 X, Y, Z”。

TAPAS 使用一个**计划执行器(Plan Executor)**来弥补这一差距。它充当一个翻译官。

  • 翻译官: 它将高级别的、抽象的计划转化为简单的、自然语言形式的指令,如“将你的手臂向左移动”或“抓取红色积木”。
  • ReAct 智能体: 这是机器人的“推理与行动”大脑。它观察指令,检查机器人实际拥有的工具(技能),并选择最佳方案。如果机器人尝试抓取积木却失败了,**验证智能体(Validator Agent,即监督者)**会说:“哎呀,那行不通。再试一次,也许把手臂移动得慢一点。”

他们发现了什么?

作者通过两种主要方式测试了 TAPAS:在经典的逻辑谜题中,以及在一个名为 VirtualHome 的 3D 模拟房屋中。

1. 逻辑谜题(基准测试)
他们在七个不同的规划挑战中测试了 TAPAS,比如著名的“积木世界”(Blocksworld,堆叠积木)和“调酒师”(Barman,调制饮料)。

  • 结果: TAPAS 的表现非常出色。当使用顶尖 AI 模型(GPT-4o)时,它解决了 97% 的“调酒师”问题和 100% 的“积木世界”问题。
  • 对比: 这比使用其他 AI 模型或仅仅尝试强迫 AI 完成所有工作要好得多。例如,在“积木世界”测试中,TAPAS 解决了 100% 的问题,而其他方法则表现得相当吃力。

2. “新规则”测试(适应性)
这是 TAPAS 真正闪光的地方。研究人员给了机器人一些它从未见过的任务,比如“堆叠积木,使最大的积木在底部”或者“移动积木,但要确保机器人不会耗尽电池”。

  • 结果: TAPAS 成功地意识到它需要向规则手册中添加“大小”或“电池”规则。它是自动完成这一过程的。
    • 对于“大小”任务,它更新了规则,规定“你只能将积木堆叠在一个更大的积木之上”。它解决了 90% 的这类复杂新问题。
    • 对于“电池”任务,它添加了关于能量消耗的规则。它解决了 100% 的“夹持器”(机器人手部)电池相关问题。
  • 不足之处: 它并非完美无缺。在带有电池约束的“地板瓷砖”(Floortile,清洁瓷砖)测试中,它仅解决了 70% 的问题。论文指出,这是因为 AI 有时会猜测起始电池电量而不是询问电量,这表明该系统在避免做出假设方面仍需更加谨慎。

3. VirtualHome 模拟
最后,他们将 TAPAS 置于一个 3D 模拟房屋中。任务是:“从冰箱里拿一个派并放在桌子上”,以及“加热三文鱼并放在桌子上”。

  • 结果: TAPAS 成功生成了计划,将其转化为动作,并引导虚拟机器人打开冰箱、抓取食物、使用微波炉并将物品放置在桌子上。
  • 记忆技巧: 他们还测试了 TAPAS 是否能从错误中学习。他们告诉系统:“下次你使用冰箱时,确保把它关上,即使我没有特意说明。”随后,当机器人面对类似任务时,它记住了这条规则,并自动关闭了冰箱。这表明 TAPAS 可以存储“程序性记忆”以不断进步。

为什么这很重要(以及它不是什么)

论文指出,TAPAS 是向前迈出的有力一步,因为它结合了 AI 理解语言的创造力和严格规划规则的可靠性。它不仅仅是遵循剧本;当情况发生变化时,它可以重写剧本。

然而,作者也谨慎地指出,这目前仍是一个模拟环境。他们在计算机世界(VirtualHome)和标准逻辑谜题中对其进行了测试,而不是在杂乱的真实世界厨房里的真实机器人上。虽然结果令人鼓舞,但论文承认,在现实世界的部署仍面临挑战,例如防止 AI “幻觉”(编造事实)或处理过于复杂以至于无法自动修复的错误。

简而言之,TAPAS 就像一个不仅仅是遵循地图的机器人;它可以在遇到路障时绘制一张新地图,在迷路时寻求指引,并且能记住下次使用的捷径。它还不是一个完美的机器人,但它是一个正在学习如何随机应变的高智商机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →