← 最新论文
🤖 AI

Decoupling Planning and Control for Instructable Agents

本文介绍了 Instruct-to-Act,这是一个解耦的框架,它将来自视觉语言模型的高层规划与快速、以语言为条件的具身世界模型控制器相结合,从而在多样化的单智能体和多智能体环境中实现鲁棒、低延迟的具身控制。

原作者: Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr

发布于 2026-08-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,存在着一种持久的“思考”与“行动”之间的鸿沟。一方面,我们拥有大型语言模型,这些系统能够阅读复杂的指令、理解目标,并将其分解为逻辑严密的步骤序列。这些模型擅长高层级的推理,就像人类给出方向指引一样,但它们往往过于缓慢且笨拙,无法完成在现实或虚拟世界中导航所需的瞬时物理动作。另一方面,我们拥有专门的控制系统,它们可以对周围环境做出即时反应,动作迅速且精准,但它们缺乏理解抽象目标或遵循对话的能力。它们就像是一名技术精湛的运动员,虽然跑得很快,但如果没有教练大声喊出具体的指令,就不知道该往哪里走。对于机器人或数字智能体而言,若要在复杂多变的环境中真正发挥作用,它既需要具备规划的能力,也需要具备行动的能力;然而,将这两项截然不同的能力结合起来,在历史上一直是一个艰巨的工程挑战。

一组研究人员通过一个名为“Instruct-to-Act”的新系统解决了这一分歧,该系统成功地将规划任务与控制任务进行了分离。他们并没有试图强迫一个单一的庞大模型同时完成所有工作,而是构建了一个由两个专业组件组成的伙伴关系。第一个是规划器,它利用预训练的视觉语言模型来观察环境和用户的目标,然后写出一条简单的、高层级的指令。第二个是控制器,这是一个轻量级系统,经过专门训练,旨在接收这些指令并将其转化为快速的物理动作流。其核心创新在于,这两个部分既相互独立又同步运行。规划器可以花时间去思考、推理,甚至与其他智能体进行交流,而控制器则以极高的速度执行必要的动作,无需等待规划器完成每一个念头。这种设计使系统能够处理视频游戏和模拟世界中的复杂长期任务,其速度和可靠性达到了以往尝试所无法企及的水平。

研究人员在七种不同的环境中测试了这种方法,范围涵盖了从经典的街机游戏到多个智能体必须协作完成任务的复杂协作场景。在这些测试中,规划器充当“大脑”,观察世界并决定下一步该做什么;而控制器则充当“手和脚”,实时执行计划。为了教会控制器如何遵循这些指令,研究人员并没有依赖人类专家来演示每一个动作。相反,他们利用规划器本身回顾控制器的成功动作,并据此编写一段关于正在发生情况的总结。这一过程使得控制器能够学习如何将模糊的自然语言命令转化为精确的底层动作。其结果是,该系统可以与不同的规划器配对而无需重新训练,具有高度的灵活性。

研究结果表明,这种职责分离的效果非常出色。当研究人员将他们的系统与那些尝试直接从大型语言模型生成动作的其他系统进行比较时,发现他们的方法在速度和准确性上都显著优于后者。直接生成的方法往往会出错,产生的动作要么太慢,要么与当前即时情况无关。相比之下,Instruct-to-Act 系统在保持高执行速度的同时,依然能够遵循复杂的指令。在多智能体测试中(即两个或更多数字角色需要通过协作来解决谜题),该系统允许它们通过语言进行沟通、协商角色并实现共同目标,而不会互相干扰。在测试的七个环境中,该系统在六个环境中都表现出了极强的竞争力,证明了这种解耦的方法可以应对高层级推理和低延迟控制的双重需求。

这项工作的最显著特点之一是其高效性。由于控制器是一个小型化的专业模型,它可以每秒处理数千次视觉信息并发布动作,而规划器则在后台运行,仅在必要时才更新其策略。这意味着系统不会因为大型语言模型的缓慢处理时间而陷入停滞。研究人员发现,这种异步设置让智能体能够有效地进行扩展:随着他们在协作任务中增加更多的智能体,系统仍能保持性能,而不会出现经常困扰其他多智能体系统的通信瓶颈。控制器保持了可靠性,在不同任务和规划器下的指令遵循准确率保持在 86% 到 97% 之间,这表明系统已经学会了理解文字背后的意图,而非仅仅死记硬背特定的短语。

研究还探讨了指令质量如何影响最终结果。他们发现,即使指令是由不同的规划器生成的,或者具有不同的复杂度,控制器也能进行适应并表现良好。这表明该系统已经学会了一种鲁棒的方式来解释语言,而非仅仅记忆一组特定的命令。研究人员指出,当指令清晰且与即时情境紧密结合时,系统的表现最佳,但它处理模糊性的能力仍优于以往的方法。通过保持规划层和控制层的分离,研究人员创建了一个不仅强大而且具有模块化特征的框架,允许他们根据具体任务的需求更换不同的规划器或控制器。

最终,这项工作展示了构建能够在现实世界中运行的智能智能体的切实路径。通过承认思考与行动需要不同的速度和不同类型的智能,研究人员创建了一个能够兼顾两者优势的系统。规划器提供愿景和策略,而控制器提供速度与精准。这种方法避免了试图用单一模型完成所有工作的弊端,从而产生了一个既聪明又快速的系统。随着研究的深入,他们看到了将该框架应用于更复杂场景的潜力,包括人机协作以及需要在动态环境中进行长期规划的任务。Instruct-to-Act 的成功表明,具身智能的未来可能不在于构建更大、更庞大的单体模型,而在于设计不同类型智能之间更聪明、更高效的伙伴关系。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →