← 最新论文
🤖 machine learning

Multi2^2: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments

本文介绍了 Multi2^2,这是一个结合了经过监督微调的高层规划器与基于强化学习的底层执行器的分层多智能体框架,旨在减轻目标漂移并在动态交互环境中实现鲁棒的长程决策,并随之发布了三个新的基准数据集。

原作者: Sangeun Park, Minhae Kwon

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Sangeun Park, Minhae Kwon

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个非常聪明但有点丢三落四的机器人如何在电子游戏中完成一项复杂的、多步骤的任务。也许目标是“寻找一种稀有植物,将其与水混合,然后酿造药剂”。

如果你只是告诉机器人“去做吧”,并让它自己摸索每一个动作,它往往会感到困惑。它可能会忘记药剂是用来做什么的,开始原地转圈,或者尝试喝掉水而不是混合它。在研究领域,这被称为**“目标漂移”(objective drift)**:机器人在旅程开始时有一个明确的目标,但在中途时却失去了对目标的追踪。

这篇论文介绍了一个名为 Multi2 的新系统来解决这个问题。把 Multi2 想象成不是一个单一的机器人,而是一个由两名专业人员组成的协作团队,他们像老板和熟练工匠一样协同工作。

两个角色:老板与建筑师

1. 老板 (System 1):负责“大局观”的规划者

  • 职责: 这个角色不接触控制键。相反,他们观察宏观目标,并将其分解为细小、易于管理的块状任务。
  • 类比: 想象你在盖房子。老板是建筑师。他们不搬砖,而是绘制蓝图并说道:“首先,我们需要浇筑地基。一旦完成后,我们再建造墙壁。”
  • 学习方式: 老板通过向他们展示数千个优秀蓝图的示例来进行训练(一种称为监督微调的方法)。他们学会了给出清晰且具备上下文意识的指令,确保团队永远不会偏离主目标。

2. 建筑师 (System 2):负责“动手操作”的执行者

  • 职责: 这个角色实际动手使用工具并开展工作。他们接收老板的指令(例如“浇筑地基”),并弄清楚为了实现这一目标需要按下哪些具体的按钮。
  • 类比: 建筑师是施工队。他们是那些亲自动手干脏活、处理泥浆并在混凝土洒出时进行修复的人。
  • 学习方式: 建筑师分两个阶段进行训练:
    • 第一阶段(离线): 他们研读一个过去的施工视频库,在不犯真实错误的情况下学习基础知识。
    • 第二阶段(在线): 他们进入真实的外部世界(游戏环境)并进行练习。如果他们搞砸了,他们会立即从中学习。至关重要的是,他们被教导要紧贴在库中学习到的内容,以免表现得过于狂野而忘记了基础知识。这被称为离线到在线强化学习(Offline-to-Online Reinforcement Learning)

为什么这个团队更有效

论文指出,以往的方法试图让一个机器人同时承担规划和建造的任务。这就像要求建筑师同时也去铺设每一块砖头。这工作量太大了,而且建筑师在挥动锤子钉钉子时,往往会忘记蓝图。

Multi2 通过分离角色解决了这个问题:

  • 稳定性: 因为老板(System 1)专注于规划,团队永远不会丢失主目标,即使任务耗时很长。
  • 效率: 建筑师(System 2)通过实践变得更加擅长特定动作。这意味着机器人不需要像以前那样费力“思考”或使用大量的计算机词汇(token)来完成任务。这就像一位经验丰富的木匠可以一气呵成地切割木板,而新手则需要不断测量和重新测量。

实验结果

研究人员在三个不同的“电子游戏”世界(ScienceWorld、ALFWorld 和 TextCraft)中测试了这个团队,这些任务都需要许多步骤。

  • 更高的成功率: Multi2 解决了比其他方法更多的任务,尤其是在那些其他机器人通常会放弃或产生困惑的长距离、高难度任务中。
  • 更少的混乱: 当其他机器人开始陷入循环(重复做无意义的动作)时,Multi2 依然能保持在轨道上。
  • 节省能量: Multi2 使用更少的计算机资源(token)就达到了同样的结果,这使得它更快、更高效。

“秘诀”所在

论文还发布了一套全新的训练数据(就像是为机器人专门设计的教科书),专门用于教授这种“老板与建筑师”的协作模式。他们发现,如果混淆训练内容——比如试图教老板如何铺砖,或者教建筑师如何画蓝图——系统就会失败。特定的角色必须保持分离,并针对其职责进行专门训练。

简而言之,Multi2 是一种构建 AI 智能体的方法,让它们不仅仅是靠“猜测”来完成长任务,而是拥有一位清晰的管理者来洞察目标,以及一位通过经验学习以高效完成工作的熟练工人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →