← 最新论文
💻 computer science

Bayesian Partner Modelling enables Adaptive Replanning for LLM Coordination

本文介绍了 BayesBeliefAgent,这是一个结合了贝叶斯伙伴追踪与矛盾条件重规划的层级化大语言模型系统,旨在高效地适应队友的策略转变,并与现有方法相比,显著减少了不必要的重规划以及信念-行动差距。

原作者: Harsh Goel, Aditya Sai Ellendula, Vaishnav Tadiparthi, Ehsan Moradi Pari, Hossein Nourkhiz Mahjoub, Sandeep P. Chinchali

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Harsh Goel, Aditya Sai Ellendula, Vaishnav Tadiparthi, Ehsan Moradi Pari, Hossein Nourkhiz Mahjoub, Sandeep P. Chinchali

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,一个主要的进阶前沿是如何教计算机协同工作。想象两个人正在试图制作一张桌子;如果一个人突然决定开始打磨木材,而另一个人还在锯木头,那么项目就会停滞。几十年来,研究人员一直试图让计算机程序进行协调,但一种特定的失败模式始终难以攻克。大型语言模型——那些能够编写故事或解决谜题的强大人工智能系统——通常非常擅长理解合作伙伴的“意图”。它们可以观察队友的行为并正确猜测:“啊,他们正试图切蔬菜。”然而,了解合作伙伴正在做什么并不自动意味着人工智能知道何时停止自己的当前任务。AI 可能会正确意识到其伙伴改变了计划,却因为过于僵化而无法改变自己的航向,继续切了十分钟蔬菜。这种在“理解伙伴”与“改变自身行为”之间的差距,正是研究人员试图解决的核心问题。

来自德克萨斯大学奥斯汀分校和本田研究中心的一个研究小组引入了一种新方法来修复这种脱节。他们构建了一个名为 BayesBeliefAgent 的 AI 智能体,设计用于在一个模拟厨房环境中工作,其中两名厨师必须共同准备餐食。在这些场景中,AI 及其看不见的伙伴必须协调各项任务,如切洋葱、煮米饭或摆盘。挑战在于,伙伴的策略可能会在任务执行过程中发生转变。研究人员发现,仅仅给 AI 提供对伙伴更好的理解是不够的。相反,他们给了 AI 一个特定的机制,用以决定确切何时停止当前的动作并重新开始。该系统不断观察伙伴的动作,并将其与 AI 基于其对伙伴计划的当前猜测所预期的动作进行比较。当伙伴的行为明显违背了该猜测时,AI 会立即中断自身的工作并重新计算一个新计划。

这项创新的关键在于,这种中断仅在必要时发生。许多现有方法要么一旦开始就从不改变计划,要么改变得过于频繁,从而浪费时间和精力。新系统使用一种统计方法来追踪伙伴可能的技能水平。它会等待证据变得强大且一致之后才采取行动。如果伙伴做了一个可能属于失误的奇特动作,AI 会忽略它;但如果伙伴的行为持续显示出他们在做完全不同于预期的事情,AI 就会停止当前工作并请求一个新计划。这种方法防止了 AI 陷入“明知错误却仍在执行”的死循环。

研究人员在各种厨房布局(包括开放式空间和圆形布局)中测试了这个系统,将其与具有不同烹饪偏好类型的不同伙伴进行配对。他们将这个新智能体与其它方法进行了对比,这些方法要么在固定的时间间隔进行重新规划,要么在特定事件发生时进行重新规划,或者依赖于一个独立的 AI 裁判来决定何时改变计划。结果显示,新智能体在成功交付餐食的数量方面取得了相似或更好的成绩,但它完成任务时的中断次数要少得多。其他方法在每局游戏中可能需要停止并重启计划数十次甚至数百次,而新智能体通常只需要重新规划几次。这种效率源于它能够区分“噪声”与“真正的策略变化”。

至关重要的是,研究表明,拥有关于伙伴角色的正确猜测并不等同于良好的协调。在一组测试中,新智能体和标准智能体在预测伙伴技能方面的准确度几乎相同。然而,标准智能体在伙伴已经改变计划后仍长时间执行过时的计划,导致了大量的重复劳动(即两个智能体尝试执行同一项任务)。相比之下,新智能体通过在正确时机触发行为改变,有效地减少了“信念-行动差距”(即智能体已知真相却未能采取行动的程度)。该研究表明,对于 AI 而言,要实现真正的协作,它不仅需要一个关于伙伴的模型,还需要一个可靠的信号,告知它何时该模型已过时以及何时该切换档位。

研究人员还测试了如果将伙伴的信息仅作为背景上下文输入到规划过程中,还是将其作为直接触发器来停止并重启,哪种效果更好。他们发现,将信息作为触发器使用要有效得多。仅仅告诉 AI “你的伙伴正在做 X”并不能保证它会改变计划。只有当信息被用于主动中断当前动作时,系统才会得到提升。这种区别强调了:理解伙伴的价值在于能够立即根据这种理解来采取行动,而不仅仅是将其保存在记忆中。

尽管取得了这些成功,研究人员也承认了局限性。该系统目前依赖于一组预定义的技能列表(如“切削”或“烹饪”),而不是实时学习新技能。在需要两个智能体完美同步移动的高度耦合环境中,该系统的表现较弱,这表明 AI 底层的规划大脑仍需改进。团队指出,未来的工作需要解决如何自动学习这些技能,以及如何处理策略变化更快的伙伴。不过,目前这项工作展示了一条清晰的前进路径:通过将对伙伴的理解直接与“何时停止并重新开始”的决策相连接,AI 智能体可以从仅仅“观察”队友转向真正地与他们“协作”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →