← 最新论文
🤖 AI

Dreaming Of Others: Latent Teammate Modeling In World Models For Multi-Agent Reinforcement Learning

本文提出了一种新颖的多智能体强化学习框架,该框架通过将潜在状态分解为环境和队友组件,并利用心智理论(Theory-of-Mind)头部来推断伙伴意图,从而增强了类 Dreamer 的世界模型,进而使智能体能够通过模拟社会行为来实现零样本和少样本协调。

原作者: Tomas Leroy-Stone

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Tomas Leroy-Stone

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:梦见你的队友

想象一下,你正在和搭档一起玩一款复杂的电子游戏。你可以看到游戏世界,但你无法看到搭档的屏幕、他们的想法或他们的秘密计划。你只能看到他们的行为。

在人工智能(AI)领域,这是一个巨大的问题。大多数学习玩游戏的 AI 系统(被称为“世界模型”,World Models)非常擅长预测环境的变化(比如重力或墙壁)。但当涉及到预测队友会做什么时,它们通常会将队友视为随机的静态噪声或恶劣的天气。它们只是在瞎猜:“也许他会向左走,也许会向右走,”而并没有真正理解其中的原因

这篇论文提出了一种构建这类 AI 大脑的新方法。作者建议,不要将队友视为随机噪声,而是要教 AI 将队友视为具有独特个性与目标的可预测、结构化的角色

“梦境者”(Dreamer)引擎

要理解这一点,你首先需要了解什么是“Dreamer”。可以将 Dreamer 想象成一个通过白日梦来学习的 AI。

  • 与其在现实中玩一百万次游戏(这太慢了),AI 会构建一个世界的心理地图。
  • 它闭上眼睛,在脑海中模拟成千上上万种场景:“如果我跳到这里,墙会倒塌。如果我向左走,敌人会出现。”
  • 它通过在想象中进行练习来学习游戏的规则,而不仅仅是通过试错法。

问题所在:“幽灵”队友

问题在于,在团队游戏中,“规则”会因为搭档改变主意而发生变化。

  • 旧方法: AI 认为:“我的搭档是不可预测的。我只能听天由命。”这就像是在开车时,假设另一位驾驶员可能会毫无理由地突然转向左侧或右侧。
  • 新方法(本论文): AI 意识到:“我的搭档并不是随机的。他们有一种‘风格’。也许他们很谨慎,或者也许他们很激进。我需要弄清楚他们的风格才能预测他们。”

解决方案:“队友解码器”

作者提出了一个全新的架构,将 AI 的心理地图拆分为两个截然不同的部分,就像一条双车道高速公路:

  1. 环境车道: 这部分追踪物理世界(墙壁、目标、重力)。
  2. 队友车道: 这是新的发明。它追踪搭档的隐藏状态

AI 使用一种特殊的工具,称为**“心智理论”(Theory of Mind, ToM)头部**。你可以把它想象成一个夏洛克·福尔摩斯模块

  • 它观察搭档的行为(例如:“他们捡起了一把钥匙,但没有使用它”)。
  • 它推断出一个隐藏的“潜码”(一种数字指纹),代表了搭档的意图性格
  • 它会自问:“这个搭档是‘冲锋型’?还是‘策略型’?”

实际运作方式

一旦 AI 拥有了这个“队友车道”和“夏洛克·福尔摩斯”模块,它改变了“做梦”的方式:

  • 之前: AI 做梦时想:“如果我走到这里,世界会发生变化。”
  • 现在: AI 做梦时想:“如果我走到这里,且我的搭档是‘冲锋型’,他们会跟随我;如果他们是‘策略型’,他们会等待。”

通过在想象中模拟不同版本的搭档,AI 可以为遇到的任何人做好准备。

  • 零样本协作(Zero-Shot Coordination): AI 可以遇到从未见过的搭档,并且仍然能立即与之高效配合,因为它可以通过寥寥数步快速猜出对方的风格。
  • 少样本适应(Few-Shot Adaptation): 如果搭档在游戏过程中改变了主意,AI 会立即更新其“夏洛克·福尔摩斯”式的猜测,并迅速调整计划。

这篇论文实际声称的内容

需要注意的是,这篇论文目前尚未实现以下内容:

  • 无实验结果: 作者承认这目前是一个提议。他们设计了蓝图和数学模型,但还没有建造出完整的机器人并进行测试。
  • 无现实应用: 他们并不是在声称这能立刻解决交通问题或治愈疾病。他们严格讨论的是如何改进 AI 在合作类电子游戏和模拟环境中的表现。

最终目标

最终目标是创造出一种不仅理解世界,而且理解世界内部思想的 AI。通过将队友视为结构化的、可学习的角色,而非随机噪声,AI 可以成为人类和其他 AI 更优秀、更具适应性的伙伴。

简而言之: 这篇论文建议教导 AI 不要仅仅去猜测搭档会做什么,而是开始建模他们,以便在想象中与他们共同预见未来,而不仅仅是在他们周围进行想象。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →