← 最新论文
🤖 AI

Differentiable Belief-based Opponent Shaping

本文提出了一种基于可微信念的对手塑造方法(D-BOS),这是一种一阶方法,通过对kk步 softmax-贝叶斯信念动力学进行微分来优化多智能体策略,从而在不依赖硬编码欺骗目标的情况下自然地塑造对手信念,在隐藏角色和混合动机游戏中相较于现有基线实现了更优越的性能。

原作者: Aarav G Sane, Karthik Sivachandran, Rohan Paleja

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Aarav G Sane, Karthik Sivachandran, Rohan Paleja

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正和一群朋友玩一场复杂的“黑手党”或“Among Us”游戏。在这些游戏中,每个人都有秘密角色(如“间谍”或“反派”),而目标不仅仅是为自己做出最佳行动,更是要操控朋友们对你的看法

如果你表现得过于可疑,大家就会识破你是间谍并投票将你淘汰;如果你表现得过于无辜,又可能错失破坏团队的机会。最聪明的玩家不会仅仅被动反应,而是主动尝试塑造群体心中关于“他们是谁”的“心理地图”。

本文介绍了一种名为D-BOS(可微信念导向对手塑造)的新型计算机程序,它教会 AI 智能体如何做到这一点:操控其他玩家对它们的信念

以下是其工作原理的简要解析,辅以简单的类比:

1. 问题所在:“硬编码”的诡计多端者

以往用于欺骗的 AI 方法,就像是一个遵循严格、呆板规则手册的机器人。

  • 旧方法(BBM):想象一个机器人间谍,其内部有一条硬编码指令:“每次我说话时,都必须试图让人们认为我是无辜的。”它盲目地、一步步地执行这一指令。
  • 缺陷:如果机器人试图表现得过于明显,其他玩家会立刻察觉。这就像一个魔术师不断说:“我绝对没有在变魔术!”其他玩家反而意识到其中有诈。

2. 解决方案:“战略傀儡师”(D-BOS)

作者提出了 D-BOS,它更加智能。D-BOS 不再遵循“要欺骗”这样的规则,而是问:“五步之后,我的朋友们会如何看待我?我该如何在当下行动,才能让那个未来的信念帮助我获胜?”

将 D-BOS 想象成一位能预见未来的棋手

  • 将“信念”视为一种状态:在这个系统中,AI 不仅观察棋盘,还观察其他玩家的头脑。它将他们的“信念”(例如“我认为特工 X 是间谍”)视为一种可以推拉的物理对象。
  • “可微”的魔力:“可微”是一个数学术语,本质上意味着 AI 能够精确计算其行动产生的连锁反应。它可以在脑海中运行模拟:“如果我执行行动 A,朋友会认为 X;如果我执行行动 B,他们会认为 Y。哪种想法能让我在后续游戏中获胜?”

3. 工作原理:“时空穿越之镜”

该论文描述了一个 AI 展开"k 步”模拟的过程。

  • 类比:想象你拿着一面镜子,镜中显示的是对手的想法。D-BOS 不仅仅看一次镜子,它会看镜子,然后想象在你行动之后对手会怎么想,接着再想象在那之后对手会怎么想,如此循环,向未来推演数步。
  • 目标:随后,它逆向推导,找出此刻最完美的行动,引导那面镜中的影像走向 AI 获胜的境地。
  • 自然策略:关键在于,AI 并没有被指令去“撒谎”。它只被指令去“获胜”。如果撒谎有助于获胜,它就会撒谎;如果说真话有助于获胜(例如诱骗敌人信任它),它就会说真话。这种策略并非源于僵化的欺骗规则,而是自然地从获胜的渴望中涌现出来。

4. 结果:优于其他方法

作者在三种不同的“游戏”中测试了该 AI:

  1. 营救将军:一款视觉游戏,团队试图拯救或杀死某个角色。
  2. 阿瓦隆:一款带有隐藏角色的社交推理游戏(类似黑手党)。
  3. 硬币游戏:一款带有隐藏动机的简单网格游戏。

研究发现

  • 旧方法(PPO):标准 AI 表现尚可,但并未真正理解其行动如何改变他人的想法。
  • “硬编码”方法(BBM):试图在每一步都进行欺骗的 AI,实际表现不如标准 AI。它过于明显,极易被识破。
  • D-BOS 方法:该 AI 表现最佳,尤其是在社交推理游戏(阿瓦隆)中。它学会了在隐藏敌人身份和向盟友暴露身份之间取得平衡,一切皆为了最大化团队得分。

5. 局限性:“模糊的镜子”

论文也承认了一个局限性。为了预测他人的想法,AI 必须猜测他们看到了什么

  • 类比:如果你试图猜测朋友在想什么,你就必须猜测他们看到了什么。如果你的猜测稍有偏差,而你试图规划十步之后的行动,那个微小的误差就会被放大,导致你的计划分崩离析。
  • 结果:当 AI 规划几步之后(例如三步)时,效果最佳。如果它试图在复杂视觉游戏中规划太远(例如五步),“模糊的镜子”会变得过于扭曲,导致策略失效。

总结

D-BOS 是一种让 AI 学习社交策略的新方法。它不再是一个盲目遵循“欺骗”指令的机器人,而是一位战略思考者,它理解:“我的行动会改变你对我的看法,而你的看法会改变你的玩法。我会选择我的行动,将你的信念引导至有助于我获胜的方向。”

它证明了,在涉及隐藏角色的游戏中,获胜的最佳方式不仅仅是擅长游戏本身,更是要擅长管理其他玩家关于你的故事

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →