← 最新论文
💬 NLP

Triadic Werewolf: A Jester Role for Multi-Hop Theory of Mind in LLMs

本文介绍了“三方狼人杀”(Triadic Werewolf)游戏,这是一个具有多跳心理理论(Theory-of-Mind)基准测试特征的游戏,其包含一个具有反向激励机制的“小丑”阵营,该游戏揭示了当前的语言大模型如何难以应对复杂的三方策略推理,即尽管具备自我学习机制,却往往无法区分真实的怀疑与刻意的欺骗。

原作者: Avni Mittal

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Avni Mittal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:打破“两队制”的习惯

想象你正在玩一场狼人杀游戏。通常情况下,有两个阵营:村民(好人)和狼人(坏人)。村民试图猜出谁是狼人,而狼人则试图隐藏身份。

在这种设定下,如果有人表现得古怪或可疑,村民通常会投票将其投出局。这是一个简单的规则:可疑 = 坏人。

这篇论文的研究人员提出了一个问题:AI 模型是真的在思考其他玩家在想什么,还是仅仅在遵循一个简单的规则?

为了找出答案,他们在游戏中加入了一个第三个、更狡猾的角色:小丑(The Jester)

新角色:小丑

小丑是一个拥有非常奇怪目标的角色:只有当村民把小丑投出局时,小丑才算获胜。

你可以把小丑想象成一个想要被开除的“可疑演员”

  • 村民想开除狼人。
  • 狼人想隐藏身份并开除村民。
  • 小丑则想表现得足够可疑,好让村民把自己开除。

这创造了一个“三方”(Triadic)问题。现在,当一名玩家表现得可疑时,村民必须面对一个更难的问题:

“这个人是狼人(我应该投票开除他),还是小查(我应该不要投票开除他,因为投票开除他会导致我输掉游戏)?”

实验:测试 AI 的大脑

研究人员运行了 60 场游戏,使用了三种不同的强大 AI 模型(GPT-4.1、DeepSeek-V3.1 和 Llama-3.3-70B)。他们通过加入一个“自我学习”功能来测试,即小丑可以阅读前几局游戏的笔记以变得更聪明。

以下是他们的发现,通过比喻进行解释:

1. “作弊码”问题(线索充分性)

在旧有的两队制游戏中,AI 可以通过寻找“可疑行为”来获胜。这就像一个背下了答案表的学生:如果老师皱眉,答案就是错的。

  • 结果: 当加入小丑后,AI 模型失败了。它们无法停止遵循“可疑 = 坏人”这个规则。
  • 小丑的胜利: 因为 AI 不断投票开除那个“可疑”的小丑,导致小丑在 60–70% 的游戏中获胜。AI 太擅长识别“可疑性”了,以至于它不小心帮助了小丑获胜。

2. 狼人的自我破坏

狼人(真正的坏人)本应该保护小丑不被投票出局,因为如果小丑离开了,狼人也会输。

  • 结果: AI 狼人表现得很糟糕。在 60–70% 的游戏中,AI 狼人会在第一天就投票踢走小丑。
  • 比喻: 这就像一个间谍小组投票开除了自己的双面间谍,仅仅因为那个双面间谍表现得“太可疑”,却没意识到开除这个双面间谍实际上是在帮敌人获胜。AI 无法将这些点连接起来:可疑的人 + 小丑的目标 = 不要投票开除他们。

3. “自我学习”循环

研究人员让小丑阅读一份从前几局游戏中总结出的“教训笔记”。

  • DeepSeek-V3.1: 这个模型是最聪明的。它学会了如何在表现得“可疑”的同时,又不显得“过于可疑”。它意识到自己需要既能戏弄村民,又要避免被狼人识破。它变得更擅长赢球了。
  • GPT-4.1: 这个模型本身就已经非常擅长识别“可疑性”,所以“教训笔记”对它帮助不大。事实上,它的表现甚至略有下降,因为它已经达到了靠简单规则能达到的“天花板”。
  • Llama-3.3: 它也有所进步,但不如 DeepSeek 那么明显。

深度探究:AI 到底在想什么?

研究人员查看了 AI 小丑写给自己的“笔记”,以观察它们的思维方式。他们测量了三个层级的“心理理论”(Theory of Mind,即理解他人心理的能力):

  1. 第一层级: “我需要表现得古怪。”(简单)
  2. 第二层级: “我需要表现得古怪,好让村民认为我是狼人。”(较好)
  3. 第三层级: “我需要对村民表现得像个狼人,但对狼人表现得不像个狼人,这样他们就不会保护我。”(复杂)

研究发现: 只有 DeepSeek-V3.1 能够稳定地达到第三层级。它理解了自己必须同时扮演两个不同的角色:对村民来说是“坏人”,对狼人来说是“正常人”。其他模型大多停留在第一或第二层级。

结论

论文得出结论:目前的 AI 模型非常擅长识别模式(如“可疑行为”),但在**多跳推理(multi-hop reasoning)**方面表现挣扎。

  • 简单比喻: 想象一只训练过“听到‘坐下’就坐下”的狗。如果你拿着零食说“坐下”,它会坐下。但如果你拿着另一种代表“待着别动”的零食说“坐下”,它就会感到困惑。
  • 论文观点: AI 模型就像那只狗。它们看到“可疑”就会立即投票“出局”。它们未能意识到,在这个特定的游戏中,“可疑”可以意味着“投票开除”(如果是狼人)或者“保留”(如果是小丑)。

研究人员认为,要真正测试 AI 是否具有“心理理论”,我们需要具有三个竞争目标的游戏(如这个小丑游戏),而不仅仅是两个。目前的“两队制”游戏太容易了,因为 AI 可以通过仅仅遵循简单规则来获胜,而不需要真正理解其他玩家的隐藏动机。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →