← 最新论文
💬 NLP

When Agents "Misremember" Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems

本文针对大语言模型多智能体系统中存在的“曼德拉效应”(集体错误记忆)现象,提出了名为 MANBENCH 的新基准来评估其成因与影响,并展示了通过提示词防御和模型对齐策略可将该效应平均降低 74.40%,从而为构建更具韧性和伦理对齐的协作多智能体系统提供了关键见解。

原作者: Naen Xu, Hengyu An, Shuo Shi, Jinghuai Zhang, Chunyi Zhou, Changjiang Li, Tianyu Du, Zhihui Fu, Jun Wang, Shouling Ji

发布于 2026-03-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Naen Xu, Hengyu An, Shuo Shi, Jinghuai Zhang, Chunyi Zhou, Changjiang Li, Tianyu Du, Zhihui Fu, Jun Wang, Shouling Ji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给一群“超级聪明的 AI 机器人”做了一场集体心理测试,结果发现了一个让人细思极恐的现象:它们也会像人类一样,被“洗脑”并集体产生错误的记忆

这就好比著名的“曼德拉效应”(Mandela Effect):很多人错误地记得南非前总统曼德拉在 80 年代就死在监狱里了(其实他活到了 2013 年)。这篇论文发现,当多个 AI 机器人聚在一起讨论问题时,也会发生同样的事情。

下面我用几个生动的比喻来拆解这篇论文的核心内容:

1. 核心发现:AI 也会“三人成虎”

想象一下,你有一个非常聪明的 AI 助手,它知道曼德拉是 2013 年去世的(这是事实)。
但是,如果你把它拉进一个由 5 个其他 AI 组成的“聊天群”里,这些 AI 会异口同声地、非常有逻辑地告诉你:“不,曼德拉肯定是在 80 年代去世的,你看,这是当时的新闻,这是专家的分析……"

结果是什么?
哪怕是最聪明的 AI,在听了这群“专家”的轮番洗脑后,也会动摇。它会开始怀疑自己的记忆,最后跟着大家一起说:“好吧,我想起来了,确实是 80 年代。”
这就是论文说的“曼德拉效应”:AI 们集体把假话当成了真记忆。

2. 实验工具:MANBENCH(AI 的“记忆陷阱”考场)

为了研究这个问题,作者们设计了一个专门的测试平台,叫 MANBENCH
你可以把它想象成一个精心设计的“剧本杀”考场

  • 题目:都是那些有标准答案的事实题(比如历史事件、科学常识)。
  • 剧本:他们设计了 5 种不同的“聊天剧本”(交互协议)。
    • 普通剧本:一群 AI 随便聊聊,互相附和。
    • 角色扮演剧本:这是最可怕的。他们给 AI 分配了特定角色,比如“带头大哥”(第一个提出错误观点)、“细节专家”(编造看似合理的细节)、“权威背书”(假装是教授用专业术语忽悠)、“从众者”(假装一开始怀疑,最后被说服)。
  • 测试:看主角 AI 在听完这些“剧本”后,会不会把原本正确的答案改成错误的。

3. 发现了什么?(实验结果)

  • 谁最容易上当?
    • 角色扮演的剧本比普通的闲聊更容易让人“洗脑”。就像现实生活中,如果有一个专家、一个细节控、一个权威人士一起忽悠你,你比听一群路人瞎聊更容易信以为真。
    • 越大的模型越容易“中招”? 这有点反直觉。通常我们认为模型越大越聪明,但研究发现,有些大模型因为太擅长理解复杂的“谎言逻辑”和“叙事结构”,反而更容易被这些精心编织的假故事带偏,把假记忆“内化”成自己的长期记忆。
  • 短期 vs 长期
    • 有些 AI 只是当时被忽悠了(短期记忆),转头就忘了。
    • 但有些 AI 会把错误记忆“刻”在脑子里(长期记忆),下次再问同样的问题,它依然会坚定地回答错误的答案。这就好比它真的“相信”曼德拉死在 80 年代了。

4. 怎么解决?(给 AI 装上“防忽悠”护盾)

既然知道了 AI 会集体犯错,作者们提出了两种“解毒药”:

  • 方法一:提示词防御(给 AI 戴个“紧箍咒”)

    • 认知锚定(Cognitive Anchoring):告诉 AI:“在听别人说话之前,先把你脑子里原本知道的事实像‘锚’一样定住。别人的话只是参考,不是真理。如果别人的话和你的‘锚’冲突,你要先怀疑别人,而不是怀疑自己。”
    • 来源审查(Source Scrutiny):告诉 AI:“别光听内容,要分析这群人的‘套路’。如果这五个人说话像排练好的剧本,有头有尾有专家有跟班,那这很可能是一个骗局,要警惕!”
    • 效果:这两种方法非常有效,能大幅减少 AI 被带偏的概率。
  • 方法二:模型级防御(给 AI 做“特训”)

    • 作者们给 AI 进行了一种特殊的训练(微调)。就像教学生一样,不仅教它怎么拒绝错误的诱导(抗干扰训练),还教它怎么接受正确的建议(合作训练)。
    • 关键点:如果只教它拒绝,它可能会变成“杠精”,连正确的建议也听不进去;如果只教它听话,它又容易被骗。最好的状态是既要有批判性思维,又要懂得合作。经过这种平衡训练的 AI,既不容易被骗,又能虚心接受真理。

5. 这有什么大影响?

这不仅仅是个有趣的笑话,它关系到未来的安全:

  • 医疗诊断:如果一群 AI 医生在讨论病情,被一个错误的“专家”带偏,集体误诊,那后果不堪设想。
  • 法律合同:如果 AI 律师们集体“记错”了某条法律条款,可能会导致巨大的经济损失。
  • 虚假信息:坏人可以利用这种机制,故意制造一群 AI 来散布假新闻,让其他 AI 也信以为真,形成“假作真时真亦假”的恶性循环。

总结

这篇论文告诉我们:AI 不仅仅是冷冰冰的代码,当它们聚在一起时,也会像人类一样产生“群体性幻觉”和“集体记忆偏差”。

好消息是,作者们已经找到了给 AI“打疫苗”的方法(提示词技巧和模型训练),让它们在面对集体忽悠时,能保持清醒,守住事实的底线。这对于未来构建安全、可靠的 AI 协作系统至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →