← 最新论文
🤖 machine learning

Can AI Agents Agree?

该论文通过大规模模拟实验发现,当前基于大语言模型的智能体群组即使在无利益冲突的拜占庭共识场景中,也难以可靠地达成一致,且随着群体规模扩大或恶意节点引入,其表现会进一步恶化,主要失败模式为超时或停滞等活性丧失而非数值篡改。

原作者: Frédéric Berdoz, Leonardo Rugli, Roger Wattenhofer

发布于 2026-03-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Frédéric Berdoz, Leonardo Rugli, Roger Wattenhofer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个非常有趣且关键的问题:当一群人工智能(AI)像人类一样开会讨论并试图达成一致时,它们真的能“达成共识”吗?如果其中混进了几个“捣乱分子”,情况又会怎样?

为了让你轻松理解,我们可以把这项研究想象成一场**“超级复杂的线上投票游戏”**。

1. 游戏背景:一群 AI 在开“头脑风暴”会

想象一下,你组织了一个由 4 到 16 个 AI 助手组成的委员会。

  • 任务:大家要在一个数字(比如 0 到 50 之间)上达成一致。
  • 规则
    1. 每个 AI 先提出一个自己心里的数字。
    2. 大家互相交流,告诉对方自己为什么选这个数字。
    3. 经过几轮讨论后,大家必须投票决定:“是继续讨论,还是停止并确认最终数字?”
    4. 胜利条件:只要大家最终选出的数字是一样的,就算成功。至于这个数字具体是 10 还是 20,其实并不重要(这叫“无利益冲突”),重要的是大家能不能统一口径

2. 实验发现:AI 们其实挺“笨”的

研究人员让不同大小的 AI 团队(4 人、8 人、16 人)玩这个游戏,结果让人大跌眼镜:

  • 即使没有坏人,也很难达成一致
    想象一下,即使所有 AI 都是诚实的、想好好合作的,它们也经常聊不到一块去

    • 人数越多,越乱:4 个人的小团队还能勉强达成一致,但一旦变成 16 个人的大团队,大家就像在嘈杂的集市里喊话,互相听不清,最后经常因为讨论太久而超时(就像会议开到了下班时间还没结论,大家直接散会了)。
    • 模型越大,越聪明但越犹豫:更先进的 AI(Qwen3-14B)比旧一点的(Qwen3-8B)表现好一些,但它们依然经常陷入“死循环”,无法做出决定。
  • 最大的问题不是“选错”,而是“选不出”
    最有趣的发现是,AI 们很少故意选一个错误的数字(比如大家都同意选 50,结果选成了 49)。
    相反,它们最大的问题是**“聊崩了”。它们要么因为太谨慎而不敢投票,要么因为互相的推理逻辑太复杂而卡住,导致永远无法结束会议**。这就好比一群人想决定中午吃什么,结果讨论了半小时,最后谁也没敢拍板,大家饿着肚子散了。

3. 捣乱分子(拜占庭故障):只要有一个“内鬼”,全盘皆输

接下来,研究人员在团队里混进了几个“捣乱分子”(也就是论文中的Byzantine Agents)。这些捣乱分子的任务很简单:故意说胡话,或者提出奇怪的建议,试图让会议无法达成结论。

  • 只要有一个,就完了
    实验发现,哪怕 8 个诚实的 AI 里只混进1 个捣乱分子,达成有效共识的概率就会断崖式下跌
  • 捣乱的方式
    这些捣乱分子不需要很聪明。它们只需要提出一些模棱两可的建议,或者在投票时故意拖延,诚实的 AI 们就会陷入混乱。它们会想:“那个家伙是不是在骗我?我是不是该再等等?”结果就是,会议再次因为无法达成一致而超时

4. 核心比喻:一场失败的“接力赛”

你可以把这项研究想象成一场接力赛

  • 理想情况:每个 AI 都是优秀的运动员,只要大家配合好,就能把“共识”这个接力棒顺利传下去。
  • 现实情况
    • 人数多了:就像接力队人太多,前面的人还没跑完,后面的人就乱了阵脚,大家互相撞在一起。
    • 有了坏人:就像接力队里混进了一个故意把棒子扔进河里的人。哪怕只扔一次,整个队伍就彻底瘫痪了。
    • 结果:大多数时候,比赛根本没有结束(超时),而不是谁输谁赢的问题。

5. 这对我们意味着什么?

这篇论文给现在的 AI 应用敲了一记警钟:

  1. 别太依赖 AI 自动做决定:如果你指望一群 AI 自动开会、投票并做出一个可靠的决定(比如在自动驾驶车队协调路线,或者在金融交易中达成共识),目前的技术还不可靠。它们很容易因为“沟通不畅”而卡死。
  2. 规模效应是双刃剑:我们总以为 AI 越多越聪明,但在这个场景下,人越多,越容易乱
  3. 安全漏洞:即使只有极少量的恶意 AI 混入,也足以破坏整个系统的稳定性。

总结一句话
目前的 AI 就像一群虽然很聪明、但缺乏“团队默契”且容易“想太多”的学生。在没有坏人干扰时,它们经常因为犹豫不决而开不成会;一旦混进一个捣乱分子,整个班级就彻底乱套了。在让 AI 真正承担关键决策任务之前,我们还需要解决如何让它们“好好说话、快速拍板”的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →