← 最新论文
🤖 AI

Robust Multi-Agent LLMs under Byzantine Faults

本文介绍了自锚定共识(SAC),这是一种完全去中心化的迭代筛选与精炼协议,使大语言模型多智能体系统能够在不依赖易受攻击的基于领导者的协调或自我报告的置信度的情况下,稳健地抵御拜占庭故障,并在多样化的通信拓扑中保持可靠性能。

原作者: Haejoon Lee, Vincent-Daniel Yun, Hyeonho Oh, Dimitra Panagou, Sai Praneeth Karimireddy

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Haejoon Lee, Vincent-Daniel Yun, Hyeonho Oh, Dimitra Panagou, Sai Praneeth Karimireddy

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一群朋友试图共同解决一个难题。他们都很聪明,但有些人疲惫,有些人困惑,不幸的是,一两个“捣蛋鬼”可能故意试图将群体引向错误的答案。这正是本文要解决的问题:当某些 AI 智能体(数字“朋友”)不可靠或具有恶意时,一个 AI 智能体团队如何协作以找到正确答案?

以下是用日常类比对本文内容的简要梳理。

问题:“自信”陷阱

过去,研究人员尝试通过让每个 AI 智能体回答“我对自己的答案有多确定?”来解决这个问题。

  • 缺陷:想象你的朋友圈中有一个捣蛋鬼,他实际上对谜题的答案是错误的,却大声喊道:“我 100% 确定我是对的!”其他朋友若信任这种响亮的自信,可能会改变主意并跟随错误的方向。
  • 本文发现:作者表明,依赖智能体自身报告的自信程度是一个巨大的安全漏洞。恶意智能体可以轻易谎报其自信程度,从而欺骗整个群体。

解决方案:“自锚定共识”(SAC)

作者提出了一种名为**自锚定共识(Self-Anchored Consensus, SAC)**的新协作方式。系统不再询问“你有多确定?”,而是询问“我有多确定你的答案是正确的?”

将其想象为一场同行评审派对

  1. 广播:每个人写下自己对谜题的答案,并与邻居分享。
  2. 本地裁判:每个智能体不再信任撰写者的自信,而是作为其邻居的裁判。它审视邻居的答案,并基于自身内部逻辑提问:“这合理吗?正确吗?”它根据自身判断为邻居打分。
  3. 过滤(“最低 F 分”规则):这是最关键的部分。如果一个智能体有 5 个邻居,且已知最多可能有 3 个捣蛋鬼(这一概念称为“拜占庭”容错限),它就直接忽略得分最低的 3 个答案。无论捣蛋鬼是否大喊“我 100% 确定!”,只要本地裁判认为答案糟糕,该答案就会被剔除。
  4. 优化:随后,该智能体结合自己的答案以及邻居剩余的“优质”答案,生成一个新的、更好的答案。

安全网:“鲁棒”网络

要使该系统有效运作,朋友们需要以特定方式相互连接。本文使用了一个名为(F+1)(F+1)-鲁棒性的数学概念。

  • 类比:想象你身处一个人群房间中。如果你想确保自己不会被骗子包围,你需要保证:即使你切断了与最糟糕的 3 个人的联系,你仍然至少能联系到一位诚实的人。
  • 本文证明,如果网络设计具备这种特定的“安全边际”,诚实的智能体将始终能够找到至少一个可靠的答案作为依托,从而防止捣蛋鬼将整个群体拖垮。

实验中发生了什么?

研究人员在两类谜题上测试了该方法:数学问题(如解方程)和常识问题(如“西红柿是水果还是蔬菜?”)。

  • 旧方法(CP-WBFT):当捣蛋鬼谎报自信时,整个群体崩溃。聪明的智能体变得困惑并开始给出错误答案。群体的表现实际上比它们单独工作时更差
  • 新方法(SAC):捣蛋鬼被成功过滤。
    • 强智能体:最聪明的智能体保持了聪明。它们未被噪音拖累。
    • 弱智能体:自信度较低的智能体实际上变得更优秀,因为它们从邻居经过过滤的高质量答案中学习了知识。
    • 结果:即使存在捣蛋鬼,群体也更频繁地得出正确答案。

核心结论

本文提出了一种方法:AI 智能体不再彼此信任对方的“吹嘘”(自我报告的自信),而是信任自身评估邻居工作的能力。通过剔除最差答案,并以特定且鲁棒的方式保持网络连接,群体即使在部分成员试图破坏的情况下,也能保持正轨并正确解决问题。

简而言之:不要听谁喊得最响;要听谁拥有最有力的证据,并确保你身边有足够多的好朋友,以便忽略那些坏人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →