← 最新论文
🔢 mathematics

Securing Multi-Agent Systems Against Corruptions via Node Contribution Backpropagation

本文提出了一种名为节点贡献反向传播的动态防御范式,该范式将多智能体系统通信建模为有符号有向无环图,通过反向传播计算单个智能体的贡献,从而实现对恶意智能体的精准识别与隔离,以保障协作任务免受对抗性破坏。

原作者: Chengcan Wu, Zhixin Zhang, Mingqian Xu, Zeming Wei, Meng Sun

发布于 2026-05-27
📖 1 分钟阅读🧠 深度阅读

原作者: Chengcan Wu, Zhixin Zhang, Mingqian Xu, Zeming Wei, Meng Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创意类比对这篇论文的解读。

问题:群聊中的“害群之马”

想象一支由专家 AI 助手组成的团队,共同解决一个难题,就像一群侦探试图侦破一起案件。这被称为多智能体系统(MAS)。它们彼此交流、分享线索,并对最终答案进行投票。

问题在于,其中一名侦探可能是一个“恶意行为者”(恶意智能体)。它不提供帮助,反而向其他人耳语虚假信息。由于团队互相信任,谎言像病毒一样传播。一名侦探相信了谎言,告诉另一名侦探,很快整个团队都被说服接受了错误的结论。这被称为腐败攻击

现有的防御措施就像只检查人们说话内容的保安。如果恶意行为者说了听起来合理但实际上是谎言的话,保安就会漏掉它。其他防御措施虽然关注团队结构,但假设团队永远不会改变成员或角色,而这在现实世界中并不成立。

解决方案:“反向计分卡”方法

作者提出了一种名为**BPD(反向传播检测)*的新方法。把它想象成一名聪明的侦探,它不仅仅听人们说了什么,而是追踪每一个词对最终裁决的影响*,一直回溯到源头。

以下是其工作原理,分步说明:

1. 绘制地图(有向无环图 DAG)

首先,系统绘制一张对话地图。想象一条时间线,每当一个智能体发言,就像火车线路上的一个新站点。

  • 节点:站点(特定时间点的智能体)。
  • :连接它们的轨道(谁对谁说了话)。
  • 标志:每条轨道都有一个标志:如果倾听者表示同意,则为绿色(+1);如果不同意,则为红色(-1);如果忽略,则为灰色(0)

这就形成了一个“有符号有向无环图”(一种带有彩色轨道的单向地图的通俗说法)。

2. “反向传播”(追踪涟漪)

通常,我们向前思考:“我说了 X,所以你说了 Y。”
BPD 则向后工作。它从团队最终决定的答案开始,一直回溯。

  • 问题:“究竟是谁推动我们走向了这一最终答案?”
  • 数学计算:系统运行一种计算(类似于谷歌 PageRank 对网站排名的方式),从最终答案反向回溯到开始。
  • 逻辑
    • 如果最终答案是正确的,那些赞同正确路径的智能体将获得高分
    • 如果某个智能体推动团队走向错误答案,它将获得低分(或负分)
    • 关键在于,如果恶意行为者欺骗了一名良性智能体,该恶意行为者的“影响力分数”会沿着链条传递。系统会精确计算出每个智能体对最终结果应得多少功劳责任

3. 发现异常值

一旦每个人都有了分数,系统就会寻找那些格格不入的个体。

  • 想象一个班级,每个人的分数都是 80 分,唯独一个学生得了 -50 分。那个学生很可能就是捣乱者。
  • BPD 会标记那些分数与群体平均值严重偏离的智能体。这些就是恶意智能体

4. “手术”(修复图结构)

一旦识别出恶意智能体,系统就会进行“手术”。它切断来自该恶意智能体的通信线路。这相当于说:“忽略这个人说的一切。”然后,团队在没有该不良影响的情况下重新运行对话,以获取正确答案。

为何这更好(结果)

该论文针对各种“攻击”测试了这种方法,在这些攻击中,恶意行为者试图以不同方式欺骗团队:

  • “微妙的谎言”:仅改变几个词,使错误答案看起来正确。
  • “安全陷阱”:假装正常问题很危险,以阻止团队回答。
  • “移动目标”:在对话中途改变团队结构或恶意行为者的身份。

发现结果

  • 准确性:BPD 在90% 以上的情况下成功识别出恶意智能体,击败了所有其他现有方法。
  • 韧性:即使团队结构发生变化(动态图),BPD 也能完美运行,而其他方法则失效。
  • 速度:该方法非常快。它仅增加约**10%**的对话时间,为了安全付出这一小点代价是值得的。
  • 无需训练:与其他需要“学习”恶意智能体长什么样(这需要时间和数据)的方法不同,BPD 只需观察对话流程即可当场做出判断。

总结类比

想象一群朋友正在决定去哪里吃晚饭。

  • 旧防御:一位朋友检查每个人的菜单选择是否看起来“安全”。一个狡猾的朋友可能会建议一家看起来很安全但实际很糟糕的餐厅,于是大家就去了那里。
  • BPD:一位朋友查看最终决定(“我们要去披萨店”)。他们回溯追踪:“谁提议了披萨?谁同意了?谁反对了?”他们意识到,尽管其他人都说讨厌披萨,但有一位朋友一直在极力推动披萨,而且该朋友的建议导致了糟糕的结果。于是,团队在下次决策时忽略该朋友的建议。

这篇论文证明,通过数学化地追踪谁影响了最终决策,我们可以识别并清除 AI 团队中的“害群之马”,从而保持整个系统的安全和准确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →