← 最新论文
🤖 AI

INFA-Guard: Mitigating Malicious Propagation via Infection-Aware Safeguarding in LLM-Based Multi-Agent Systems

本文介绍了 INFA-Guard,一种针对基于大语言模型的多智能体系统的创新防御框架,该框架通过区分并修复受感染的智能体而非依赖二元分类,来缓解恶意传播,从而在保持拓扑完整性的同时显著降低攻击成功率。

原作者: Yijin Zhou, Xiaoya Lu, Dongrui Liu, Junchi Yan, Jing Shao

发布于 2026-01-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Yijin Zhou, Xiaoya Lu, Dongrui Liu, Junchi Yan, Jing Shao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一群由专家级机器人组成的庞大团队(被称为多智能体系统)正在协作解决一个复杂问题,比如规划城市的交通或诊断病人。它们彼此交流、分享想法并就最佳方案进行投票。

这篇论文介绍了一种名为 INFA-GUARD 的新型安全系统,旨在保护这些机器人团队免受一种特定类型的破坏。

问题所在:“僵尸”病毒

在过去,这些机器人团队的安全卫士只寻找两类人:

  1. 坏人: 从一开始就被黑客入侵、试图破坏计划的机器人。
  2. 好人: 本身无辜且运行正常的机器人。

论文指出,这种观点过于简单了。它忽略了第三种危险的群体:被感染者

这就像办公室里的流感爆发:

  • 攻击者: 一个带着流感走进办公室并开始对着大家咳嗽的人。
  • 被感染者: 一个原本健康但因为坐在攻击者旁边而染病的一名同事。他们不是最初的源头,但现在已经病了,并且正在将病毒传播给其他人。
  • 旧有的卫士: 安全团队只把那个带毒进来的感染者赶走。他们却对“被感染”的同事视而不见。结果,被感染的同事继续传播流感,整个办公室还是病倒了。

论文指出,在人工智能机器人团队中,“攻击者”利用具有说服力的论点来诱骗无辜的机器人相信虚假信息。一旦被骗,这些无辜的机器人就会变成“被感染者”。他们天性不坏,但现在正在传播错误的观点。如果你只移除原始攻击者而留下被感染的机器人,破坏仍会持续下去。

解决方案:INFA-GUARD

INFA-GUARD 是一个理解这种“感染”过程的新型安全框架。它就像一位聪明的健康检查员,不仅寻找带来病毒的人,还能识别出谁被传染了以及谁正在传播病毒。

它是如何工作的,分为简单的三个步骤:

  1. 检测感染(雷达):
    它不仅仅是检查一个机器人是“好”还是“坏”,而是观察机器人在一段时间内的交流情况。它会寻找一个健康的机器人在与一个可疑对象交谈后开始表现异常的时刻。它使用一张特殊的团队连接图谱来观察谁在与谁交谈。如果一个机器人表现异常但处于孤立状态,那可能是误报;但如果一个机器人表现异常,且正坐在一个已知的坏人旁边,系统就会将其标记为“被感染”。

  2. 修复团队(分诊):
    一旦系统知道谁是谁,它会采取不同的行动:

    • 针对攻击者: 它将他们彻底踢出团队,并用一个全新的、健康的机器人来替换。这切断了毒素的源头。
    • 针对被感染者: 它并不把他们踢走!相反,它会“治愈”他们。它会提取他们的错误答案,通过重写来去除其中的毒素,然后让他们留在团队中。这保持了团队结构的完整,并确保团队不会损失宝贵的成员。
  3. 保持图谱完整:
    该系统非常小心,不会破坏团队的通信网络。通过修复被感染的机器人而不是直接删除他们,团队能够保持连接并有效地解决问题。

实验结果

作者测试了该系统应对各种类型“攻击”(例如用虚假数据或错误的工具欺骗机器人)的表现。他们发现:

  • 效果更好: 它比以往的安全方法更有效地阻止了坏主意的传播(平均降低了约 33% 的攻击成功率)。
  • 高效: 它不需要大量的额外计算能力,使其具有实用性。
  • 灵活: 无论机器人是以环形、直线还是随机分组的方式排列,它都能很好地工作,并且适用于不同类型的 AI 大脑。

简而言之,INFA-GUARD 意识到,在 AI 团队中,“被坏主意感染”与“天生就是坏人”是两种不同的问题。通过对它们进行区别对待,它挽救了整个团队免于崩溃。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →