← 最新论文
💻 computer science

LCGuard: Latent Communication Guard for Safe KV Sharing in Multi-Agent Systems

LCGuard 是一个通过应用对抗性训练来转换共享 KV 缓存以保障多智能体大语言模型系统中潜在通信安全的框架,该方法在保留任务相关语义的同时,有效防止了对敏感的智能体特定信息的重建。

原作者: Sadia Asif, Mohammad Mohammadi Amiri, Momin Abbas, Prasanna Sattigeri, Karthikeyan Natesan Ramamurthy

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Sadia Asif, Mohammad Mohammadi Amiri, Momin Abbas, Prasanna Sattigeri, Karthikeyan Natesan Ramamurthy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一支由专家侦探组成的团队,他们协同合作以侦破一起复杂的案件。在旧的方式中,他们会用 plain English(普通英语)书写便条传递信息。如果侦探 A 写道:“我在银行附近发现了一只红鞋”,侦探 B 读到后便能理解。但如果侦探 A 不小心写道:“我在银行附近发现了一只红鞋,顺便提一下,我的秘密家庭住址是枫树街 123 号”,那么这一秘密便向所有人暴露了。

问题:“思维便条”泄露
最近,这些侦探团队(AI 智能体)开始以一种全新的、超高速的方式传递便条。他们不再书写完整句子,而是传递“思维快照”(称为KV 缓存)。这些快照如同侦探原始、未经过滤的思绪与记忆。它们比纯文本更易于快速共享,且包含更丰富的细节。

然而,其中存在一个隐患。正如人类大脑在思考“红鞋”时仍会保留其秘密家庭住址,这些“思维快照”也秘密地包含了敏感信息(如私人用户数据或机密上下文),而这些是侦探从未打算分享的。由于这些快照复杂且隐蔽,无人能轻易检查其中究竟藏有何种秘密。狡猾的黑客可以窃取这些快照,并利用特殊解码器重构侦探的私人秘密,即便侦探从未用普通英语将其写下。

解决方案:LCGuard(“隐私过滤器”)
该论文提出了LCGuard(潜在通信守卫)。可将 LCGuard 想象为一个智能、无形的过滤器,位于侦探们传递思维快照之前。

  1. 转换过程:在侦探 A 将“思维快照”传递给侦探 B 之前,LCGuard 会通过一台特殊机器对其进行处理。
  2. 目标:这台机器被训练为同时完成两件事:
    • 保留有用信息:确保“红鞋”和“银行”等细节保持清晰,以便侦探 B 仍能破案。
    • 扰乱秘密:通过数学方式扭曲或移除隐藏的“家庭住址”细节,使得即便黑客窃取快照,也无法重构秘密。

如何训练它(“猫鼠游戏”)
为了构建这一过滤器,研究人员设计了一场训练游戏:

  • 窃贼(对抗者):一个计算机程序试图查看经过过滤的快照,并猜测秘密家庭住址。
  • 守卫(LCGuard):过滤器尝试仅对快照进行适度修改,使窃贼无法成功,同时不破坏完成任务所需的“红鞋”细节。

他们反复进行这场游戏。窃贼的猜测能力不断提升,迫使守卫在隐藏秘密方面变得更加出色。最终,守卫学会了完美的平衡:既保持团队高效,又使秘密无法被恢复。

研究发现
研究人员使用不同 AI 侦探团队在各种谜题(基准测试)上对该系统进行了测试。

  • 无守卫:团队快速且聪明,但“窃贼”能轻易窃取秘密(泄露率高)。
  • 添加噪声(其他方法):有些方法尝试仅向快照添加静态噪声。这虽能有效隐藏秘密,但也使“红鞋”细节变得模糊,导致团队无法完成谜题。
  • 使用 LCGuard:团队保持快速且聪明(高性能),而“窃贼”几乎每次都无法猜中秘密。

总结
LCGuard 是为直接共享“思维”的 AI 团队提供的一张安全网。它充当隐私过滤器,从共享的思维数据中清除敏感的个人细节,同时保留有用信息的完整性,确保团队能够高效协作,而不会意外暴露私人秘密。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →