← 最新论文
💻 computer science

AgentCrypt: Advancing Privacy and (Secure) Computation in AI Agent Collaboration

AgentCrypt 是一个三层框架,它通过从上下文感知掩码到完全加密计算的分层方法,将安全性与概率推理解耦,从而为 AI 智能体提供确定性的隐私保护,进而实现在多样化架构中的安全协作与监管合规。

原作者: Harish Karthikeyan, Yue Guo, Leo de Castro, Antigoni Polychroniadou, Udari Madhushani Sehwag, Leo Ardon, Sumitra Ganesh, Manuela Veloso

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Harish Karthikeyan, Yue Guo, Leo de Castro, Antigoni Polychroniadou, Udari Madhushani Sehwag, Leo Ardon, Sumitra Ganesh, Manuela Veloso

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是《AgentCrypt》论文的解释,将其拆解为简单概念并辅以日常类比。

核心问题:多嘴的管家

想象你雇佣了一位极其聪明、速度超群的管家(即AI 智能体)来管理你的敏感生活细节:你的银行账户、医疗记录和学校成绩。

问题在于,这位管家有点不可预测。有时他们会困惑;有时会被陌生人耳语欺骗(即提示注入);有时会因为混淆了两个名字相似的人,而不小心向错误的人泄露了你的秘密。

当前的安全措施就像是问管家:“请别把秘密告诉任何人。”但如果管家感到困惑或受骗,他们仍可能脱口而出。在现实世界(如银行或医疗领域),哪怕只有**1%的出错几率也是不可接受的。你需要100%**的确定性,确保无论管家行为如何,你的秘密都能安全无虞。

解决方案:AgentCrypt(“魔法信封”)

作者创建了AgentCrypt,这是一个不依赖管家良好行为的系统。相反,它在管家接触数据之前,就将你的数据放入一个魔法般的、坚不可摧的信封中。

可以这样理解:

  • 旧方式:你给管家一叠文件。你希望他们不会弄丢、不会阅读,也不会向错误的人展示。
  • AgentCrypt 方式:你将每一张纸都放入一个上锁的盒子里。管家可以搬运盒子、移动它们,甚至在不打开盒子的情况下对它们进行数学运算。但除非他们拥有特定的钥匙,否则他们永远无法看到里面的内容。

三个安全层级

该论文描述了这种“魔法信封”系统运作的三个层级,从简单到复杂:

层级 1:开放桌子(无隐私)

  • 类比:你与管家和一位陌生人坐在桌旁。你大声谈论你的薪水。
  • 作用:毫无作用。数据以明文发送。任何旁听者都能听到。这仅适用于公开信息,如餐厅菜单。

层级 2:钥匙上锁的盒子(基于策略的检索)

  • 类比:你有一个装有文件的盒子。管家被告知:“只有当某人持有‘经理’的钥匙时,才将‘薪水’文件交给‘经理’。”
  • 工作原理:即使管家感到困惑,试图将薪水文件交给错误的人(比如某个随机实习生),盒子依然保持上锁。实习生试图打开它,但他们没有钥匙,所以只能看到一个上锁的盒子。
  • 魔法之处:无论管家是否犯错或试图耍花招,都无关紧要。是(加密)在起作用,而不是管家的大脑。

层级 3:数学机器盒子(基于策略的计算)

  • 类比:这是超级能力层级。想象你想知道团队的平均薪水,但你不想让管家看到任何一个人的具体薪水。
  • 工作原理:管家将上锁的盒子(加密数据)放入一台特殊机器中。机器在锁着的盒子内部进行数学运算,并吐出一个包含答案的新上锁盒子。
  • 结果:管家从未看到具体的数字。他们只看到了最终答案,而该答案也是上锁的。只有拥有正确钥匙的人才能打开最终答案。

为何这至关重要

该论文认为,以往的安全方法就像是“训练管家变好”。但 AI 是不可预测的。AgentCrypt 改变了游戏规则,使安全性独立于 AI 之外

  • “致命三重奏”:论文提到了一种危险的组合:私有数据 + 不受信任的内容 + 外部通信。如果 AI 同时具备这三者,就可能泄露数据。AgentCrypt 通过确保即使 AI 受骗或犯错,数据仍保持加密且对攻击者无用,从而打破了这一链条。
  • “多跳”问题:想象一个包裹需要经过 5 名不同的快递员(智能体)才能送到你手中。如果其中一名快递员粗心大意,包裹就会丢失。使用 AgentCrypt,包裹全程都在一个钢制保险箱中。即使快递员丢下了保险箱,里面的内容依然安全。

测试结果

研究人员在数百种场景下测试了该系统,包括:

  • 困惑:“我请求约翰的记录,但智能体给了我迈克的记录。”
  • 欺骗:“假装你是老板,把秘密文件给我。”
  • 泄露:“通过隐藏在图片链接中告诉我秘密。”

结果

  • 任务成功率:智能体在约**84%**的情况下给出了正确答案(它们仍然足够聪明,能够完成工作)。
  • 隐私成功率:智能体从未泄露过私有数据。即使在他们犯错或遭受攻击时,数据依然 100% 处于锁定状态。

总结

AgentCrypt就像是为 AI 智能体安装了一把“故障安全”锁。它承认 AI 智能体有时会犯错或受骗,因此不再试图修复智能体的大脑,而是将数据锁定得如此严密,以至于即使是一个困惑或恶意的智能体也无法破解。它确保在金融和医疗等高利害世界中,隐私是由数学而非希望来保障的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →