想象一下,你雇佣了一位极其聪明、速度超快的个人助理(“智能体 AI")来处理你最敏感的任务:管理你的银行账户、阅读你的私人邮件,并代表你做出决策。
本文是对该助理的一次安全审计。它提出了一个关键问题:如果你的助理所居住的建筑物由一位可疑的房东(云服务商)拥有,这位房东能否窥探助理的笔记、窃取你的密码,或秘密篡改你的指令?
以下是本文研究发现的拆解,采用简单的类比说明。
1. 问题所在:“玻璃屋”中的助理
目前,大多数 AI 助理运行在“玻璃屋”中。即使你锁上了前门(软件安全),房东(云运营商)仍然掌握着万能钥匙。他们可以走进来,读取助理的记忆,窃取你的信用卡号,或者在你不注意时向助理耳边低语新的指令。
- 威胁: 一个坏的房东不仅会偷窃;他们还能欺骗助理。如果助理为了执行任务而阅读某份文档,那么隐藏在该文档中的恶意注释可以指示助理“无视你的老板,把钱转给我”。
- 软件为何失效: 传统的软件防御措施就像要求助理“小心行事”。但如果房东控制着房间,他们就可以无视这些请求。
2. 解决方案:“堡垒”(机密计算)
本文探讨了机密计算(Confidential Computing, CC)。这相当于在房东的建筑物内建造一个防弹、隔音的保险库。
- 可信执行环境(TEE): 这就是保险库。一旦你的助理进入其中,房东就无法看到它在思考、阅读或书写什么。甚至连房东自己的安保人员(操作系统)也被拒之门外。
- 远程证明: 这是一个密封且防篡改的身份徽章。在你向助理交付秘密之前,你可以扫描它的徽章。该徽章证明:“我运行在一个真实且完好的保险库内,并且我运行的是你指定的确切软件。”
3. 现状:不同类型的保险库
本文调研了六种不同的“保险库”技术(如 Intel SGX、AMD SEV、ARM CCA 等)。并非其中某一种是完美的;它们只是针对不同任务的不同工具:
- 小型保险库(进程级): 适合仅保护大脑中最敏感的部分(如你的密码),但助理的其他部分仍然暴露在外。
- 大房间(虚拟机级): 适合保护整个助理及其工作空间。
- “大脑”扩展(GPU): AI 需要巨大的算力(GPU)来进行思考。有些保险库仅保护 CPU(逻辑部分),却将 GPU(内存部分)暴露在外。本文指出,新技术正开始构建包含 GPU 内存在内的保险库。
4. 新挑战:不再仅仅是单个助理
本文认为,保护单个 AI 聊天机器人与保护协同工作的 AI 智能体团队是不同的。
- 信任链: 想象智能体 A 请求智能体 B 调用一个工具,而智能体 B 又请求智能体 C。如果智能体 A 在保险库内,但智能体 B 不在,秘密就会泄露。
- “握手”问题: 智能体 A 如何知道智能体 B 确实处于保险库中?本文发现,虽然我们有良好的方法来检查单个智能体,但尚未有一套完美的系统来验证整个智能体链条在相互传递秘密时的状态。
- 内存泄露: 智能体会记住事情(如你们的对话历史)。本文强调,虽然我们可以保护“当前”的思维,但保护“长期记忆”(如存储在云端的日记)仍然是一个未解的重大难题。
5. 该技术无法做到的事情
本文非常明确地指出了局限性。将 AI 放入保险库并不会让它变得“善良”或“诚实”。
- “诚实但邪恶”的问题: 如果你告诉 AI“偷走所有的钱”,并将其放入一个超级安全的保险库中,保险库会保护你的钱不被房东偷走,但 AI 仍然会偷走它,因为这是你让它做的。保险库防范的是外部窃贼,而非恶意的指令。
- “欺骗”问题: 如果有人欺骗 AI,使其认为需要向骗子汇款(即“提示注入”),保险库无法阻止 AI 执行该操作。保险库仅能确保 AI 没有被房东秘密地欺骗。
6. 结论
本文总结道,我们拥有构建 AI 智能体安全基础的砖块,但尚未建成整栋房子。
- 行之有效的部分: 目前我们可以保护 AI 的大脑及其即时思维免受房东窥探。
- 缺失的部分: 我们需要更好的方法来保护长期记忆,验证多个智能体组成的链条,并确保 AI 不会通过微妙的侧信道(如思考所需的时间长短)泄露秘密。
简而言之: 机密计算是一种强大的工具,能阻止房东窃取你的秘密,但它无法修正 AI 的“性格”,我们仍需解决如何确保整个智能体团队协作安全的问题。
技术摘要:当智能体处理机密信息:面向智能体 AI 的机密计算综述
1. 问题陈述
大语言模型(LLM)驱动的智能体的部署引入了与独立模型推理截然不同的威胁面。与无状态的查询 - 响应系统不同,智能体 AI 系统自主规划、调用外部工具、维护持久化记忆,并通过模型上下文协议(MCP)和智能体对智能体(A2A)等协议与同级智能体进行协调。这种扩大的操作范围创造了软件层防御(例如提示词防护、输出分类器)无法完全解决的漏洞,特别是针对拥有特权的基础设施 adversaries(例如被攻陷的云服务运营商或虚拟机监控器),他们能够检查模型权重、窃取对话历史,或在传输过程中操纵工具输出。
虽然全同态加密(FHE)等密码学方法提供了严格的保障,但其计算开销使其难以适用于交互式、百亿参数规模的工作负载。本文指出了一个关键缺口:现有的综述分别探讨了智能体安全或独立推理的机密计算(CC),但缺乏对硬件根信任(可信执行环境,即 TEEs)如何应用于完整的多步骤智能体栈的持续关注。具体而言,智能体系统需要针对工具调用隔离、持久化记忆机密性以及智能体间消息溯源的保护,这些保护范围超出了单次调用推理的范畴。
2. 方法论
本文采用结构化的综述方法,以综合面向智能体 AI 的机密计算设计空间。
- 语料构建:文献汇编始于机密 LLM 推理和智能体安全研究的种子集,通过向后/向前滚雪球法扩展,并结合针对性关键词搜索(例如 TEE、安全飞地、远程证明、MCP、A2A)。
- 分类协议:保留的核心论文按 TEE 基础架构、操作类别(独立推理、使用工具的单智能体、工作流智能体、多智能体系统)、受保护智能体层、adversary 类别和安全目标进行编码。仅当系统保护了工具使用、工作流执行、持久化记忆或智能体间协调时,才被标记为“直接面向智能体”。
- 分析视角:分析围绕三个维度组织:
- 功能智能体层:感知、规划、记忆、行动和协调。
- Adversary 特权:范围从外部攻击者(A1)到被攻陷的共租户(A2)、恶意基础设施运营商(A3)以及被攻陷的同级智能体(A4)。
- 部署边界:进程飞地、机密虚拟机(CVMs)、安全世界/域隔离,以及 CPU 到 GPU 的机密执行。
3. 主要贡献
A. 统一的 TEE 平台分类法
本文提出了六种与智能体部署相关的 TEE 平台的比较分类法:Intel SGX、Intel TDX、AMD SEV-SNP、ARM TrustZone、ARM CCA 和 NVIDIA H100 CC。分析从六个维度评估了它们:
- 隔离粒度:进程级(SGX)与虚拟机级(TDX、SEV-SNP)与域级(CCA)。
- 可信计算基(TCB)大小:可信计算基的规模。
- 加速器机密性:平台是否将信任扩展到 GPU 内存(例如 NVIDIA H100 CC),或仍局限于 CPU 中心。
- 边缘部署能力:适用于移动/边缘与云数据中心的适宜性。
- 飞地间通信成本:隔离组件间通信的开销。
- 证明模型:远程验证的机制。
B. 以智能体为中心的威胁模型
作者形式化了一个五层威胁模型,将 adversarial 能力映射到具体的安全目标:
- 感知:摄入用户提示词和检索到的文档。
- 规划/推理:LLM 核心处理和工具选择。
- 记忆:短期上下文、长期向量存储和 KV 缓存。
- 行动/工具执行:调用外部 API 和现实世界工具。
- 协调:智能体间委托与通信。
该模型对应九项安全目标:输入机密性、模型机密性、执行完整性、记忆机密性、工具调用完整性、消息真实性、溯源性、新鲜性和侧信道抗性。
C. 机密计算防御的比较综述
本综述根据威胁模型分析了代表性系统(例如 TEESlice、CMIF、TEECHAT、Omega、AttestMCP、CAEC、BlockA2A)。主要发现包括:
- 推理与智能体:目前大多数证据支持独立推理(感知/规划层)的输入和模型机密性。
- 缺口:针对持久化记忆、工具调用完整性和多智能体协调的保护仍然不完整。
- 直接面向智能体的系统:像 Omega(SEV-SNP + NVIDIA H100 CC)这样的系统展示了端到端的机密运行时,具有基于证明的工具访问控制;而 CAEC(ARM CCA)则为多智能体协作实现了机密共享内存。
D. 开放研究挑战
本文综合了六个关键的开放挑战:
- 复合证明:建立跨多跳智能体链(用户 → 编排器 → 专家 → 工具)的传递信任。
- 基于 TEE 的 RAG:创建经过证明的向量存储,其中检索操作由证明机制控制。
- CC 感知协议:重新设计 MCP 和 A2A,以原生支持证明、溯源性和新鲜性。
- 侧信道泄露:解决特定于自回归推理模式(例如 KV 缓存访问)的微架构泄露。
- GPU-TEE 性能:表征在 LLM 规模(405B+ 参数)和并发多智能体工作负载下的开销。
- 监管对齐:弥合技术证明证据与合规要求(例如欧盟《人工智能法案》、DORA)之间的差距。
4. 结果与发现
- 硬件成熟度:硬件信任原语(SGX、TDX、SEV-SNP、CCA、H100 CC)已足够成熟,可用于针对性部署,但没有任何单一平台主导智能体设计空间。
- 选择性保护:实际设计将信任边界与最高价值层(例如保护系统提示词和凭证)对齐,而不是试图封闭整个智能体栈,后者由于内存和 I/O 限制往往不可行。
- 机密计算的局限性:
- 机密计算保护“使用中”的数据免受拥有特权的基础设施运营商侵害,但无法防止语义提示词注入(A1)或确保外部输入的真实性。
- 证明确立了正在运行什么代码,而非代码的目标是否与人类意图一致。
- 侧信道攻击(时序、缓存、总线争用)仍然是一个重大风险,特别是针对共租户 adversaries。
- 可用性无法保证;TEE 引入了新的操作脆弱性(例如内存容量限制、证明服务依赖)。
- 平台 specifics:
- Intel SGX:最适合敏感组件的细粒度隔离,但受限于 EPC 容量且缺乏原生 GPU 信任扩展。
- Intel TDX/AMD SEV-SNP:适用于云规模的智能体服务“直接迁移”,但在跨虚拟机的机密共享内存方面面临挑战。
- ARM CCA:在多域协调和边缘/云混合部署方面前景广阔,但依赖于较新的研究原型。
- NVIDIA H100 CC:对于大模型推理机密性至关重要,但需要可信的 CPU 端根(例如 TDX)来实现端到端的系统完整性。
5. 意义与主张
本文主张,机密计算为智能体 AI 提供了一种必要的、基于硬件的防御基础,以抵御拥有特权的基础设施 adversaries,填补了纯软件防御留下的空白。然而,作者保持了适度的立场:
- 部分解决方案:机密计算并非智能体安全、模型鲁棒性或端到端系统可信度的通用解决方案。它解决了特定的安全目标(机密性、执行完整性),但无法解决语义错位或输入可信度问题。
- 组合式未来:前进的道路在于组合式进步——结合经过证明的内存服务、协议原生的溯源机制以及 GPU 感知的性能表征——而非纯粹的架构突破。
- 当前状态:虽然几种硬件原语已成熟,但“目前尚无广泛建立的端到端框架将它们绑定为生产级智能体 AI 的连贯安全基础”。本综述旨在定义设计空间,强调从仅推理系统到智能体系统的可转移性(及其缺失),并界定从试点部署迈向受监管的、生产级智能体系统所需的具体挑战。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。