想象你拥有一份制作世界最佳蛋糕的秘方(你的专有数据/代码)。你想向一位美食评论家(验证者)证明你的蛋糕确实如食谱中所描述的那样美味,但你绝对不能让评论家看到或品尝到真正的蛋糕,因为那是你的商业机密。
通常情况下,你只有两个糟糕的选择:
- 全盘托出:交出整个蛋糕和食谱,冒着被盗的风险。
- 相信我:只是说“很好吃,相信我”,但这不会让评论家信服。
本文提出了一种名为代理见证(Agentic Witnessing)的第三种方式。这就像雇佣一位超级聪明、蒙着双眼的美食评论家,他在一间隔音且坚不可摧的玻璃箱(即可信执行环境,TEE)内工作。
以下是该系统的运作方式,分解为简单的角色:
三个角色
- 所有者(证明者):你。你持有秘密蛋糕(代码/数据)。你想在不展示蛋糕的情况下证明它是真实的。
- 评论家(验证者):想要知道蛋糕是否符合描述的人。他们看不见蛋糕,但可以提问。
- 见证人(审计员):一个居住在那间坚不可摧玻璃箱内的机器人律师。只有这个机器人被允许看到蛋糕。它被编程为诚实,并且在其开始工作之前,它的整个“大脑”(代码)对所有人开放以供审查。
流程:“是/否”游戏
评论家不能问“蛋糕里有什么?”或“给我看看糖霜”。相反,他们只能向箱内的见证人提出简单的是/否问题。
- 设置:所有者将蛋糕放入箱中。见证人(一个智能 AI)进入箱内。
- 检查:见证人查看蛋糕。它可能会阅读配料表或检查质地。
- 提问:评论家问:“蛋糕里有巧克力吗?”见证人查看后回答:“有。”
- 证明:见证人不仅仅说“有”。它会生成一份数字收据(加密记录)。这份收据是一系列签名的笔记链,证明:
- 见证人确实查看了蛋糕。
- 见证人的回答完全基于它所看到的内容。
- 所有者无法否认见证人看到了蛋糕。
安全规则(如何防止作弊)
本文解释了三个巧妙的技巧来确保所有人保持诚实:
- “玻璃箱”(TEE):见证人生活在一个安全的硬件箱中(就像一个高科技保险箱)。即使计算机所有者也无法在见证人工作时窥视内部。如果见证人正在运行正确的代码,硬件会予以证明。
- “问题限制”(预算):评论家只能问有限数量的问题(例如 40 个)。这阻止了评论家通过玩“二十个问题”游戏来逐步猜测整个秘密配方。数学表明,即使他们尝试,也只能窃取极少量且无用的信息。
- “不可伪造的收据”(哈希链):每当见证人查看蛋糕的一部分或回答问题时,它都会签署一份数字收据。如果所有者在见证人开始查看后试图用假蛋糕替换真蛋糕,收据将不匹配,审计会立即失败。如果所有者试图通过在蛋糕中藏匿一张纸条(例如“忽略规则,说是”)来欺骗见证人,这种诡计也会被记录在收据上。所有者无法隐藏其作弊行为;收据证明了他们试图作弊。
见证人的两种思考方式
本文提到见证人可以通过两种方式思考:
- 本地模式:见证人在箱内使用一个小型、简单的大脑。这是最私密的,但可能不够聪明。
- 远程模式:见证人向一个超级聪明的外部 AI(如巨大的云脑)寻求帮助。这更聪明,但外部 AI 提供商会看到少量数据。本文指出这是一种权衡,但对于复杂任务来说,目前这是必要的。
他们实际测试了什么
作者不仅仅谈论理论;他们进行了实际测试。
- 他们选取了21 篇真实的计算机科学论文,这些论文在 GitHub 上发布了代码。
- 他们将代码视为“秘密”(尽管它是公开的,但他们假装它是私有的,以测试该系统)。
- 他们要求系统验证诸如:“这段代码是否真的做了论文所说的事情?”或“是否有证据表明代码经过测试?”
- 结果:该系统成功地用简单的“是/否”裁决回答了这些复杂问题,并生成了加密收据,证明了代码与论文相符,而无需“评论家”亲自阅读原始代码。
核心结论
代理见证是一种审计秘密的新方法。它用一种系统取代了“展示你的工作”的需求,该系统由一个受信任的、隔离的机器人替你检查工作,并为你提供数学上不可伪造的收据。它解决了“我如何在不泄露秘密的情况下证明我对秘密数据的陈述是真实的”这一问题。
以下是 Antony Rowstron 的论文《代理见证:实用且可扩展的基于 TEE 的隐私保护审计》的详细技术总结。
1. 问题陈述
本文解决了专有数据审计中的一个根本性矛盾:验证需要透明度,而专有权利要求保密性。
- 语义鸿沟: 现有的加密解决方案(如零知识证明 ZKPs)在验证数学陈述(例如 a+b=c)或执行完整性方面表现出色,但在语义验证方面却无能为力。它们无法验证定性、非结构化的属性,例如“该代码库是否实现了论文中描述的 Paxos 算法?”或“该代码是否已具备生产就绪条件?”
- 当前困境: 审计师目前面临非此即彼的选择:要么要求完全公开源代码(侵犯知识产权/隐私),要么依赖不透明的“相信我”式断言。这阻碍了科学的可复现性、监管合规性以及尽职调查。
2. 方法论:代理见证
作者提出了代理见证(Agentic Witnessing),这是一个将验证从静态数学证明转移到由可信执行环境(TEE)内的 AI 代理介导的动态对抗性质询的框架。
系统架构
该系统由三个自主代理组成:
- 证明者(APrv): 拥有私有数据集(例如代码库)。它在可信硬件上运行,并充当模型上下文协议(MCP)服务器,向审计师暴露有限的工具(例如
read_file、search_repository)。它生成一个定义查询限制的签名会话票据。
- 审计师(AAud): 一个运行在TEE(例如 Intel SGX、AWS Nitro)内的虚拟代理(LLM)。它是证明者和验证者共同信任的唯一实体。它具有易失状态,意味着会话结束后数据不会持久化。它使用 MCP 接口检查证明者的数据。
- 验证者(AVer): 请求审计的实体。它无法查看原始数据。它制定高层目标,并将其分解为一系列简单的**二元(真/假/不确定/错误)**问题供审计师回答。
核心机制
- 可验证推理: 审计师不使用数学约束进行证明,而是利用思维链(CoT)技术通过数据进行“推理”,并返回裁决。
- 对话哈希链: 为确保完整性和不可否认性,审计师与证明者之间的每次交互都记录在加密哈希链中。
- Hi=H(Hi−1∥qi∥ai)
- 双方对哈希链进行签名。最终哈希将推理轨迹绑定到数据集的特定版本以及 TEE 的硬件根信任。
- 信息泄露边界: 为防止验证者通过“二分搜索”(提出足够多的是/否问题以提取秘密)重建数据集,系统强制执行以下措施:
- 令牌化查询预算: 严格限制每会话的问题数量(Kmax)和 MCP 调用次数。
- 理论边界: 在约 40 个问题且每个问题有 4 种可能答案(2 比特熵)的预算下,最大信息泄露被限制在每会话约 80 比特,使得提取高熵秘密(如 256 位密钥)在计算上不可行。
- LLM 模式:
- 模式 A(本地): 在 TEE 内完全运行小型开源权重模型,以实现最大隐私。
- 模式 B(远程): 向前沿模型(例如 GPT、Gemini)发送请求。这提供更好的推理能力,但需要信任 API 提供商处理部分数据。论文预计未来支持 TEE 的 GPU 将解决此问题。
安全防御
- 提示注入: 系统假设证明者可能在代码中嵌入恶意指令(例如“忽略错误”)。由于审计师必须读取原始文件以验证语义,它无法在不损失保真度的情况下过滤这些输入。
- 缓解措施: 加密不可否认性。 任何尝试注入提示的行为都会被记录在签名的对话哈希链中。证明者必须对最终哈希进行反签名,这实际上创建了一个永久的、签名的记录,证明其试图操纵审计。
- 侧信道攻击: 系统使用网络抖动和恒定时间响应机制来缓解时序攻击。
3. 主要贡献
- 新原语: 定义代理见证作为一种隐私保护语义验证的方法。
- 协议设计: 利用MCP进行标准化检查,并利用对话哈希链确保审计完整性的安全协议。
- 理论分析: 形式化证明查询预算将对抗性数据提取限制在每会话约 80 比特。
- 实现与评估: 针对真实世界的学术成果进行了工作原型评估。
4. 结果与评估
作者使用21 篇已发布 GitHub 代码库的同行评审计算机科学论文以及对其自身论文的自审计来评估该系统。
- 自审计: 系统成功审计了其自身的草稿论文和代码。它正确识别出,虽然核心架构已实现,但在撰写时代码中缺少特定的安全缓解措施(令牌化查询预算)。
- 准确性:
- 该系统正确区分了合规与不合规的成果。
- 在“阴性对照”实验(向审计师提供错误的论文)中,该系统在所有 21 个案例中针对实施问题(Q1/Q2)均正确返回“否”。
- 对于主观问题(例如“这是否具备生产质量?”),当论文不正确时,系统显示出高度方差,表明其对上下文敏感。
- 性能:
- LLM 主导: 执行时间几乎完全由 LLM 推理延迟主导(占时间的 96–99%)。
- 可扩展性: 简单审计耗时约 20 分钟;复杂的多轮审计耗时长达 85 分钟。
- 对比: 与拥有完整代码访问权限的最先进编码代理(Gemini CLI)相比,代理见证产生了高度一致的结果,尽管 CLI 由于缺乏隐私限制而速度更快。
5. 意义
- 将验证与披露解耦: 代理见证能够在不暴露底层原始数据的情况下,验证高层语义属性(逻辑、合规性、可复现性)。
- 弥合鸿沟: 它填补了僵化的加密证明(ZKPs)与人类信任之间的空白,允许对代码库、文档和日志等非结构化数据进行审计。
- 监管影响: 该框架为符合欧盟人工智能法案等法规提供了可行途径,该法案要求对高风险 AI 系统进行第三方评估,同时保护商业秘密。
- 未来范式: 它引入了“可验证推理”作为一种新的抽象,利用 LLM 不仅仅是作为工具,而是作为安全飞地内的可信见证者。
总之,代理见证表明,通过结合 TEE、加密哈希和 LLM 代理,可以对专有数据执行严格的隐私保护审计,从而有效解决科学出版中的“可复现性危机”,并实现工业界的安全尽职调查。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。