← 最新论文
💻 computer science

Hardware-rooted attestation for AI-agent evidence: composing IETF RATS with action evidence packages

本文提出并论证了一种复合证明框架,该框架通过 IETF RATS 架构将软件生成的 AI 动作证据包与硬件根信任绑定,从而确保代理输出被验证为源自特定、未篡改的模型版本及受信任平台。

原作者: Anton Sokolov

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Anton Sokolov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

数字黑盒之谜

想象一下,你正在试图破解一个谜团,但唯一的目击者竟然是嫌疑人本人。在人工智能的世界里,我们正在构建“智能体”(agents)——即能够做出决策、编写代码甚至控制机器人的智能计算机程序。为了确保这些智能体保持诚实,我们需要一种检查它们工作的方式。目前,我们依赖于一种数字“日志”(logbook),由智能体为自己编写。日志上写着:“我做了这件事,我有权执行此操作,以下是结果。”这很有用,但它有一个致命缺陷:如果智能体在撒谎,或者如果有黑客偷偷将智能体的“大脑”替换成了另一个,日志看起来依然会非常完美。这就像一个罪犯在日记里写道:“我没有偷饼干”,而手里却还拿着饼干。日记虽然签名并加盖了封印,但它无法证明究竟是写的,或者是运行在什么样的计算机上。

为了解决这个问题,我们需要一个“黑匣子”记录仪,类似于飞机上的那种。这些设备由第三方制造,密封严密,记录的数据是飞行员(或计算机操作员)无法篡改的。在计算机领域,这被称为“硬件证明”(hardware attestation)。这是一种让计算机内部特殊的、受信任的芯片向外部检查员低声耳语的方式,它会说:“我保证,当前运行的软件正是所有者所声称的那一个。”科学家们提出的重大问题是:我们如何将智能体自己的叙述(日志)与这种不可破坏的硬件证明(黑盒)结合起来,从而创造出一种单一且无可争辩的真相?


日志与密封记录仪

本文提出了一种巧妙的方法将这两者联系在一起。作者安东·索科洛夫(Anton Sokolov)建议,我们不应仅仅信任 AI 的日志,也不应仅仅信任硬件。相反,我们应该将它们“缝合”在一起,使它们无法被分离。

可以将这想象成机组人员试图解释一次粗糙着陆的过程。

  1. 日志(AEP): 这是“行动证据包”(Action Evidence Package)。它是机组人员的书面报告:“我们得到了塔台的降落许可,我们使用了左侧跑道,并安全着陆。”它很详细且经过签名,但它仍然只是机组人员书写的文字。
  2. 黑匣子(RATS 证据): 这是硬件证明。它是一个密封的记录仪,显示:“就在这一刻,飞机的计算机正在运行 1.0 版本的降落软件,且发动机处于全功率状态。”飞行员无法更改这一点;这是由飞机自身传感器记录下的物理事实。

论文指出,仅靠日志是不够的,因为机组人员可能会撒谎。仅靠黑匣子也是不够的,因为它无法告诉我们飞机为什么要着陆,或者飞行员是否遵守了规则。解决方案是将它们绑定。当机组人员在日志中记录时,他们必须同时附上一个来自黑匣子的、新鲜且密封的印章,以证明在那个精确时刻,飞机的计算机正处于正确的状态。

实验是如何进行的

作者并非凭空构想,而是构建了一个小型的工作模型来验证其可行性。他们使用了一个“软件 TPM”(一种在真实计算机中发现的特殊安全芯片的模拟版本)来充当黑盒。他们创建了一个虚假的 AI 日志,并尝试将其与硬件证明相结合。

以下是他们在模拟实验中的发现:

  • “良好”场景: 当 AI 按照预期执行任务,且计算机运行着正确的软件时,系统给出了绿灯。结论是**“已验证”(Attested)**。日志与黑匣子达成一致。
  • “更换大脑”场景: 研究人员试图欺骗系统。他们假装 AI 将其大脑替换为了另一个未经授权的模型。黑匣子立即察觉到了变化。尽管日志看起来非常完美,并声称“我是一个优秀的模型”,但硬件证明却说:“不,你不是。”这是论文取得的重大胜利:日志本身依然完全有效,但组合后的结论揭示了故事与硬件现实之间的差异。结论为**“有争议”(Contested)**。
  • “旧闻”场景: 他们尝试使用昨天的一个有效的黑匣子印章来签署今天的日志。系统提示“过期了!”,并给出结论为**“已过期”(Expired)**。
  • “伪造日志”场景: 他们尝试将一个有效的黑匣子印章附加到一个完全编造的日志上。系统立即拒绝了它。印章与故事不匹配,因此整个过程被废弃。

这意味着什么(以及它没能做到什么)

论文非常谨慎地说明了它尚未完成的工作。这是一个在普通计算机上使用虚拟芯片进行的模拟。它证明了该想法是可行的,但尚未证明真实服务器中的真实物理芯片也会表现得同样出色。作者承认,在现实世界中,我们需要测量实际的 AI 模型文件(即“大脑”),并确保硬件确实未被篡改,这是一个更大的工程挑战。

然而,核心思想是稳固的:通过将 AI 的叙述与硬件封印相结合,我们可以创造出一种新型的真相。我们可以从询问“AI 说它做了什么?”转向询问“操作员声称拥有的那台特定计算机,是否真的做了这件事?”

论文建议,这种“复合”方法创造了一个关于信任的六词词汇表:已授权(Authorized,它拥有权限)、未经授权(Unauthorized,它没有权限)、不确定(Indeterminate,我们不知道)、已验证(Attested,硬件是正常的)、有争议(Contested,硬件在撒谎或发生了变化)以及已过期(Expired,证明已失效)。

简而言之,论文表明我们可以构建一个将 AI 日志锁定在硬件封印中的系统。如果 AI 试图对其行为撒谎,或者有人试图将 AI 的大脑替换为另一个,封印不会破裂,但组合后的结论会变成**“有争议”**,从而揭示出故事与机器之间的分歧。这是一种确保当我们听到 AI 说“我做了这件事”时,我们可以确信这不仅仅是一个故事,而是由机器本身支撑的事实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →