← 最新论文
🤖 AI

Committed SAE-Feature Traces for Audited-Session Substitution Detection in Hosted LLMs

本文提出了一种提交 - 开启协议,该协议利用默克尔树承诺对稀疏自编码器(SAE)特征轨迹进行承诺,以有效检测托管大语言模型中的静默模型替换,在保持最小计算开销的同时,通过抵御多样化的自适应攻击,其表现优于现有的“返回后探测”方案。

原作者: Ziyang Liu

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziyang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你从一家高档餐厅点了一份高级牛排。你支付了 premium 部位的费用,但厨房却偷偷用一块更便宜、冷冻过的肉饼替换了它。在人工智能领域,这是一种真实存在的风险:云服务商可能宣传一个强大且昂贵的 AI 模型,却为了节省成本,偷偷向你发送一个更廉价、更弱的模型。

本文提出了一种新方法,无需信任餐厅,就能揪出这些“假牛排”。

问题所在:“魔镜”诡计

当前的安全方法试图通过向 AI 发送一个秘密测试问题(即“探针”)来揪出作弊者,该问题会随你的真实请求一同发出。如果 AI 正确回答了测试问题,服务商便会宣称:“看吧?我们使用的是优质模型!”

但一个不诚实的服务商可以利用“魔镜”诡计来欺骗这套系统。他们可以将你的秘密测试问题路由到昂贵、高质量的模型(以通过测试),而将你的实际请求路由到廉价、低质的模型。你得到了糟糕的结果,但安全检查却显示一切正常。

解决方案:“密封食谱盒”

作者提出了一种名为“承诺 - 开启协议”(Commit-Open Protocol)的新系统。这就像是一个密封的食谱盒,厨师必须在开始烹饪之前将其锁好。

  1. 承诺(锁上盒子):在 AI 生成任何答案之前,它会为其内部思维过程创建一个数字“指纹”。它使用一种特殊工具(称为稀疏自编码器,SAE)在每一步对其大脑活动进行快照。随后,它将这些快照锁定在一个数字“默克尔树”(一种安全且不可更改的列表)中,并发布该锁。
  2. 开启(核对收据):在 AI 给出答案后,安全检查员会从过程中随机挑选几个步骤,要求服务商为这些特定时刻“打开”盒子。
  3. 验证(品尝测试):检查员将打开的快照与公开的“优质”AI 大脑特征库进行比对。如果快照与高质量模型相符,则接受该答案;如果它们看起来像廉价模型,则拒绝该答案。

为何作弊者无法得逞

该论文针对 17 种不同类型的作弊者进行了测试,包括试图替换模型的、试图微调模型的,甚至试图从数学上欺骗系统的作弊者。

  • “并行服务”的失败:在旧的“魔镜”方法中,作弊者可以通过仅向测试问题展示优质模型来轻松通过测试。而在新系统中,由于“指纹”在答案完全生成之前就已锁定,并且覆盖了整个过程,作弊者无法在不破坏锁的情况下中途替换模型。
  • “伪造大脑”的失败:即使作弊者试图伪造指纹(假装拥有优质模型的大脑活动),数学证明表明,如果不实际运行真实模型,就不可能伪造出真实模型内部思维的复杂性。
  • “黑客”的失败:即使黑客试图从指纹逆向推导以欺骗系统,真实模型与伪造模型之间的差距也过于巨大,无法跨越。

成本

作者在三种不同的 AI 模型上运行了该系统。他们发现,添加这种安全锁仅使 AI 的运行速度减慢约 2.1%。为了确保你支付牛排费用时不会吃到冷冻肉饼,这是一个微不足道的代价。

简而言之:本文介绍了一种“锁定 - 检查”系统,迫使 AI 服务商证明他们确实使用了所承诺的特定模型,从数学上使得在不被察觉的情况下替换为廉价版本成为不可能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →