← 最新论文
💬 NLP

RedAct: Redacting Agent Capability Traces for Procedural Skill Protection

本文介绍了 RedAct,这是一个通过选择性地脱敏敏感信息并保留审计证据,从而在保护 AI 智能体执行轨迹中的程序化技能的同时,有效防止未经授权的技能转移且不损害问责制的框架。

原作者: Shuwen Xu (May), Zhitao He (May), Yi R. (May), Fung

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuwen Xu (May), Zhitao He (May), Yi R. (May), Fung

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位名厨来为一场晚宴烹饪一道复杂的家族秘方。这位厨师留下了一段记录整个烹饪过程的视频:他们使用的精确分量、所用的特定品牌香料、烤箱的精准温度,以及他们用来修复烧焦酱汁的独特技巧。

如果你将这段视频发布到网上,让人们看到他是如何做到的(为了透明度),竞争对手可能会观看视频,复制这些秘密技巧,并开始销售同样的菜肴,而无需经过学习原配方本身的过程。他们并没有偷走实体的食谱,他们只是通过视频“逆向工程”出了“做法”。

这篇名为 REDACT 的论文正是针对这一问题展开研究的——针对 AI 智能体(使用计算器、代码编辑器或搜索引擎等工具的智能计算机程序)。

问题所在:“视频泄露”

当 AI 智能体解决难题时(例如分析医疗数据或修复金融模型),它们会留下一个“痕迹”——一份关于其每一个思考步骤、每一次工具点击和每一项决策的详细日志。

  • 优点: 这些日志有助于人类检查 AI 是否工作正常并修复漏洞。
  • 缺点: 这些日志通常包含 AI 的“秘密配方”——专有的公式、特定的阈值和巧妙的策略,这些都是公司拥有的资产。如果公开这些日志,其他 AI 系统就可以通过观察这些日志,学习这些秘密并复制这些技能,而无需为原始训练支付费用。

作者称之为 “黑盒追踪披露”(Black-Box Trace Disclosure)。这就像是给了别人一张寻宝图,即使你没有给他们原始的钥匙,但这张图准确地显示了金子埋藏的位置。

解决方案:REDACT

团队开发了一个名为 REDACT(Redacting Agent Capability Traces,即“智能体能力痕迹脱敏”)的系统,旨在保护这些秘密,同时仍让人们能够看到工作过程。可以将其想象为一个智能编辑,在烹饪视频上传到网络之前对其进行编辑。

REDACT 主要做了两件事:

1. “智能模糊”(选择性重写)

REDACT 并不是简单地把整个视频涂黑(因为那样会让视频失去检查厨师是否确实完成了烹饪工作的意义),而是使用了“智能模糊”。

  • 保留内容: 它保留了证明工作已完成的步骤。例如,“厨师检查了烤箱温度”或“酱汁已被验证为安全”。这允许审计人员确认过程是有效的。
  • 隐藏内容: 它用通用的描述替换具体的秘密。与其说“加入 3.42 克盐并在 185°F 下炖煮”,它会说“加入适量的调味料并在适当的温度下炖煮”。
  • 结果: 视频看起来仍然像是一个真实的烹饪节目,但竞争对手无法再复制出精确的配方。

2. “隐形墨水”(行为水印)

为了确保人们不会偷走视频并声称这是他们自己制作的,REDACT 在日志中加入了“隐形墨水”。

  • 这些不是隐藏的文字,而是行为习惯。例如,AI 可能会被编程为在开始任务前总是先检查室温,或者在出错后说一句特定的短语,如“让我们复查一下工具”。
  • 如果有人试图使用该 AI 的技能,他们可能会不经意间模仿这些习惯。原所有者随后可以扫描新的 AI 行为,查看其中是否包含这些特定的“特征点”,从而证明新的 AI 是从原始视频中学到了技能。

测试厨房 (CAPTRACEBENCH)

为了证明其有效性,作者构建了一个庞大的测试厨房,称为 CAPTRACEBENCH

  • 他们创建了 75 种不同的复杂任务(如分析 DNA 序列或修复代码),涵盖了 7 个领域(如生物学、金融和工程学)。
  • 其中包含了 154 项特定的“技能”(即秘密配方)。
  • 他们让其他 AI 系统尝试从“原始”视频与“经过 REDACT 处理”的视频中学习。

实验结果

实验表明:

  1. 原始视频是危险的: 当 AI 系统观看未经编辑的日志时,它们能够复制约 45% 到 67% 的秘密技能。它们基本上变成了原始专家的克隆体。
  2. REDACT 阻止了窃取: 使用 REDACT 后,其他 AI 窃取技能的能力降至 (甚至低于零,意味着它们在没有帮助的情况下表现得更好)。“智能模糊”成功地移除了可被复用的秘密。
  3. 审计依然有效: 即使隐藏了秘密,日志中仍包含足够的信息供人类验证工作是否正确完成。
  4. 隐形墨水有效: 当技能被窃取时,行为水印的检测率达到了 93% 至 100%,且几乎没有误报。

总结

本文认为,发布 AI 日志就像发布烹饪视频:它对于透明度非常有益,但也会带来知识产权方面的风险。REDACT 是一个用于编辑这些日志的工具,它在隐藏“秘密配方”的同时保留了“烹饪证明”,并添加了隐形标记来捕捉任何试图复制作品的行为。它使公司能够在不泄露竞争优势的前提下,安全地分享其 AI 的工作成果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →