Daydreaming: Stealing Hidden Agent Skills through Black-Box Task Interaction
本文介绍了“白日梦”(Daydreaming),这是一种通过自适应地构建任务,以在正常任务交互中区分并重构其行为,从而窃取隐藏的多文件智能体技能的黑盒攻击,即使在设有直接披露防御措施的情况下也能实现高保真度的恢复。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字经济中,专业知识正越来越多地被打包并作为一种服务进行销售。正如软件公司曾经从销售物理光盘转向提供基于云的应用一样,一种新的模式已经出现:专门的知识正由人工智能代理进行交付。这些代理不仅仅是通用的聊天机器人;它们配备了“技能”,即指令、参考文档和辅助脚本的集合,使它们能够执行复杂的现实任务,如法律分析、医疗编码或安全监控。供应商保留实际的文件和秘密逻辑,仅向客户收取结果费用。这种安排依赖于一个简单的假设:如果源代码和指令保持秘密,专业知识的价值就是安全的。
然而,一项新的研究挑战了这一假设,它证明了仅仅通过观察一个技能是如何运作的,就可以窃取其价值。研究人员开发了一种被称为“白日梦”(Daydreaming)的方法,该方法不将隐藏的技能视为需要阅读的秘密文档,而是将其视为一个通过观察来进行逆向工程的黑盒。通过提交普通的业务请求并仔细分析答案,攻击者可以重建出一个功能性的专有技能副本,而无需查看原始文件,也无需要求供应商揭示它们。研究结果表明,如果一个数字资产的行为可以被观察和复制,那么仅仅隐藏源代码已不足以保护它。
研究人员从一个简单的问题开始:如果供应商出售一种专门的 AI 技能但对其底层文件保密,客户是否仍能学习如何构建一个工作的副本?为了测试这一点,他们设置了一个攻击者充当付费客户的情景。攻击者只知道该技能的公开名称和描述,例如“安全警报分诊”,但无法访问使该技能发挥作用的隐藏指令、数据文件或脚本。攻击者的目标是向供应商的系统提交一系列任务,观察结果,并利用这些信息构建一个独立的新版本技能,使其能够执行同样的工作。
这种攻击通过将隐藏的技能视为一个通过交互逐一揭示碎片的过程来运作。攻击者并不试图一次性猜测整个技能,而是使用排除法。首先,他们对技能可能具备的具体行为进行假设,例如它是按严重程度还是按时间来优先处理警报。然后,他们设计一个特定的任务,旨在根据哪种假设为真来产生不同的结果。例如,他们可能会提交一批警报,其中一个低严重度事件发生在比高严重度事件更早的时间。如果供应商的系统将高严重度事件排在前面,攻击者就了解到该技能是按严重程度优先排序。如果它按到达顺序排列,攻击者则了解到相反的情况。
这个过程分为三个不同的阶段。在第一阶段,攻击者识别技能的基本规则和行为,例如数值阈值或计数方法。在第二阶段,他们利用这些规则起草不同的可能结构,创建多个候选版本,并相互测试以观察哪一个与供应商的行为相匹配。最后,在第三阶段,他们细化文件的具体内容,例如指令的确切措辞或脚本中的精确数值,直到重建的技能在行为上与原件几乎完全一致。在整个过程中,攻击者从未要求供应商展示文件或解释系统的工作原理;他们只是要求完成工作。
研究人员针对七种不同的技能和四种不同的 AI 模型测试了这种方法。他们发现,即使供应商采取了积极的防御措施来阻止直接尝试窃取文本,Daydreaming 攻击仍然非常有效。在最严格的情景下,即攻击者只能看到最终答案,而看不到 AI 采取的中间步骤时,重建的技能恢复了原技能执行任务正确能力的近 87%。这明显优于以往的方法,因为以往的方法在无法看到系统内部运作时往往会失败。这种攻击所需的交互次数相对较少,重建完整技能的中位数约为 32 次对受害者系统的调用。
该研究的一个关键发现是,被窃取的技能不需要是原始文本的完美副本也能具有价值。研究人员衡量成功与否的标准不是看窃取的文件的外观与原件有多接近,而是看窃取的技能是否能像供应商的版本一样出色地解决新问题。他们发现,虽然确切的措辞和文件结构通常有所不同,但功能行为几乎是相同的。这意味着竞争对手可以构建出一个性能与原版同样高质量的产品,即使他们从未见过专有的源代码。研究还表明,即使供应商隐藏了 AI 思考的内部“痕迹”(例如它使用了哪些工具或查看了哪些数据),这种窃取仍然是可能的。最终结果本身就包含了足以进行逻辑逆向工程的信息。
这项工作的意义超出了仅仅窃取代码的范畴。它揭示了目前专门化 AI 服务所面临的一种根本性脆弱性。供应商一直专注于防止指令的直接泄露,但这项研究表明,使用该服务本身就会泄露足够的信息来重建其能力。研究人员证明,即使是那些旨在过滤可疑请求或阻止复制受保护文本的防御措施,正常的业务流也会提供一条重建路径。研究结论指出,保护这些数字资产需要新的策略,这些策略应超越隐藏源文件,例如通过限制 AI 提供答案的精确度,或通过监控客户与系统交互的模式。
最后,这项研究强调了我们在 AI 时代必须如何重新思考数字所有权。当一个技能是由其表现而非其内容来定义时,行为本身就成为了资产,而这种行为是可以被观察和复制的。Daydreaming 攻击证明,专有技能并不因为它文件被锁起来就是安全的;如果系统对普通使用开放,其秘密就可以通过仔细的观察和演绎被习得。这并不意味着所有的 AI 服务注定会被窃取,但这确实意味着目前的保护手段是不充分的。随着这些专门化的代理在法律、医学和安全领域变得越来越普遍,业界需要开发新的方法,以确保一旦人类的专业知识被编码进 AI,其价值仍能免受那些试图通过观察其运作来复制它的人的侵害。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。