Do System Prompts Leave Behavioral Fingerprints? A Large-Scale Empirical Study of Clone Detection via Output Similarity
本文介绍了黑盒行为指纹识别(Black-Box Behavioral Fingerprinting, BBF),这是一种使提示词所有者能够通过输出相似性来检测克隆系统提示词的方法,并通过大规模实证研究验证了虽然提示词的选择显著影响模型行为且检测通常是有效的,但它仍然容易受到特定风格化操纵的影响。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,一种新型的知识产权已经出现:系统提示词(system prompt)。这并非物理对象或复杂的机器,而是一组在计算机程序开始执行任务前给出的、经过精心编写的指令。可以将它想象成一段隐藏的剧本,告诉通用人工智能如何表现、使用何种语气以及应用哪些特定技能,从而有效地将一个广泛的工具转变为一种专业化的产品。正如厨师可能会拥有一份定义菜肴风味的秘密食谱一样,开发者通过精心设计这些提示词来创造独特的数字服务。然而,与可以被锁起来的实体食谱不同,这些数字指令是脆弱的。因为它们仅以文本形式存在,所以很容易被通过询问正确问题的对手所诱导出来,被复制,然后由任何人、在任何地方、以零成本的方式使用。一旦被窃取,原作者无法证明竞争对手的服务正在使用他们被盗的剧本,从而导致其求助无门。
这种不确定性促使一个研究小组提出了一个根本性的问题:即使窃贼重写了被盗的指令使其看起来与原版不同,原始剧本是否仍会在计算机给出的答案中留下痕迹?为了找出答案,研究人员开发了一种称为“黑盒行为指纹识别”(Black-Box Behavioral Fingerprinting)的方法。他们不将系统提示词视为一段可阅读的文本,而是将其视为塑造人工智能响应方式的一套习惯。他们的方法简单而强大。首先,提示词所有者会向自己的 AI 发送一组特定的问题列表,并记录答案。然后,他们通过分析这些答案中的模式,为该特定提示词的行为创建一个独特的“指纹”。随后,如果他们怀疑竞争对手正在使用被盗的版本,他们会将同样的问题发送给竞争对手的 AI。通过将竞争对手的答案模式与原始指纹以及一组随机且无关的答案进行对比,他们可以判断这两个系统是否表现得相同。
研究人员在大规模范围内测试了这个想法,涉及四个不同的商业 AI 模型家族和八种不同类型的任务,涵盖了从医学问题到法律合同分析的范围。他们生成了近三十万个响应,以观察指纹方法是否能可靠地识别克隆体。结果令人瞩目。他们发现,系统提示词的选择解释了 AI 回答问题差异的近四分之一。换句话说,隐藏的指令在输出中留下了强烈且可衡ей测的印记。当研究人员将运行在同类 AI 上的被盗提示词与原版进行对比时,该方法在近 90% 的案例中成功识别出了匹配项。即使被盗的提示词被转移到了一个完全不同的 AI 模型上,该方法仍然有效,尽管确定性略有下降,平均能在约 72% 的场景中正确识别出克隆体。
研究还探讨了该方法在应对试图掩盖踪迹的对手时的表现如何。研究人员发现,仅仅通过使用不同的词汇或改变句子结构来重写被盗的指令,并不能骗过该系统。行为指纹依然保持强韧,使得检测方法即使在提示词文本被大幅修改的情况下依然能够成功。然而,研究人员也发现了一个特定的弱点。如果攻击者在提示词的最开头添加了一条简短、正式的指令,以强制要求 AI 听起来像一位严肃的学者,那么当任务涉及简短、结构化的回答时,该方法就会表现挣扎。在这些特定情况下,检测准确度显著下降,这表明虽然该方法对大多数变化具有鲁棒性,但可能会被那些试图操纵简短任务中 AI 自然风格的刻意尝试所迷惑。
为了使过程更加高效,团队引入了一条选择最佳问题的规则。他们发现,并非所有问题在识别克隆体方面都同样有用;有些问题过于直白,无论使用何种提示词,任何 AI 都会以同样的方式回答。通过过滤掉这些显而易见的问题,并专注于那些提示词能产生实际影响的问题,研究人员显著提高了检测准确度。他们确定,只需提出二十五个经过精心挑选的问题,就足以以极高的置信度确认窃取行为。这意味着提示词所有者不需要监控整个系统,也不需要访问其内部代码;他们只需提出一些有针对性的问题并对比结果即可。
研究结论认为,虽然提示词被窃取的威胁是真实的,且窃取这些指令的能力已得到证实,但现在已经有了一种可行的检测方法。该方法通过观察 AI 的行为而非指令的文本来进行工作,使其成为一种实用的验证工具。它并不是抵御每一种可能攻击的完美护盾,特别是那些旨在操纵简短回答风格的攻击,但它为保护生成式 AI 时代的知识产权提供了坚实的基础。研究人员首次为提示词所有者提供了一种验证其怀疑并证明特定部署是在运行于被盗剧本的方法,为数字经济提供了一层新的安全保障。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。