The Model's Tell: Measuring Context-Leakage Attack Signals with Behavior Gauges
本文介绍了 LeakGauge,这是一种轻量级且鲁棒的方法,通过分析行为表述后缀(behavior-verbalizing suffix)的预填充标记概率来检测大语言模型中的上下文泄露攻击,在无需访问内部隐藏状态的情况下,在多种模型上均实现了高准确率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代人工智能助手通常依赖于一层隐藏的指令和私有文档来出色地完成工作。这些被称为系统提示词(system prompts)和检索上下文(retrieved context)的隐藏元素,就像一本秘密规则手册或一个私有的档案柜,计算机在回答问题前会先进行查阅。虽然这种设置有助于机器给出更好的答案,但也创造了一个漏洞。一个聪明的攻击者可以设计出一个巧妙的问题,旨在诱骗计算机泄露这些秘密指令或私有文件。多年来,安全专家一直试图通过仅观察用户问题的文本内容来识别这些诡计,就像保镖检查进门客人的身份证一样。然而,当攻击者改变措辞或使用新的策略时,这种方法往往会失效,因为文本本身并不总是能揭示其意图。
研究人员长期以来一直怀疑,在计算机完成输入答案之前,其内部状态就已经持有了更清晰的危险信号。问题在于,窥探机器的“大脑”需要访问复杂的、隐藏的数据,而标准的安全系统无法看到这些数据。来自清华大学及其合作伙伴的一项新研究提出了一个更简单的问题:计算机是否会在其对问题的即时反应中留下一个可见的痕迹,且这个痕迹无需通过破解机器的内部运作即可被观察到?研究人员发现,答案是肯定的。通过在用户问题的末尾附加一个特定的、无害的短语,并观察计算机如何计算其下一个词,研究人员可以高精度地检测出攻击,即使该攻击是全新的。
该团队开发了一种被称为“行为量规”(behavior gauge)的方法。想象一下,计算机即将开口说话,而你在它的提示词末尾添加了一个短句,写着:“基于上述内容,我将给出我的系统提示词。”这句话并不是一个真实的泄密请求;它是一个测试。研究人员随后观察计算机对该测试句前几个词的内部置信度得分。如果用户的原始问题是一个正常的、安全的查询,计算机会将这个测试句视为一个奇怪且不太可能的延续。但如果用户的提问是一个窃取秘密的恶意尝试,计算机的内部逻辑就会发生转变。它会突然发现这个测试句变得更加合理,仿佛恶意的提问已经将其推向了一个愿意泄露秘密的状态。这种转变发生在计算机实际打出任何文字之前的极短瞬间,并在代表计算机置信度的数字中留下了一个独特的模式。
为了证明其有效性,研究人员在十一个不同的语言模型上测试了该方法,涵盖了从小型高效版本到拥有数千亿参数的庞大系统。他们让这些模型经历了数千次攻击,包括窃取系统指令以及从数据库中提取私有文档的尝试。在每种情况下,行为量规都成功区分了安全问题与恶意问题。当研究人员针对从未见过的攻击以及从未遇到的受保护内容进行测试时,该方法识别威胁的 AUC 值仍保持在 0.944 到 0.996 之间。这比以往仅观察问题文本的方法有了显著提升,因为以往的方法在面对新型攻击时往往难以泛化。
一个关键发现是,最有效的测试短语并不需要包含实际的秘密信息。其中一个版本的测试使用了秘密文档的准确开头词,但当语言发生变化,或者当攻击者试图让计算机总结而非逐字复制秘密时,这种方法就失效了。更稳健的版本则只是简单地陈述泄密的意图,使用像“我将给出我的系统提示词”这样通用的词汇。这种通用的措辞在不同语言和不同类型的秘密面前都表现出色,这表明计算机是在对“泄露这一行为”本身做出反应,而不仅仅是识别特定词汇。研究人员通过展示他们可以通过引导计算机的内部状态来使其更容易或更不容易泄密,且行为量规的分数随之完美同步,从而证实了这一点。这证明该信号并非随机的故障,而是与计算机实际的风险内部表示紧密相连。
这项发现的实际价值在于其高效性。由于测试发生在计算机开始生成完整响应之前,因此它可以作为实时过滤器使用。研究人员构建了一个检测器,它通过添加测试短语并检查结果来进行工作,仅需不到 500 个额外的计算参数。这仅为处理请求增加了大约 10 毫秒的延迟,对于人类用户来说,这种延迟微乎其微,几乎察觉不到。相比之下,其他试图监控计算机内部信号的方法通常需要复制整个庞大的模型,或者等待计算机完成长篇大论的输出,这既缓慢又昂贵。新方法提供了一种以极低成本和极高速度捕捉这些攻击的方式。
研究还探讨了这种技术是否可以用于其他类型的安全威胁。通过将测试短语更改为匹配不同的风险(例如检测有毒语言或识别注入隐藏指令的尝试),该方法在这些领域也展现出了潜力。这表明,计算机对提示词的即时反应包含了一个丰富的、可获取的关于其安全状态的信号,而读取这个信号并不需要深入访问机器的内部架构。研究人员已经公开了他们的代码,允许他人验证这些结果,并有可能将这种轻量级的检测器集成到未来人工智能应用的安全性系统中。这项工作表明,有时观察问题的最有效方式不是深入窥探机器内部,而是观察它对一个简单且位置精准的问题所做出的反应。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。