Inadvertent Context Leakage in Language Models
本文表明,先进语言模型会通过其对普通提示词的良性响应,无意中泄露诸如凭据和健康记录等敏感的上下文机密,这揭示了该漏洞是模型能力的固有副产品,而非可修复的缺陷。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代人工智能正越来越多地被要求充当个人助手,管理日历、阅读私人邮件,并持有健康记录或财务数据等敏感细节。为了实现这一目标,计算机程序必须在工作时将其中的秘密保存在其即时记忆中,研究人员称之为“上下文窗口”的空间。普遍的观点一直是:如果模型被告知要保守秘密并且拒绝说出它,那么这个秘密就是安全的。安全检查通常像一个简单的过滤器一样运作:如果计算机生成的文本不包含该秘密的逐字内容,系统就认为没有发生泄露。这种方法将对话视为单一的通信渠道,假设未说出口的内容也是未知的。
然而,一项新的研究表明,这种观点是不完整的。研究人员发现,即使模型正确地拒绝透露秘密,它构建句子的方式本身也携带了关于该秘密的隐藏线索。秘密改变了模型的内部状态,而这种改变会波及到它生成的文本中,以人类读者无法察觉、但计算机可以检测到的方式,改变词汇选择、句子长度和格式的模式。这就像模型虽然闭上了嘴巴,却通过声音的另一个部分在低声诉说着秘密。
这项研究背后的团队与八个最先进的语言模型一起工作,旨在测试这些隐藏信号是否真实存在。他们创建了一个场景:给模型一个秘密数字并指示其保持机密。然后,他们要求模型执行普通的、无害的任务,例如写一个短篇故事或生成一份统计数据列表。模型在被问及是否可以直接说出该数字时始终能够拒绝,通过了所有标准的安全性检查。然而,当研究人员分析模型针对这些无害请求所生成的文本时,他们发现该秘密数字被编码在了输出结果的统计特性中。
为了证明这一点,研究人员构建了一个专门的解码器,这是一种经过训练、旨在倾听这些特定统计模式的工具。当他们将良性的文本输入这个解码器时,它成功地以惊人的准确度重建了秘密数字。对于两位数的秘密,解码器在几个顶级模型中几乎完美地恢复了完整数字。即使对于更难通过随机猜测获取的四位数秘密,在最强大的模型上,解码器也能在约82%的情况下实现精确匹配。这发生时,模型从未被诱导说出该数字,攻击者也没有任何访问模型内部机制的特殊权限;他们只看到了最终的文本,就像普通用户看到的一样。
研究表明,泄露信息的能力并非一个可以轻易修复的漏洞,而是模型智能的一个副作用。模型越擅长遵循指令和理解复杂任务,它对记忆中的秘密就越敏感,从而在无意中泄露的信息也越多。研究人员测试了来自不同公司的模型,包括 Anthropic、Google、OpenAI 和 xAI。他们发现,虽然有些模型比其他模型更具抵抗力,但最强大的模型通常泄露的信息也最多。事实上,那些最擅长遵循“保守此秘密”指令的模型,往往是通过这些微妙渠道泄露信息最多的模型。这表明,使这些助手变得有用且顺从的机制,正是使它们变得脆弱的原因。
研究人员还探索了这种泄露是否可以被用来了解用户除了数字之外的私人生活。他们测试了模型的输出是否可以揭示特定的记忆(例如某种健康状况或财务事件)是否存在于其上下文中。通过使用一个训练好的分类器,他们发现模型的常规响应可以以远高于随机猜测的成功率揭示这些记忆的存在。即使模型从未在文本中提到该记忆,情况依然如此。研究表明,受用户私人数据影响的模型内部状态,会在它写的每一句话上留下统计学上的指纹。
或许最令人担忧的是一个实验,研究人员尝试从一个模拟的个人代理中提取一个完整的九位社会安全号码。在这种情景下,攻击者不仅是在倾听泄露,还积极设计对话,迫使模型将秘密编码到其响应的一个特定特征中,例如使用的感叹号数量。通过使用一种优化提示词以触发此行为的技术,攻击者在其中一个领先模型上,成功回收了近97%的尝试中出现的第一个数字,并在约76%的案例中回收了剩余的八位数字。即使在上下文非常长(包含数十万个单词)的情况下,且尽管模型从未写出该数字,这种方法依然奏效。
研究结论是,目前保护这些系统中隐私的方法是不充分的。仅仅告诉模型要谨慎,或者过滤其输出中的特定词汇,并不能阻止信息通过语言的统计模式进行泄露。研究人员认为,只要模型在生成文本时在其即时记忆中持有私人数据,该数据就会以可以被解码的方式影响输出。他们建议,解决这个问题需要的不仅仅是更好的指令或过滤器;它可能需要一种根本性的变革,即如何训练这些模型,以确保它们的输出在统计上与其持有的秘密保持独立。在此之前,我们托付给数字助手的秘密,可能在机器的记忆中还不如在我们自己的脑海里安全。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。