LLMs Can Leak Training Data But Do They Want To? A Propensity-Aware Evaluation of Memorization in LLMs
本文通过引入 PropMe 和 SimpleTrace 来证明,尽管大语言模型在对抗性攻击下具备复现训练数据的能力,但在普通的非对抗性设置中,其复现此类数据的倾向性显著较低,这表明记忆审计应当同时报告最坏情况下的可提取性和典型的泄露倾向。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,将大语言模型(LLM)视为一名极度痴迷的学生,他读完了整个图书馆的书籍(训练数据),并记住了其中的大量篇幅。
长期以来,研究人员一直在问一个问题:“如果我们诱导这个学生,他能背诵出某本书吗?” 答案总是“可以”。但本论文提出了一个更具实际意义的问题:“当我们只是正常提问时,这个学生真的想背诵那本书吗?”
以下是使用简单类比对该论文研究结果的解读。
1. 测试学生的两种方式
作者创建了一个名为 PROPME 的新测试框架,从两个不同的角度来观察记忆现象:
- “能力”测试(对抗性攻击): 想象一名侦探递给学生一本著名小说的第一句话,并对他说:“把这个故事写完。” 因为学生已经背下了这本书,所以他可以轻松地完美完成句子。这测试的是模型在受到推动时能做什么。
- “倾向性”测试(常规使用): 想象你向学生提一个普通问题,比如:“写一个关于猫的故事。” 这个提问并不是为了诱导他。这测试的是模型在日常生活中实际会做什么。
重大发现: 论文发现这两者之间存在巨大的鸿沟。如果你给学生正确的提示,他可以背诵那本书(能力);但当你只是正常要求写个故事时,他几乎不会这样做(倾向性)。
2. 新工具:SIMPLETRACE
为了证明这一点,作者构建了一个名为 SIMPLETRACE 的工具。
- 类比: 将训练数据想象成一个存放着数百万份文档、尘土飞扬的巨大仓库。当模型生成文本时,SIMPLETRACE 就像一位超级快速的图书管理员,能瞬间将模型说的每一个词与整个仓库进行比对。
- 它的作用: 它不靠猜测,而是寻找精确匹配。它能告诉你:“模型刚刚写的这句话,正是仓库中编号为 #892 的文档第 42 页的完美复刻。”这消除了所有的猜测和歧昧。
3. 实验:两个学生,两个图书馆
研究人员在两个数据集(图书馆)上测试了两个模型(学生):
- Comma: 一个在庞大英文图书馆上训练的模型。
- DFM Decoder: 一个以 Comma 为基础,随后在较小的丹麦语库(Dynaword)与部分英文混合数据上进行了“再训练”的模型。
他们使用三种类型的提示词让两个模型生成文本:
- 通用型(Generic): “讲个笑话。”(正常情况)
- 特定型(Specific): “讲一个关于丹麦文化的笑话。”(略微具有针对性,但并非诱导)
- 前缀型(Prefix): “这是一个来自图书馆的笑话开头:[真实笑话的前 50 个单词]。请完成它。”(这是诱导手段)
4. 他们的发现
- “诱导”效果最好: 当使用“前缀”诱导手段时,模型频繁泄露训练数据。它们可以背诵出长段且精确的内容。
- 日常生活很安全: 当使用正常提示(通用型或特定型)时,模型几乎不会泄露精确的文本。其“倾向性”(即泄露的可能性)非常低。
- “再训练”效应: 第二个模型(DFM Decoder),即在新的语言(丹麦语)上进行再训练的模型,在泄露原始英文书籍方面反而表现得更差了。这就像是这个学生因为忙于学习新的丹麦语图书馆,从而开始遗忘旧的英文细节一样。
5. 核心结论
论文认为,我们不能只观察“最坏情况”(即模型在被诱导时能做什么)。这就像是仅仅因为一辆车能开下悬崖,就判定这辆车很危险一样。
相反,我们需要衡量“日常风险”(即在正常驾驶时,模型会做什么)。
- 目前的审计: 主要检查模型是否能被诱导。
- 建议的审计: 应该既检查可诱导性,也检查日常情况下泄露数据的可能性。
简而言之: 这些模型就像是背下了整个图书馆的学生。如果你把枪口对准他们的头(或者给出一个特定的提示),他们会背诵出文本。但如果你只是找他们聊天,他们通常不会。论文建议,我们应该同时衡量“持枪胁迫”风险和“闲聊”风险,才能得到关于安全性的真实图景。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。