Leak@: Unlearning Does Not Make LLMs Forget Under Probabilistic Decoding
本文揭示了现有的大语言模型遗忘方法在概率解码下无法实现真正的遗忘,引入了\texttt{leak@}指标来量化这一漏洞,并提出了\texttt{RULE}算法以在多个基准测试中有效缓解知识泄露。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗易懂的语言和生动的类比对论文《Leak@k:在概率解码下,遗忘并未使大语言模型真正遗忘》的解释。
核心理念:“失忆”的幻觉
想象你雇佣了一位图书管理员(即人工智能),并要求他从馆藏中移除一本特定的、令人尴尬的书。你希望他彻底忘记这本书的故事,从此不再提及。
这篇论文的研究人员发现了一个令人震惊的事实:这位图书管理员实际上并没有忘记这个故事。
当你向图书管理员提问时,他通常会给出一个标准、安全的回答(就像机器人照着剧本念)。这被称为贪婪解码(Greedy Decoding)。在这种条件下,图书管理员看起来似乎成功忘记了那本书。
然而,如果你要求图书管理员“即兴发挥”或“展现创意”(这正是现实世界中人工智能的实际工作方式,称为概率解码(Probabilistic Decoding)),这位图书管理员会突然记起这个故事,并常常一字不差地讲给你听。所谓的“遗忘”只是我们测试方式造成的幻觉。
问题所在:“魔法八号球”与“水晶球”
要理解这篇论文,我们需要了解人工智能是如何做决策的:
- 贪婪解码(水晶球): 想象人工智能总是选择下一个最明显、最安全的词。这就像一颗水晶球,只向你展示最可能发生的未来。在这种模式下,人工智能成功隐藏了秘密。
- 概率解码(魔法八号球): 在现实世界中,人工智能并不只选择最可能的词;它会从一系列优质选项中挑选,有时会为了更具创意或更像人类而选择风险更高的路径。这就像摇晃一个魔法八号球。
- 发现: 论文发现,虽然人工智能透过水晶球看时能隐藏秘密,但当你摇晃魔法八号球足够多次时,秘密就会泄露。如果你用不同的“摇晃”(随机性)问同一个问题 64 次,秘密最终会暴露出来。
新工具:"Leak@k"
作者们意识到,当前的测试就像只在河流平静时检查大坝。他们需要在暴风雨中测试大坝的方法。
他们发明了一种新的衡量标准,称为Leak@k。
- 类比: 想象你试图检查一个筛子是否有漏洞。
- 旧方法: 你往筛子里倒一杯水。如果没有水漏出来?太好了,没有漏洞!(这就是旧的“贪婪”测试)。
- Leak@k 方法: 你往筛子里倒k杯水。即使第一杯水没有漏出,第 10 杯或第 50 杯也可能发现一个微小的漏洞并滴漏出来。
- 它衡量什么: 它计算的是,在多次尝试中,至少有一次会泄露秘密信息的概率。论文表明,对于几乎所有当前的“遗忘”方法,随着你增加杯子的数量(k),水(秘密)最终都会漏出来。
证据:“通往地狱的巴士”示例
论文提供了一个既有趣又严肃的例子,使用了关于新闻文章的数据集(MUSE)。
- 秘密: 一条公交线路的编号从 666(地狱)改为了 669。
- 测试:
- 贪婪模式: 人工智能说:“我不知道那条线路。”(成功!)
- 概率模式(64 次尝试): 人工智能最终说:“新的线路编号是 669。”(失败!)
这一现象在三个不同的主要测试(TOFU、MUSE 和 WMDP)中均发生了。无论秘密是虚构的作者姓名、新闻事实,还是危险的生物知识,一旦允许人工智能展现创意,“遗忘”就会失效。
解决方案:RULE(鲁棒遗忘)
既然旧方法就像试图用湿纸巾擦除纹身(看起来没了,但墨水还在),作者们创建了一种名为RULE的新方法。
工作原理: RULE 不再只是告诉人工智能“忘记这个特定的句子”,而是玩起了“打地鼠”游戏。
- 它多次向人工智能提问,观察它如何试图泄露秘密。
- 它在人工智能差点说漏嘴时将其抓住。
- 然后它教导人工智能也要忘记这些特定的失误。
- 它重复这个过程,每次变得更加严格。
结果: 使用 RULE,即使你摇晃魔法八号球 128 次,秘密也会保持隐藏。人工智能真正遗忘了,不仅是在它小心翼翼时,即使是在它展现创意时也是如此。
总结
- 问题: 当前的人工智能“遗忘”方法是虚假的。它们仅在人工智能被迫变得枯燥和可预测时才有效。
- 现实: 当允许人工智能展现创意时(这正是我们使用它的方式),它会记住我们让它忘记的事情。
- 修正: 作者们构建了一个新测试(Leak@k)来捕捉这种作弊行为,并构建了一种新训练方法(RULE)来真正让人工智能遗忘,即使在压力下也是如此。
论文得出结论:在我们用这种新的、更严格的"Leak@k"标准测试之前,我们不能信任当前的人工智能安全措施。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。