Unforgettable Generalization in Language Models
本文研究了语言模型在通过随机标签进行微调以“遗忘”技能时表现如何,揭示了遗忘的泛化性具有高度的不可预测性和任务依赖性,即尽管输出在表面上呈现随机性,但这种遗忘往往无法扩展到特定的训练样本之外,且通过线性探测实验证明其底层任务能力依然完好无损。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个超级聪明的机器人朋友,它几乎读遍了互联网上的所有内容。它能写诗、解数学题,还能告诉你天空为什么是蓝色的。但有时,这个机器人会学到一些你不希望它知道的东西,或者它在某个特定的技巧上变得太擅长了,而你想让它“忘掉”这个技巧。这就是“机器卸载”(machine unlearning)的世界——这是一个人工智能研究领域,它提出了一个棘手的问题:我们能否让一个机器人真正地遗忘?
要理解这个实验,你需要先了解两件事。首先,这些机器人(被称为大语言模型)是通过阅读海量文本进行训练的,然后通过在特定示例上进行“微调”(fine-tuned)来提升在特定任务上的表现,比如回答科学问题。其次,一种常见的尝试让它们遗忘的方法是,再次向它们展示相同的问题,但把答案完全打乱或编造出来。其背后的逻辑是:如果通过这种方式让机器人感到足够困惑,它可能会彻底放弃学习那个主题。研究人员一直在追踪一个巨大的谜团:这种困惑会扩散吗?如果你让机器人在一个特定的问题上感到困惑,它是会忘记如何回答所有类似的问题,还是仅仅会对那一个特定的例子感到困惑?
伟大的“反训练”实验
在这篇论文中,来自麻省理工学院(MIT)的研究员 Eric Zhang、Leshem Choshen 和 Jacob Andreas 决定用一个名为 Llama2 的巨型语言模型来玩一场“卸载”游戏。他们把这个模型看作一名刚刚通过了考试的学生,然后试图通过用随机的、无意义的答案重新教导它,来让它忘掉所学的内容。他们想看看这个学生是会忘掉整个学科,还是仅仅忘掉被展示给它的那些特定练习题。
巨大的惊喜:这取决于学科类型
研究人员在 21 种不同类型的任务上测试了这一点,范围从“物理常识”(例如判断哪个物体更重)到“蕴含关系”(判断一个句子在逻辑上是否由另一个句子推导而来)。结果既疯狂又难以预测。
有时,这种“遗忘”效果非常完美。如果他们试图让模型忘掉如何进行蕴含分类(一种关于句子的逻辑谜题),模型就会变得一片空白。对于它从未见过的新问题,它会开始给出随机且无用的答案。就好像机器人已经失去了处理那种特定类型逻辑的能力。
但另一些时候,这种“遗忘”完全失败了。当他们试图让模型忘掉物理常识(如重力是如何运作的)或科学问题时,模型表现得非常固执。即使在接受了随机的错误答案训练后,它仍然能正确回答新的科学问题!这就像是一个被迫死记硬背特定练习题错误答案的学生,但在真正的考试到来时,他依然知道正确答案。模型似乎忘记了它被训练过的那些特定例子,但保留了它的通用知识。
这与测试难度无关
你可能会认为模型只会忘掉简单的东西而记住难的东西。研究人员对此进行了检查,结果发现事实并非如此。他们发现,任务的难度并不能预测模型是否会遗忘。例如,模型对“困难”的 ARC Challenge 问题比对“简单”的 ARC Easy 问题(两者都是科学问题)的记忆力反而更好。问题的难度并不重要;问题的类型才是关键。
秘密线索:置信度与“大脑”变异性
那么,是什么让一项技能变得容易或难以被遗忘呢?研究人员在模型的“大脑”(其内部数据表示)中发现了两个线索:
- 置信度(Confidence): 如果模型在开始遗忘实验之前对答案本身就很不确定,那么让它遗忘就更容易。如果模型很自信,它就会抓得更紧。
- 大脑变异性(Brain Variability): 这有点像观察模型的思想如何“摆动”。如果模型针对某项任务的内部“想法”(表示)非常杂乱(高变异性),那么擦除记忆就很难。如果想法非常一致且相似(低变异性),则模型更容易被“反训练”。
“浅层”遗忘
这是最令人脑洞大开的部分。即使模型看起来已经成功遗忘了某项技能——即对所有人都在给出随机答案——研究人员发现信息其实并没有消失。他们构建了一个简单的工具叫做“线性探测器”(linear probe,可以把它想象成一个微型的、专门的检测器),并观察了模型的内部“脑电波”。
令人惊讶的是,即使模型本身表现得好像一无所知,这个检测器仍然可以完美地读取出正确答案。这就像是一个学生在课堂上假装困惑并给出随机答案,但如果你去看他的笔记,正确的答案依然清晰地写在上面。这种“遗忘”只是表层的行为;深层的知识依然存在,等待着被发现。
总结
该论文得出结论:仅仅通过用随机答案进行重新训练来尝试让 AI 忘记特定技能是一种赌博。它对某些任务(如逻辑谜题)有效,但对其他任务(如科学和常识)则会失效。此外,即使看起来奏效,信息也并未真正被删除;它只是隐藏在了一层混乱之后。研究人员建议,在我们能够可靠地控制 AI 忘掉那些我们不想让它知道的内容之前,我们需要更深入地了解这些模型是如何学习和存储信息的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。