← 最新论文
🤖 AI

Can Scientific Claims Be Removed from Large Language Models? A Systematic Evaluation of Claim-Level Unlearning

本文引入了科学断言遗忘(Scientific Claim Unlearning)这一任务以及一个新的基准测试 SciUnlearn,旨在证明当前的机器遗忘方法无法有效地从大语言模型中移除相互关联且不断演进的科学断言,往往仅导致表层的抑制而非真正的知识消除。

原作者: Snigdha Paul, Manasi Patwardhan, Arman Cohan

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Snigdha Paul, Manasi Patwardhan, Arman Cohan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代人工智能系统,通常被称为大型语言模型,扮演着人类知识庞大图书馆的角色。它们通过阅读海量的文本(包括科学论文)进行训练,以此学习如何回答问题和解决问题。然而,科学并非一个静态的档案库;它是一个不断修订、充满活力的过程。当一项新研究证明旧观点错误,或者一篇论文因错误而被撤回时,科学记录会随之更新。问题在于,这些人工智能模型并不会自动更新自身。一旦它们学习了一个事实,即使在科学界已宣布该事实为假之后,它们往往仍会坚持持有这一观点。这造成了一种风险,即人工智能可能会自信地重复过时或被证伪的信息,从而可能误导研究人员,甚至在医学等领域造成危害。

为了解决这个问题,研究人员开发了一种称为“机器遗忘”(machine unlearning)的技术。其目标是教会模型“忘记”特定的信息片段,同时保持其回答其他问题的能力。想象一位图书管理员,必须从书架上移除一本特定的、错误的图书,而不干扰图书馆中的其他书籍,也不失去寻找其他书籍的能力。虽然这种技术已在移除个人数据或受版权保护的材料方面得到了测试,但科学家们尚未找到如何有效移除特定科学主张的方法。这些主张之所以棘手,是因为它们是深度互联的;了解一个事实往往依赖于对许多其他事实的理解。如果你试图移除一个事实,模型可能会仅仅通过稍微改变措辞来让该知识保持存活,或者它可能会意外地忘记其他所有内容。

来自 TCS Research 和耶鲁大学的研究团队致力于解决这个特定问题。他们创建了一个名为 SciUnlearn 的新测试环境,以观察当前的人工智能模型是否真的能够忘记科学主张。他们利用来自计算机科学和医学领域的真实科学论文构建了一个数据集,其中包括一组已被正式撤回的论文。对于每篇论文,他们提取了核心科学主张,并将它们转化为各种类型的题目,例如多项选择题、判断题和填空题。为了确保测试公平,他们将问题分为两组:一组用于教模型去忘记,另一组是基于相同底层事实的改写问题,用以观察模型是真的忘记了该概念,还是仅仅记住了特定的问题。

随后,研究人员采用了现有的遗忘方法并将其应用于这些模型。他们要求模型忘记第一组问题,然后测试它们在第二组问题以及一般性知识问题上的表现,以确保模型并未变得毫无用处。结果是具有启发性的。这些方法在让模型在受训要忘记的特定问题上表现失败方面效果良好。然而,当面对测试相同底层科学主张的改写问题时,模型往往仍然能答对。这表明模型并没有真正移除知识,而仅仅是抑制了训练问题中所使用的特定词汇模式。这就像是模型学会了忽略某个特定的句子,而不是抹除其背后的事实。

研究还观察了模型对其他无关信息的记忆能力。一些试图忘记目标主张的方法也无意中降低了模型回答一般性问题的能力,而另一些方法则设法保持了其余知识的完整性。研究人员发现,忘记一个主张的难度取决于该主张在科学文献中的嵌入深度。那些被许多其他研究频繁引用的论文中的主张要难移除得多。这些高引用率的思想被广泛的相关文本交织成一张复杂的网,使得它们在单次遗忘尝试面前具有极强的抵抗力。相比之下,来自引用较少论文的主张较容易被破坏,即便如此,这种遗忘通常也仅限于问题的精确表层形式。

最终,这项研究得出结论:目前的方法尚无法实现真正的科学主张遗忘。它们可以隐藏知识的具体实例,但在移除底层的概念性理解方面仍感到吃力。研究人员建议,未来的工作需要专注于能够针对模型知识中更深层、更结构化连接的方法,而非仅仅是抑制表层的模式。在此之前,这些人工智能模型可能会继续背负着过时科学的重担,固守着世界早已抛弃的事实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →