← 最新论文
💬 NLP

Forgotten in Weights, Recovered by Tools: Agentic Tool Unlearning for LLM Agents

本文介绍了智能体工具遗忘(Agentic Tool Unlearning, ATU),这是一个结合了参数知识抑制与轨迹级强化学习的两阶段框架,旨在防止大语言模型智能体通过外部工具恢复被遗忘的信息,同时保留其对保留知识的使用效用。

原作者: Baicheng Chen, Zheyuan Liu, Jingyu Zhang, Kaize Ding, Ningshan Ma, Yue Huang, Meng Jiang

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Baicheng Chen, Zheyuan Liu, Jingyu Zhang, Kaize Ding, Ningshan Ma, Yue Huang, Meng Jiang

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是许多现代数字助手背后的引擎,能够生成文本、回答问题并进行对话。多年来,研究人员一直致力于教导这些模型“忘记”特定信息,例如私人数据或受版权保护的故事,方法是通过调整存储知识的内部设置。这一被称为“机器卸载”(machine unlearning)的过程,旨在消除某些事实的影响,使模型无法再回忆起它们。然而,随着这些模型从简单的文本生成器演变为主动的智能体(agents),一个新的复杂问题出现了。这些智能体并不仅仅依赖其内部记忆;它们可以触及外部世界,利用网络搜索引擎或数据库等工具来实时寻找答案。这种转变创造了一个漏洞:即使模型已经成功在内部忘记了某个事实,它仍可能从互联网检索到该事实并将其作为自己的答案呈现出来,从而有效地绕过了遗忘过程。

一个研究小组识别出了这种特定的失效模式,称之为“工具介导的恢复”(tool-mediated recovery),并开发了一种新方法来弥补这一差距。在他们的研究中,他们证明了当模型作为拥有外部工具访问权限的智能体部署时,标准的知识卸载技术是不充分的。他们发现,虽然模型在孤立测试时可能表现出已经忘记了某项信息,但一旦允许其搜索网络或查询数据库,它就能轻易地恢复该信息。为了解决这个问题,研究人员提出了一个两阶段训练框架。第一阶段执行传统的任务,即抑制对不想要信息的内部记忆。第二阶段更为复杂;它在模拟环境中训练模型作为一个智能体行动,学习识别何时搜索或调用工具会导致获取禁忌信息,并转而选择停止或提供安全、不泄露信息的响应。

研究人员在涉及名人及受版权保护书籍的现实场景中测试了这种方法。在一组实验中,他们测量了被卸载知识的模型意外泄露信息的频率。当模型作为没有工具支持的标准文本生成器使用时,它成功避免了信息的泄露。然而,一旦给予该模型访问搜索工具的权限,其隐藏信息的能力便会崩溃,开始以更高的频率泄露被遗忘的事实。例如,在一次针对公众人物的测试中,当启用工具后,意外泄露的速率从孤立状态下的低水平跃升至高水平。这证实了工具本身正充当着一种恢复通道,允许模型重建那些本应被删除的知识。

为了解决这一问题,研究人员应用了他们的两阶段方法。在初始的内部卸载之后,他们让模型进入第二阶段训练,即在受控设置中练习与工具交互。在此阶段,即使工具提供了禁忌信息,如果模型避开了这些信息,也会获得奖励;如果模型试图利用工具寻找该特定数据,则会被惩罚。结果显示,这种额外的训练显著降低了模型通过工具恢复被遗忘信息的能力。在针对公众人物的测试中,与仅经过第一阶段卸载的模型相比,该方法大幅降低了意外泄露的速率。同样,在涉及版权书籍内容的测试中,该方法防止了模型利用本地数据库来检索隐藏的文本。

至关重要的是,研究人员确保了这种新方法不会破坏模型的正常功能。他们验证了模型仍然可以有效地为不涉及禁忌信息的任务使用工具,例如查找常识性事实或进行计算。训练并未迫使模型拒绝所有工具使用,或变得不再有用;它只是教会了模型划定界限,知道何时停止搜索以保护特定的敏感数据。这项研究表明,为了使卸载在现代智能体时代真正有效,必须考虑这些智能体如何与世界互动,而不仅仅是它们如何在内部存储数据。通过训练模型抵御利用工具恢复已删除知识的诱惑,研究人员为确保被遗忘的信息即使在联网的数字环境中也能真正被遗忘,创造了一种更稳健的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →