← 最新论文
🤖 machine learning

Continual Fine-Tuning of Large Language Models via Program Memory

本文介绍了 ProCL,这是一种持续微调框架,通过将低秩适应(LoRA)适配器组织为结构化的、可动态检索的程序内存槽来增强大语言模型,从而在快速适应与知识保留之间实现有效平衡,进而无需增加推理成本即可缓解灾难性遗忘。

原作者: Hung Le, Svetha Venkatesh

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Hung Le, Svetha Venkatesh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《通过程序记忆对大型语言模型进行持续微调》(ProCL)的通俗解释,辅以生动的类比。

核心难题:“金鱼”与“海绵”

想象你有一个非常聪明的机器人(大型语言模型,LLM),它知晓世间万物。你希望它能随时间推移学习新事物,比如先学习如何诊断某种特定疾病,接着学习如何推荐治疗方案,随后再学习如何起草法律合同。

问题在于灾难性遗忘

  • 金鱼模式:当你教机器人一项新技能时,它往往会“覆盖”掉旧记忆。它学会了推荐治疗方案,却忘了如何诊断。
  • 海绵模式:如果你毫无计划地试图一次性教它太多东西,海绵吸饱了水,既无法容纳新的水滴,或者水混合成了一团浑浊的泥水。

现有的方法(如标准的 LoRA)试图通过给机器人添加一个小“笔记本”来记录新事物以解决此问题。但如果你持续在同一本笔记本上书写,新笔记最终会模糊掉旧笔记。

解决方案:ProCL(程序记忆)

作者提出了一种名为ProCL的新方法。他们从人类大脑的运作方式中汲取灵感,具体来说是互补学习系统理论。

把你的大脑想象成拥有两个主要部分:

  1. 海马体(快速记忆):用于快速、临时的学习。它能迅速抓取新信息,但杂乱无章且遗忘很快。
  2. 皮层(慢速记忆):用于长期、稳定的知识。它学习缓慢,但能永久安全地保存信息。

ProCL 试图在机器人的“笔记本”内部构建完全相同的系统。

ProCL 如何运作:“模块化车间”

ProCL 不再使用一本大笔记本,而是将机器人的学习空间变成了一个拥有许多专用工具箱(称为“程序”或“记忆槽”)的车间

以下是具体步骤:

1. “指纹”检查(输入条件注意力)

当机器人收到一个新问题(例如“我如何治疗骨折?”)时,它不会直接把答案扔进主笔记本。

  • 类比:想象繁忙办公室里的接待员。当客户走进来时,接待员会查看他们的身份证(即“指纹”)。
  • 行动:接待员会检查:“哦,这是一个医疗问题。去3 号工具箱。”如果下一位客户询问法律事务,他们会被送往7 号工具箱
  • 结果:机器人仅更新与当前任务相关的具体工具箱。它不会触碰其他工具箱。这防止了旧记忆的“模糊”。

2. “稳定基石”(原始适配器)

即使在使用特定工具箱时,机器人也保留着一个主蓝图(原始适配器权重),该权重在单个任务的训练过程中永不改变。

  • 类比:将主蓝图想象成房子的地基。你可以利用工具箱添加一个新房间(一项新技能),但地基保持稳固,确保房子不会倒塌。
  • 结果:这确保了机器人即使在习得新事物时,也能记住它曾学过的所有内容的基础部分。

3. “夜间清理”(巩固)

白天(训练期间),机器人忙于使用工具箱。但在夜间,它会执行一个巩固步骤

  • 类比:想象一位厨师在白天使用不同的香料罐来制作不同的食谱。在一天结束时,厨师将使用过的香料平均量混合到一个“主香料混合罐”中。
  • 行动:机器人将从特定工具箱中学到的内容,温和地折叠进主要的、永久性的记忆中。
  • 结果:新知识成为机器人永久个性的一部分,但这种融合方式不会抹去旧内容。

为何此法特殊

  • 无额外成本:当机器人实际工作(推理)时,它不需要检查接待员或打开多个工具箱。它只需使用最终的“主香料混合罐”。其速度与普通机器人一样快。
  • 更好的保留能力:论文表明,这种方法阻止了机器人遗忘旧任务。在测试中,当机器人学习新问题时,它在旧问题上的准确率保持得比其他方法好得多。
  • 更少的干扰:由于不同任务进入不同的“工具箱”,它们互不冲突。

局限性(潜在问题)

作者诚实地指出了该方法可能失效的地方:

  1. 过于相似的任务:如果机器人被要求学习两件几乎相同的事情(例如“如何烤蛋糕”和“如何烤松饼”),接待员可能会混淆,将两者都发送到同一个工具箱。如果任务过于相似,“专业化”就会失效。
  2. 固定数量的工具箱:机器人拥有固定数量的工具箱(例如 4 个或 16 个)。如果你试图教它 1000 种完全不同的、不相关的技能,它可能会耗尽空间,迫使新任务与旧任务共享工具箱,从而导致某种程度的遗忘。

总结

ProCL 就像是给机器人配备了一套智能归档系统,而不是单本杂乱的笔记本。它根据信息的内容将其分类到特定的文件夹中,在下方保持稳定的基础,并在一天结束时将新学到的内容温和地合并到主文件中。这使得机器人能够持续学习而不遗忘过去,同时在真正执行任务时不会降低速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →