想象你有一位博学且训练有素的图书管理员(即大型语言模型),他精通历史、科学和烹饪。你希望每天教这位图书管理员新技能:今天是编程,明天是总结法律文件,后天是写诗。
传统教学方法的弊端在于,每当学习新技能时,图书管理员都必须重写自己的“大脑”。每次学习新技能,都会意外擦除或打乱旧记忆。这被称为“灾难性遗忘”。例如,如果他学会了编程,可能会忘记如何写诗。
CRAFT 是一种全新的教学方法,它无需重写大脑即可解决这一问题。以下是其工作原理,通过简单的类比来说明:
1. 用“便利贴”代替重写大脑
CRAFT 不是强迫图书管理员修改其永久记忆(即模型的权重),而是给他一叠便利贴(干预措施)。
- 大脑:图书管理员的原始知识保持冻结且不受干扰,永不改变。
- 便利贴:当新任务到来时,CRAFT 会在一张便利贴上写下一条微小的、低秩的“指令”,并将其贴在图书管理员当前的思维过程上。
- 结果:图书管理员可以借助这张便利贴完美完成新任务,但其原始大脑保持原样。由于大脑本身未被触碰,旧记忆不会被擦除。
2. “智能分类器”(路由)
你不能为每个任务随意给图书管理员一张便利贴,那样会陷入混乱。CRAFT 使用一个智能分类器来整理这些便利贴。
- 预热:当新任务到来时(例如“总结会议”),CRAFT 会简要尝试一下,观察它产生什么样的“风格”或输出。
- 匹配:它将这种风格与已有的便利贴组进行比较。
- 如果新任务感觉像“财经新闻”,它就会被归入现有的“金融”便利贴组。
- 如果它感觉完全不同,比如“编写 Python 代码”,它就会获得一个全新的组。
- 无需额外大脑:关键在于,这个分类器本身不需要学习任何新东西。它只需观察输出,然后判断:“哦,这看起来像 A 组”,或者“这是新的,让我们建立 B 组”。
3. “守护者”(遗忘控制)
这是最巧妙的部分。当图书管理员利用便利贴学习新任务时,存在新便利贴可能意外扰乱同一组中旧便利贴的风险。
- 锚点:CRAFT 会在新任务到来之前,对该组已掌握的内容进行“快照”记录。这就是锚点。
- 安全检查:在图书管理员学习新任务的过程中,CRAFT 会不断检查:“你是否偏离了该组原本所知的内容太多?”
- KL 信号:它使用一种名为KL 散度的数学度量(可将其视为“漂移计”)来衡量新行为与旧行为之间的距离。
- 如果漂移很小,新便利贴就可以安全保留。
- 如果漂移巨大(意味着新任务差异太大,会破坏旧任务),系统会停止训练或将任务移至新组。
- 合并:一旦任务被安全地学会,新便利贴就会被合并回该组共享的堆栈中,更新该组的知识,同时不破坏旧内容。
为什么这更好?
- 高效性:与其他方法相比,它使用的“便利贴”(参数)少得多,因为它在相似任务之间共享便利贴。
- 无遗忘:由于原始大脑被冻结且便利贴得到精心管理,图书管理员在学习今天的内容时,能记住昨天所学的一切。
- 简洁性:它不需要复杂的“门控”系统来决定做什么;它只需观察输出并自然地进行组织。
核心结论
CRAFT 将持续学习视为整理便利贴图书馆,而非“重写大脑”。通过保持大脑冻结,并使用单一的“漂移计”确保新便利贴不会破坏旧便利贴,它使大型语言模型能够持续学习而不会忘记自己是谁。
技术摘要:CRAFT——面向持续学习的遗忘感知干预式适配
1. 问题陈述
大型语言模型(LLM)在通过微调适配新任务时,会遭受灾难性遗忘。这是因为标准微调会更新编码先前知识的相同参数,从而在可塑性(学习新任务)与稳定性(保留旧任务)之间产生固有的权衡。现有解决方案——如正则化(例如 EWC)、重放机制或 LoRA 池等架构约束——均在参数空间内运作,而冲突正源于此。这些方法通常依赖学习到的门控机制(其本身易受遗忘影响)或无法捕捉演变中的共享知识的固定参考。
本文提出,持续学习不应被重新定义为参数竞争问题,而应被视为表示级干预的组织与控制问题。通过保持骨干网络权重冻结并在低秩子空间中编辑隐藏表示,可以消除权重级干扰的根源。然而,基于表示的学习仍面临挑战:如何在相似任务间共享容量而不迫使无关任务相互竞争,如何在无需学习门控的情况下进行任务路由,以及如何在适配过程中控制遗忘而不限制效率。
2. 方法论:CRAFT
CRAFT(持续表示锚定微调)是一个完全在表示空间内执行路由、适配和合并的框架,无需修改模型权重。它利用LoReFT(低秩线性子空间重调),通过低秩干预函数 Φ(h(l);ϕ)=h(l)+R⊤(Wh(l)+b−Rh(l)) 在特定 token 位置编辑隐藏状态 h(l)。
该框架由单一的Kullback–Leibler (KL) 散度信号驱动,在三个统一阶段中运作:
A. 干预架构
CRAFT 将干预分散在残差流中的两个提示流上:
- f-stream:应用于前 tpos 个 token(前缀),编码指令。
- l-stream:应用于后 tpos 个 token(后缀),在此处输出被确定。
相似任务组 Sk 内的任务共享一个共同的干预状态 ϕSk,而不同组间的任务则保持隔离。
B. 确定性路由(无需学习门控)
CRAFT 不使用可训练的路由器,而是利用输出分布散度来分配任务:
- 预热:新任务 τt 从共享随机种子开始进行短暂的预热(Swu 步),以生成临时干预 ϕ~(t)。
- 距离计算:将输出分布 πϕ~(t) 与现有组 Sk 的存储分布进行比较,使用归一化对称 KL 距离:
d(t,k)=max(min(DK,DGk),ϵ)DKGk
其中 DK 是新任务与基线的距离,DGk 是组与基线的距离,DKGk 是任务与组之间的距离。
- 分配:如果 d(t,k)≤δ,则该任务加入组 Sk。否则,将初始化一个新组。此过程无需可训练的路由参数或任务标识符。
C. KL 正则化适配与合并
一旦分配到组 Sk:
- 锚定:将组的当前状态 ϕSk 冻结为锚点 ϕanchor。
- 训练:在 KL 损失函数的约束下,针对新任务训练任务的干预 ϕ(t):
Ltotal=Lτ(ϕ(t))+β⋅KL(πϕanchor∥πϕ(t))
KL 项作为一个统一信号,起到以下作用:
- 正则化训练以防止偏离组的先验知识。
- 预测遗忘:基于经验法则(Shenfeld 等人,2025),高 KL 散度与遗忘相关。如果初始 epoch 的平均 KL 超过阈值 η,则该任务将被驱逐至新组。
- 合并:收敛后,训练好的 ϕ(t) 将覆盖共享状态 ϕSk。
3. 主要贡献
- 干预级持续学习:CRAFT 是首个完全在表示空间内联合执行路由、适配和合并且无需修改模型权重的框架。
- 无需学习门控的确定性路由:它利用短暂的预热和输出分布 KL 距离来分配任务,消除了对可训练路由参数的需求,使路由器对遗忘具有鲁棒性。
- 统一的遗忘控制:它引入了单一的基于 KL 的信号,同时调节训练漂移、预测遗忘并管理新知识整合,取代了分散的启发式方法。
- 实证验证:该方法在三种不同的 LLM(Llama-3.2-1B、Gemma-2B、Llama-2-7B)和多样化的基准测试(TRACE、Math-LLM、O-LoRA 序列)上得到了验证。
4. 实验结果
CRAFT 与强基线方法进行了对比评估,包括 SeqLoRA、GEM、EWC、L2P、DualPrompt、HiDeLoRA、O-LoRA、TreeLoRA 以及 SAPT 和 TASL 等最新方法。
- 性能提升:与最佳最先进方法相比,CRAFT 将整体性能(OP)提高了高达 8.03%(在 Llama-3.2-1B 上)。
- 遗忘减少:它将反向迁移(BWT)遗忘率降低了高达 6.49%。在 Llama-3.2-1B 的 15 任务流中,CRAFT 实现了 2.60% 的 BWT,而 TreeLoRA 为 6.41%,O-LoRA 为 10.99%。
- 参数效率:CRAFT 使用的可训练干预参数比强 LoRA 基线少 3.75 倍。例如,在 Llama-3.2-1B 上处理 15 个任务时,CRAFT 仅需 4.20M 参数,而标准 LoRA 需要 15.73M。
- 鲁棒性:该方法在不同任务顺序下保持鲁棒,且在宽泛的平稳区内对路由阈值 δ 和预热长度 Swu 的变化不敏感。
- 跨组不变性:理论和实证分析证实,在一个簇中训练任务不会影响其他簇中任务的推理输出,因为优化器范围仅触及特定组的干预。
5. 意义与主张
本文主张,在表示空间中控制适配,并由输出空间散度引导,提供了一种可扩展且 principled(有原则)的持续学习方法。
- 重新定义权衡:通过移除权重更新,CRAFT 将稳定性 - 可塑性权衡从参数空间的拉锯战转变为组织表示编辑的问题。
- 有原则的遗忘控制:利用 KL 散度作为统一信号,使系统能够直接测量和控制遗忘,而非依赖代理指标。
- 可扩展性:该框架随发现的任务组数量(K)而非任务总数(T)进行扩展,为长任务流提供了更高效的解决方案。
- 局限性:作者承认,路由机制在处理接近天花板性能的任务或任务近乎重复但顺序呈现的流(例如同一数据集的两个部分)时可能会遇到困难,因为对称 KL 距离可能会饱和。他们建议未来的工作可以涉及从现有簇初始化预热以处理此类情况。
本质上,CRAFT 证明了通过结构化的表示编辑,可以在模型输出层面有效控制灾难性遗忘,而无需约束或修改底层基础权重。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。