✨ 要点🔬 技术摘要
想象一下,你正在教导一位聪明但僵化的学生(大型语言模型)如何解决复杂的谜题,例如数学问题、编程挑战或事实核查难题。
传统上,当我们希望这位学生变得更好时,我们会强迫他们通过重写大脑(更新模型的内部参数)来死记硬背 新规则。这就像把一块海绵浸在新水中,然后将其挤干。问题在于:一旦你挤干它,旧水(他们原有的通用知识)就会漏掉。他们会在你教给他们的特定谜题上表现得非常出色,但却忘记了如何成为一个优秀的通用思考者,并且在面对下一个 谜题时会感到吃力。这被称为“灾难性遗忘”。
另一方面,你也可以为每个特定的谜题给学生一张小抄 (提示词)。这种方法既便宜又快速,但学生仍然必须依赖他们原有的脑力。如果谜题太难,仅靠小抄还不足以获得满分。
“快与慢”的解决方案 这篇论文介绍了一种名为**快慢训练(Fast-Slow Training, FST)**的新训练方法。它将学生的过程视为一个双轨系统,结合了两种方法的优势:
慢速轨道(大脑): 这是模型的永久权重。它像长期记忆一样缓慢学习。它专注于保持学生的核心推理技能和通用知识完整无损。
快速轨道(小抄): 这是“上下文”或提示词。它像一张临时的便利贴一样学习得非常快。它吸收当前任务的具体、棘手的细节,而不会永久改变学生的大脑。
工作原理(类比) 想象一下,你正在训练一位厨师(人工智能)烹饪一道新的、困难的菜肴。
旧方法(仅慢速学习): 你强迫厨师通过重写其整个烹饪理念来死记硬背食谱。他们变得非常擅长这一道菜 ,但却忘记了如何烹饪其他任何菜肴,并且如果你稍后要求他们烹饪一个略有不同的版本,他们也无法适应。
FST 方法: 你保持厨师的基本技能(慢速轨道)完全不变。相反,你给他们一张动态演变的食谱卡 (快速轨道)。
每当厨师尝试这道菜并犯错时,“教练”(系统)会查看错误,并立即在食谱卡上更新一条具体的提示(例如:“直到第 3 步之前不要加盐”)。
厨师使用这张更新后的卡片再次尝试。
只有在厨师利用这些卡片掌握了这道菜之后,我们才会对其基本的烹饪风格(慢速轨道)进行微小、谨慎的调整。
为何这种方法更优(结果) 论文声称,这种方法在三个主要方面胜出:
更快、更便宜: 因为“食谱卡”(快速轨道)可以瞬间吸收新信息,系统学习任务的速度要快得多。论文指出,达到与旧方法相同的性能水平,它所需的尝试次数最多可减少3 倍 。
不会遗忘: 因为厨师的基本大脑(慢速轨道)没有被不断重写,所以他们不会失去通用的烹饪技能。论文显示,模型能保持更接近其原本聪明的状态,这意味着它不会“忘记”如何成为一个通用推理者。
为下一个挑战做好准备: 由于厨师的大脑没有在首道菜上过度专业化,他们可以立即开始学习新 菜肴,而无需“遗忘”旧菜肴。论文通过在训练中途切换任务来测试这一点,FST 模型平稳地适应了变化,而旧模型则完全停滞不前。
秘诀:厨师团队 论文还提到一个巧妙的技巧:他们不是只使用一张 食谱卡,而是维护一个不同食谱卡的团队 (提示词群体)。有些卡片擅长数学,另一些擅长编程。系统将它们混合使用,允许“慢速轨道”看到多种解决问题的方法,这有助于它在避免混淆的情况下学得更好。
总结 这篇论文认为,我们不应强迫人工智能模型通过重写大脑来死记硬背每一个新任务。相反,我们应该让他们保留通用智能(慢速),同时赋予他们一套超快速、可适应的指令(快速)来处理特定任务。这使得他们更聪明、训练速度更快,并且在学习新事物时不会忘记旧事物。
技术摘要:快与慢的学习:迈向持续适应的大语言模型
问题陈述
大语言模型(LLMs)通常通过参数更新(如监督微调 SFT 或强化学习 RL)来适应下游任务。尽管这种方法行之有效,但它迫使模型将所有特定任务的信息吸收进单一且持久的权重集合中。这造成了一个根本性的瓶颈:提升领域内性能的更新会同时将模型推离其基础行为,导致输出熵降低、分布外(OOD)泛化能力下降,并引发“可塑性丧失”——即无法有效适应未来任务。相反,上下文学习(例如提示优化)允许在不修改权重的情况下进行快速、低成本的适应,但通常无法达到通过参数更新所能实现的性能上限。本文认为,将学习局限于上下文机制或权重机制中的任何一种都是次优的,且现有方法未能利用两者互补的优势。
方法论:快慢训练(FST)
作者提出了快慢训练(Fast-Slow Training, FST) ,这是一个联合优化两个互补适应通道的框架:
慢权重(θ \theta θ ): 模型参数,通过带有可验证奖励的强化学习(RLVR)进行不频繁且高成本的更新。这些权重编码了长期存在且持久的行为。
快权重(Φ \Phi Φ ): 一组文本上下文(提示、指令),通过反思性提示进化(GEPA)进行频繁且低成本的更新。这些权重捕捉瞬态的、特定于任务的信号。
训练循环
FST 在长度为 T T T 的周期内交错运行两个更新循环:
快循环(上下文优化): 系统使用当前策略 π θ \pi_\theta π θ 生成轨迹。一个冻结的“反思”大语言模型分析这些轨迹(包括思考过程、工具调用、错误和反馈),以提出文本变异。GEPA 维护一个包含 K K K 个提示的帕累托前沿种群 ,而非单个最佳提示。该种群保持了多样性,允许不同的提示在任务分布的不同子集上实现专业化。
慢循环(参数更新): 策略 θ \theta θ 使用带有截断代理目标(CISPO)的组相对策略优化(GRPO)进行更新。关键在于,在为 RL 更新生成轨迹时,系统从 K K K 个快提示的整个种群 中进行采样。优势计算对整个组内的奖励进行归一化,混合了由提示和采样过程共同引起的变异。
这种协同进化使得快权重能够立即吸收特定任务的教训(例如特定的启发式方法或错误修正),从而引导模型走向更好的推理。随后,慢权重在此不断演变的上下文下进行更新,防止模型过度专业化于单个静态提示,或偏离基础策略过远。
主要贡献
框架集成: 本文将源自神经科学和早期神经网络文献的快/慢权重理论概念实例化,应用于大语言模型的后训练,具体结合了用于权重的 RLVR 和用于提示的 GEPA。
帕累托前沿提示种群: 与优化单个提示的先前工作不同,FST 维护一个多样化的提示种群。这使得 RL 代理能够在同一优势计算中比较不同条件行为下的响应,从而提供更丰富的梯度信号。
交错优化: 该方法避免了顺序式的“先训练后微调”范式。相反,它允许策略和提示种群协同进化,其中提示种群适应当前策略,而策略适应不断演变的提示。
实验结果
作者使用 Qwen3-8B 作为基础模型,在三个推理领域评估了 FST:CodeIO(代码输出预测)、Polaris(数学)和 HoVer-hard(多跳事实验证)。
数据效率: FST 在显著更少的步数内达到了标准 RL 的运行峰值性能:在 CodeIO 上减少了 3.0 倍 ,在数学任务上减少了 1.4 倍 ,在 HoVer-hard 上减少了 3.0 倍 。
性能渐近线: FST 始终达到比单独使用 RL 更高的性能上限。例如,在 HoVer-hard 任务上,拟合的渐近线从 17.3%(RL)提升至 25.0%(FST)。
减少模型漂移: 在匹配奖励水平的情况下,与仅使用 RL 的模型相比,FST 训练的模型与基础策略的 KL 散度降低了高达 70% 。这表明慢权重更接近基础配置。
保持可塑性: 在两阶段训练实验(先训练任务 X,再训练任务 Y)中,FST 启动的模型保留了有效学习任务 Y 的能力。相比之下,仅使用 RL 的模型在第二个任务上往往崩溃至接近零的性能,表现出严重的可塑性丧失。
持续学习: 在每 200 步切换一次任务领域的设置中,FST 能够快速适应新目标,而仅使用 RL 的模型则在初始任务之后停滞或无法获取新任务。
机制分析:
观察 1: 快权重比慢权重更快地获取任务信号。在一个合成星图任务中,FST 在第 ~50 步时通过提示进化实现了可测量的奖励,而仅使用 RL 的模型直到第 ~300 步仍接近零。
观察 2: 性能上限的提升是因为两个通道都在优化奖励。将快权重蒸馏到慢权重中(FST-distill)虽然比仅使用提示的方法提高了性能,但未能达到联合 FST 方法的上限,证实了两个组件对于实现最大性能都是必要的。
意义与主张
本文主张,有效的大语言模型后训练不应被视为参数学习 followed by 提示微调,而应被视为跨多个适应通道的优化 。
分工: 通过将特定任务且快速演变的改进路由至快文本权重,慢参数权重得以解放,用于巩固持久且通用的推理行为。
持续学习: 这种分工为后训练方法提供了一条路径,使其更具数据效率、破坏性更小(更低的 KL 漂移),并更适应持续学习,从而解决了深度持续学习中观察到的“可塑性丧失”现象。
信息效率: 该框架利用上下文更新中丰富的文本反馈(思考、错误),克服了通常与二元 RLVR 奖励相关的“每回合 1 比特”的信息限制。
作者得出结论,FST 代表了推理模型的一个有前景的方向,表明并非所有特定任务的信息都需要被蒸馏进模型权重中,并且对于通用推理器而言,保持陈述性(提示)知识与程序性(权重)知识之间的分离至关重要。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。