← 最新论文
🤖 machine learning

Learning, Fast and Slow: Towards LLMs That Adapt Continually

本文介绍了快速 - 慢速训练(FST),这是一个将固定模型参数(“慢”权重)与优化上下文(“快”权重)相结合的框架,旨在使大语言模型能够更有效地从文本反馈中学习、实现更高性能并保持更大可塑性,同时相较于传统参数更新方法显著减少灾难性遗忘。

原作者: Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Rishabh Agarwal, Devvrit Khatri

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Rishabh Agarwal, Devvrit Khatri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教导一位聪明但僵化的学生(大型语言模型)如何解决复杂的谜题,例如数学问题、编程挑战或事实核查难题。

传统上,当我们希望这位学生变得更好时,我们会强迫他们通过重写大脑(更新模型的内部参数)来死记硬背新规则。这就像把一块海绵浸在新水中,然后将其挤干。问题在于:一旦你挤干它,旧水(他们原有的通用知识)就会漏掉。他们会在你教给他们的特定谜题上表现得非常出色,但却忘记了如何成为一个优秀的通用思考者,并且在面对下一个谜题时会感到吃力。这被称为“灾难性遗忘”。

另一方面,你也可以为每个特定的谜题给学生一张小抄(提示词)。这种方法既便宜又快速,但学生仍然必须依赖他们原有的脑力。如果谜题太难,仅靠小抄还不足以获得满分。

“快与慢”的解决方案
这篇论文介绍了一种名为**快慢训练(Fast-Slow Training, FST)**的新训练方法。它将学生的过程视为一个双轨系统,结合了两种方法的优势:

  1. 慢速轨道(大脑): 这是模型的永久权重。它像长期记忆一样缓慢学习。它专注于保持学生的核心推理技能和通用知识完整无损。
  2. 快速轨道(小抄): 这是“上下文”或提示词。它像一张临时的便利贴一样学习得非常快。它吸收当前任务的具体、棘手的细节,而不会永久改变学生的大脑。

工作原理(类比)
想象一下,你正在训练一位厨师(人工智能)烹饪一道新的、困难的菜肴。

  • 旧方法(仅慢速学习): 你强迫厨师通过重写其整个烹饪理念来死记硬背食谱。他们变得非常擅长这一道菜,但却忘记了如何烹饪其他任何菜肴,并且如果你稍后要求他们烹饪一个略有不同的版本,他们也无法适应。
  • FST 方法: 你保持厨师的基本技能(慢速轨道)完全不变。相反,你给他们一张动态演变的食谱卡(快速轨道)。
    • 每当厨师尝试这道菜并犯错时,“教练”(系统)会查看错误,并立即在食谱卡上更新一条具体的提示(例如:“直到第 3 步之前不要加盐”)。
    • 厨师使用这张更新后的卡片再次尝试。
    • 只有在厨师利用这些卡片掌握了这道菜之后,我们才会对其基本的烹饪风格(慢速轨道)进行微小、谨慎的调整。

为何这种方法更优(结果)
论文声称,这种方法在三个主要方面胜出:

  1. 更快、更便宜: 因为“食谱卡”(快速轨道)可以瞬间吸收新信息,系统学习任务的速度要快得多。论文指出,达到与旧方法相同的性能水平,它所需的尝试次数最多可减少3 倍
  2. 不会遗忘: 因为厨师的基本大脑(慢速轨道)没有被不断重写,所以他们不会失去通用的烹饪技能。论文显示,模型能保持更接近其原本聪明的状态,这意味着它不会“忘记”如何成为一个通用推理者。
  3. 为下一个挑战做好准备: 由于厨师的大脑没有在首道菜上过度专业化,他们可以立即开始学习菜肴,而无需“遗忘”旧菜肴。论文通过在训练中途切换任务来测试这一点,FST 模型平稳地适应了变化,而旧模型则完全停滞不前。

秘诀:厨师团队
论文还提到一个巧妙的技巧:他们不是只使用一张食谱卡,而是维护一个不同食谱卡的团队(提示词群体)。有些卡片擅长数学,另一些擅长编程。系统将它们混合使用,允许“慢速轨道”看到多种解决问题的方法,这有助于它在避免混淆的情况下学得更好。

总结
这篇论文认为,我们不应强迫人工智能模型通过重写大脑来死记硬背每一个新任务。相反,我们应该让他们保留通用智能(慢速),同时赋予他们一套超快速、可适应的指令(快速)来处理特定任务。这使得他们更聪明、训练速度更快,并且在学习新事物时不会忘记旧事物。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →