← 最新论文
🤖 machine learning

Knowledge is Not Enough: Injecting RL Skills for Continual Adaptation

本文提出了参数化技能迁移(PaST)框架,该框架通过线性注入源自强化学习的领域无关技能向量,解决了监督微调在适配大语言模型方面的局限性,从而为实现知识整合与智能体工具使用的高效且有效的持续适应提供了支持。

原作者: Pingzhi Tang, Yiding Wang, Muhan Zhang

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Pingzhi Tang, Yiding Wang, Muhan Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和生动的类比对论文《知识不足:注入强化学习技能以实现持续适应》的解读。

核心难题:“聪明却无知”的学生

想象你有一位天才学生(即大型语言模型,LLM),他在某个截止日期前几乎读遍了图书馆里的所有书籍。这位学生非常擅长基于已有知识回答问题。

然而,世界在不断变化。每天都有新事实出现(比如昨天通过的一项新法律,或今天早上发布的一款新应用)。

  • 旧方法(SFT,监督微调): 为了让学生掌握这些新事实,我们通常只是让他们死记硬背新文本。这就像强迫他们在考试前一晚突击背诵一本新教材。他们能完美地复述事实,但如果考试要求他们在棘手的情境中运用这些事实,他们往往会僵住、猜错,或者胡编乱造(产生幻觉)。他们拥有知识,却缺乏运用这些知识的技能
  • 昂贵的方法(RL,强化学习): 为了教会他们如何思考和解决问题,我们通常使用强化学习(RL)。这就像聘请一位私人教练,让学生反复练习解决问题,并在他们做对时给予奖励。这种方法效果很好,但需要耗费巨大的时间和金钱。你不可能为世界上出现的每一个新事实都聘请一位教练。

发现:两种截然不同的“大脑”变化

北京大学的研究人员发现了一个关于学生“大脑”在上述两种过程中如何变化的有趣现象。

他们发现,当学生记忆事实(SFT)和当学生学习推理技能(RL)时,变化发生在他们“大脑”中两个完全不同的区域。

  • 类比: 想象学生的“大脑”是一座巨大的图书馆。
    • SFT 就像在书架上添加新书。它改变了图书馆的内容
    • RL 就像训练图书管理员如何寻找书籍、交叉引用它们,并利用它们解决谜题。它改变了图书馆的组织结构和逻辑
    • 关键洞察: 这两种变化互不干扰。它们是“正交”的,意味着它们发生在独立且不重叠的空间里。你可以在不破坏图书管理员逻辑的情况下添加新书,也可以在不变动书架上书籍的情况下训练图书管理员。

解决方案:PaST(参数化技能迁移)

由于这两种变化是分离的,研究人员想出了一个巧妙的捷径,称为PaST

它是如何工作的:

  1. 提取“技能向量”: 他们不再针对每个新主题重新训练学生,而是先利用昂贵的“教练”方法(RL)在一个主题(例如电影)上训练好一个模型。然后,将这个“聪明”的模型与一个仅记忆了事实的“笨”模型进行比较。两者之间的差异就是一个“技能向量”。
    • 类比: 可以将这个技能向量想象成一本通用的**“操作指南”或一块“肌肉记忆芯片”**。它包含了“如何解决问题”的纯粹逻辑,而不依附于任何具体事实。
  2. 注入技能: 当新主题出现时(例如一份新的法律文件),他们首先快速教会学生新事实(轻量级的 SFT)。然后,他们只需将“技能向量”插入学生的“大脑”中。
    • 类比: 这就像给学生一本新教科书(事实),然后瞬间插入他们在电影训练中习得的“解题芯片”(技能)。学生现在既掌握了新事实,又确切知道如何运用它们,而无需新的教练。

为何这意义重大

该论文在三个不同的挑战中测试了这种方法:

  1. 阅读理解(SQuAD): 模型必须记忆一段文章并回答问题,且不能回看文本。与单纯记忆相比,PaST 使模型在找到正确答案方面表现大幅提升。
  2. 长文档(LooGLE): 当文本非常庞大时(例如一份 2 万字的文档),标准方法往往会迷失方向。PaST 帮助模型保持专注并找到正确的信息。
  3. 使用工具(ToolBench): 模型必须使用 API(例如下载 Instagram 帖子)。当 Instagram 账户设为私密时,普通模型会胡乱猜测一个新的、虚假的工具来使用。而 PaST 模型则意识到账户是私密的,停止猜测,并给出正确答案:“我无法做到,因为该账户是私密的。”

结论

该论文证明了知识和技能是两回事。每次给予模型新信息时,你无需花费巨资重新训练其“思考”能力。相反,你可以一次性学会“思考”技能,将其提取为一种便携工具,然后将其插入任何新情境中。这使得 AI 在适应现实世界时变得更快、更便宜、更智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →