← 最新论文
🤖 machine learning

Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models

本文介绍了 RECAP,一种具有动态目标重加权的端到端回放策略,该策略在有效缓解通过强化学习训练的大型推理模型在通用能力方面的遗忘问题的同时,通过灵活的奖励权衡提升了推理性能。

原作者: Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Hoang Phan, Xianjun Yang, Yuanshun Yao, Jingyu Zhang, Shengjie Bi, Xiaocheng Tang, Madian Khabsa, Lijuan Liu, Deren Lei

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:“专家”陷阱

想象一下,你雇佣了一位全能的顶级大厨,他无所不能:他能烤出完美的蛋糕,能精准地切菜,甚至还能修理厨房里漏水的水龙头(这比喻模型处理数学、视觉和通用知识的能力)。

然后,你决定专门训练这位大厨去赢得一场高规格的吃派大赛。你把他关在一个只有派的食谱和关于如何拿叉子的严格规则的房间里。

结果会怎样?
经过几周的高强度训练,这位大厨成为了世界级的吃派高手。他能完美地遵守拿叉子的规则。然而,因为他把所有时间都花在了练习吃派上,他开始忘记如何切菜或修理水龙头了。如果你让他切个洋葱,他可能会愣在那里,或者试图把整个洋葱吞下去。

在 AI 世界中,情况正是如此。研究人员正在使用一种名为 RLVR(带有可验证奖励的强化学习)的技术来教大语言模型(LLM)如何进行“推理”(解决数学问题、遵循复杂的逻辑)。虽然模型在推理方面变得非常出色,但它们开始遗忘其他技能,比如识别图片中的物体、阅读图像中的文本或保持安全与诚实。

论文的解决方案:“RECAP”

作者提出了一种名为 RECAP(增强重放能力保持)的新方法。你可以把 RECAP 理解为一个智能化的训练计划,专门针对那位大厨。

RECAP 不仅仅是整天给大厨喂派的食谱,它做了两件事:

  1. 重放基础知识: 它会偶尔把旧的“切菜”和“修水龙头”的食谱拿回来,这样大厨就不会忘记这些基本功。
  2. 动态权重分配: 它像一个聪明的教练,能实时观察大厨的进步情况。

“智能教练”是如何工作的(类比)

想象大厨正在同时练习三件事:

  • 叉子规则 (格式): 如何拿叉子。
  • 味道 (准确性): 派的味道好不好?
  • 清理工作 (通用技能): 保持厨房整洁。

在普通的训练课程中,教练可能会说:“三件事平均练习!”但这并不高效。

  • 叉子规则很简单。大厨在 5 分钟内就掌握了。如果教练还让他在上面练习一小时,那就是在浪费时间。
  • 味道很难。大厨在这一项上很挣扎。
  • 清理工作因为大厨分心而变得一团糟。

RECAP 的教练会观察数据并说:

“嘿,大厨已经掌握了叉子规则。我们别再关注它了(降低权重)。让我们把更多时间花在‘味道’和‘清理’上,因为这两项目前还在挣扎或者表现不稳定。”

RECAP 会自动检测哪些技能已经“饱和”(已经学会)以及哪些技能处于“波动期”(正在挣扎或变化剧烈)。它会将训练重心转移到那些挣扎中的技能上,这样模型就不会在简单的事情上过度学习,从而导致在困难任务上遗忘。

研究发现(结果)

研究人员在强大的 AI 模型(特别是 Qwen2.5-VL 系列)上测试了该方法。以下是他们的发现:

  1. “遗忘”是真实存在的: 当他们仅针对推理任务训练模型时,模型的数学能力提升了,但在阅读图像中的文本或识别物体等方面却显著变差了。
  2. RECAP 拯救了局面: 通过使用这种动态计划,模型不仅保持了高水平的推理能力(有时甚至有所提升),而且没有丢失其通用技能。事实上,在通用任务上的表现往往比使用标准方法的模型更好。
  3. 效率更高: 使用 RECAP 训练的模型不仅变得更聪明,还变得更高效。它们开始给出更短、更直接的答案,而不是喋喋不休,因为系统不再强迫它们在不需要“思考”(写长篇逻辑链)的任务上进行冗长的输出。

总结

这篇论文认为,我们不应该仅仅通过忽略其他一切来强迫 AI 模型成为“推理机器”。如果我们这样做,它们就会变成只会一项技能的“单项冠军”,从而忘记如何在这个现实世界中提供帮助。

RECAP 是一个简单的、即插即用的工具,它就像是 AI 训练中的“均衡饮食”。它确保在模型学习解决复杂谜题的同时,不会忘记如何观察、阅读和理解周围的世界。它的目标是在让 AI 成为该领域天才的同时,依然保持其全面发展的素质。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →