SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation
该论文提出了 SMOPD,一种两阶段“专业化与合并”的在线策略蒸馏框架,通过训练奖励专业化的教师模型并将其整合为单一的学生策略,以有效地平衡不同粒度的多奖励信号,其在各种模型骨干网络上的表现均优于 GDPO 等现有方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人成为完美的助手。你希望它既能提供帮助、不造成伤害,又能遵循严格的格式规则,比如使用特定的标签或调用正确的工具。这就是基于人类反馈的强化学习(RLHF)的世界。这就像训练一只狗:当它做得好时,你给它一个奖励(“奖励”),它就会学会重复这种行为。但棘手的部分在于:如果你想让这只狗同时做到“坐下”、“待着不动”并且“衔回球”,该怎么办?如果你只是因为它完成了所有动作就给它一个大大的奖励,这只狗可能会感到困惑。它可能会意识到,“衔回球”是获得奖励最容易的方式,于是它会完全忽略“坐下”和“待着不动”。在 AI 的世界里,这被称为奖励掩盖(reward masking),即一个强烈的信号淹没了其他信号。
最近,科学家们尝试通过在组合各项任务之前,先为每个任务给出单独的分数来解决这个问题,这种方法被称为 GDPO。这就像是给狗一个关于“坐下”的记分卡,一个关于“待着不动”的记分卡,以及一个关于“衔回球”的记分卡,然后将它们相加。但问题在于:有些任务很容易衡量(比如“它是否衔回了球?”),而有些任务则非常罕见且难以察觉(比如“它是否完美地保持静止了 10 秒钟?”)。如果 AI 得到了 100 万个“衔回球”的分数,却只得到了一个“待着不动”的分数,那么“待着不动”的信号就会淹没在噪声中。AI 学会了完美地衔回球,却忘记了如何保持静止。这篇名为 SMOPD 的论文提出了一个简单的问题:我们如何确保 AI 在学习这些稀有、难以察觉的技能时,不会忘记那些容易掌握的技能?
问题所在:“嘈杂的教室”
想象一个教室,老师正试图同时教学生两件事:如何解决复杂的数学题(这是一个“稠密”奖励,因为有很多步骤需要做对)以及如何在说话前举手(这是一个“稀疏”奖励,因为每节课只发生一次)。
如果老师只是在一天结束时喊出一个总分,学生们就会完全专注于数学。他们会忽略举手,因为从统计学上讲,数学得分无处不在,而举手的得分却非常罕见。即使老师试图将举手的权重设为相等,学生们仍然无法在数学得分的噪声中清晰地听到举手的信号。AI 模型也面临着同样的问题:它们擅长处理“稠密”任务,但在处理“稀疏”任务(如正确格式化答案或在关键时刻保持无害)时表现糟糕。
解决方案:专业化,然后合并
该论文的作者提出了一种巧妙的两步策略,称为 SMOPD(专业化与合并在线策略蒸馏)。与其试图让一个学生同时精通所有事情,不如创建一个专家团队,然后合并他们的技能。
第一步:专业化(“专家教师”)
首先,研究人员训练了几个不同的“教师”模型。但转折在于:每个教师都被告知只能专注于一项特定的技能。
- 教师 A 被告知:“忽略数学!你的唯一任务是确保学生举手。”为了实现这一点,每当有学生举手时,教师都会获得巨额奖金,使这个信号变得无法被忽视。
- 教师 B 被告知:“忽略举手!你的唯一任务是解决数学题。”
因为每个教师都高度专注,他们成为了各自领域的专家。教师 A 完美地学会了稀有的“举手”技能,因为这是他们唯一在意的事情。教师 B 则成为了数学奇才。他们并不试图平衡两者,而是全力以赴于其中之一。
第二步:合并(“学生”模型)
现在,研究人员引入了一个新的“学生”模型。这个学生不仅仅听从一位老师,它同时听从所有老师。
- 当学生在写答案时,它会观察教师 A(举手专家)会怎么做,以及教师 B(数学天才)会怎么做。
- 学生学习模仿两者的精华部分。如果教师 A 对格式非常有信心,学生就模仿教师 A;如果教师 B 对数学非常有信心,学生也模仿教师 B。
至关重要的是,这个学生还有一个“安全网”(称为锚点/anchor),用于检查最终答案,以确保它仍然是一个优秀的整体答案,而不仅仅是一个简单的复制粘贴。这确保了学生能够自然地平衡各项技能,而不是成为两个不同人的混乱混合体。
他们的发现
团队在不同规模的 AI 模型(15 亿、30 亿和 70 亿参数)上测试了这个想法,并使用了两个截然不同的挑战:
- 工具调用(Tool Calling): 确保 AI 使用正确的工具(如计算器或搜索引擎)并且格式化输出完全正确(如使用特定的 XML 标签)。
- 安全性(Safety): 确保 AI 既有帮助性又无害。
结果令人印象深刻。在“工具调用”测试中,旧方法(GDPO)由于格式化信号过于稀疏,仅能实现约 8.8% 的正确格式化。但在使用 SMOPD 后,模型的格式化正确率达到了 97.5%!更令人惊讶的是,他们在过程中并没有丢失数学能力。15 亿参数的模型相比之前的最佳方法,整体得分提升了 48%。
在“安全性”测试中,即“有帮助”和“无害”的目标有时会发生冲突的情况下,SMOPD 在所有模型规模上都一致优于其他方法。它成功学习了稀有的“无害”行为,同时没有牺牲其“有帮助”的能力。
为什么这很重要
这篇论文表明,试图在单次训练过程中平衡所有奖励的旧方法正在遭遇瓶颈。你不能仅仅通过调整权重来让一切都达到完美;有时,某种技能仅仅是因为在人群中太稀有了,以至于无法被学习。通过让 AI 先进行“专业化”——让它在隔离状态下精通一件事——然后再“合并”这些技能,AI 就可以在学习那些困难、稀有的技能时,不会忘记那些容易的技能。
这就像是意识到要建立一支完美的管弦乐队,你不应该只是要求每个人同时演奏所有乐器。相反,你应该让小提琴手单独练习他们的部分直到完美,让鼓手也这样做,然后将他们聚集在一起演奏交响乐。其结果是一场每个乐器都能被清晰听到、音乐比任何人预期的都要精彩的演出。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。