← 最新论文
💬 NLP

Multi-Task GRPO: Reliable LLM Reasoning Across Tasks

该论文提出了多任务 GRPO(MT-GRPO),这是一种通过动态调整任务权重并采用比例保持采样器来克服多任务强化学习中优化不平衡问题的创新算法,从而显著提升了与标准 GRPO 和 DAPO 相比的最差任务性能和训练效率。

原作者: Shyam Sundhar Ramesh, Xiaotong Ji, Matthieu Zimmer, Sangwoong Yoon, Zhiyong Wang, Haitham Bou Ammar, Aurelien Lucchi, Ilija Bogunovic

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Shyam Sundhar Ramesh, Xiaotong Ji, Matthieu Zimmer, Sangwoong Yoon, Zhiyong Wang, Haitham Bou Ammar, Aurelien Lucchi, Ilija Bogunovic

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一个超级聪明的机器人助手,让它去解决各种各样的谜题,从数学题到逻辑谜语。你希望这个机器人成为一个真正的全才,能够处理你交给它的任何任务,而不会感到困惑或在难题面前败下阵来。在人工智能的世界里,这被称为“推理”,而这些机器人被称为“大语言模型”(LLM)。为了让这些模型变得更好,科学家们使用了一种叫做“强化学习”的技术,这就像是在机器人答对时给它一个击掌(奖励),而在它答错时温柔地对它说“再试一次”。其中一种流行的方法叫做 GRPO,这是一种巧妙的方法,用于弄清楚机器人应该从每一次尝试中学习多少。然而,这里有一个陷阱:如果你要求机器人同时学习十种不同类型的谜题,它往往会陷入困境。它可能会在简单的谜题上表现得非常好,但完全忽略了困难的谜题;或者它可能会卡在某种特定的谜语上,从而忘记了如何做其他的题目。大问题在于,我们如何训练一个大脑,让它在所有方面都同样出色,确保没有任何一项技能被落下?

这正是名为 Multi-Task GRPO (MT-GRPO) 的新方法所解决的问题。把标准的训练过程想象成一位试图教导一群学习速度迥异的学生进行教学的老师。如果老师只是关注“平均水平”的学生,聪明的孩子可能会觉得无聊,而落后的孩子则会掉队得更远。标准的方法往往会让简单的任务“劫持”训练过程,使模型在平均水平上看起来表现良好,但实际上在困难挑战面前却在秘密失败。研究人员意识到,仅仅通过平均分并不能造就一个可靠的机器人;你需要确保班级里表现最差的学生也在进步。

为了解决这个问题,他们发明了一个两部分的策略。首先,他们创建了一个动态的“权重系统”。想象一位不断观察记分板的教练。如果机器人在“倒计时”(一种数学游戏)方面做得很好,但在“斑马谜题”(逻辑谜语)方面表现很差,教练会立即转移重心。他们开始给机器人提供更多来自斑马类别的练习题,并减少数学类别的题目。但棘手的地方在于,有时机器人尝试解一道斑马谜题却得到了“零分”,因为它甚至没有尝试正确地解决它,这意味着它没有从那次尝试中学习到任何东西。如果教练仅仅计算问题的数量,他们可能会认为自己正在教授斑马谜题,但实际上,机器人只从数学题中学习,因为那些斑马题的尝试是“零梯度”(无效学习)。

为了解决这个问题,他们的第二个发明是“比例保持采样器”(Ratio-Preserving Sampler)。这就像一位非常严格的图书管理员,确保即使机器人丢弃了一些无用的练习尝试,最终剩下的有用练习题仍然拥有完全正确的数学和逻辑谜题比例。如果教练希望 30% 的练习是逻辑谜题,图书管理员会确保在过滤掉废品后,剩余的优质题目中仍有 30% 是逻辑谜题。这防止了简单的任务仅仅因为困难的任务产生了更多的“失败”尝试,就意外地接管了整个训练过程。

这种新方法的测试结果非常令人鼓舞。当团队在一组包含三种不同推理任务的混合测试中对其进行测试时,他们的新 MT-GRPO 方法比标准方法提高了最差任务准确率的 16–28%,比另一种先进方法 DAPO 高出 6%。更令人印象深刻的是,它仅使用比竞争对手少 50% 的训练步骤,就在最难的任务上达到了 50% 的准确率阈值。在一个包含九个不同任务的更大规模测试中,该方法继续表现优于其他方法,表明它可以扩展到处理更复杂、更多样化的挑战。作者发现,通过调节一个“旋钮”(一个称为 λ\lambda 的参数),他们可以控制模型是优先修复其最弱的技能,还是仅仅致力于提高平均水平。

简而言之,这篇论文表明,通过更聪明地选择机器人练习哪些问题,并确保这些问题确实进入了训练环节,我们可以构建出不仅仅擅长简单事物,而且在各个领域都表现可靠的 AI。这是朝着创造一种不仅能在狭窄领域专业化,而且能真正通过各种现实世界问题进行推理,且不落下任何一项技能的 AI 迈出的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →