← 最新论文
💻 computer science

Mitigating Think-Answer Mismatch in Large Language Model Reasoning Through Noise-Aware Advantage Reweighting

本文引入了稳定组相对策略优化(S-GRPO),这是一种通过推导噪声感知优势权重来缓解大型推理模型中“思考-回答不匹配”问题的新方法,从而在噪声奖励条件下实现比标准 GRPO 更优越的鲁棒性和性能。

原作者: Danhao Zhu, Peijun Shen, Si Shen

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Danhao Zhu, Peijun Shen, Si Shen

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人解决一个棘手的数学谜题。你不想坐在那里对它的每一个思考步骤进行评分;相反,你只看最终答案。如果机器人答对了,你就给它一个击掌(奖励);如果它答错了,你就温柔地对它说“再试一次”。这就是许多现代 AI 模型学习推理的方式:它们生成许多不同的尝试,观察哪些尝试击中了目标,然后学习模仿那些获胜者。这种方法被称为组相对策略优化(Group-Relative Policy Optimization),简称 GRPO。这就像一个教室,老师只给最终的测试成绩评分,而不去管那些凌乱的草稿过程。

但问题在于,有时学生得到正确答案的原因是错误的。也许他们是猜出来的,或者也许他们在第一步犯了错,但在第三步时却意外地把它改正了。在 AI 世界中,这被称为“思维-答案不匹配”(Think-Answer Mismatch)。机器人认为自己是个天才,因为它得到了奖励,但实际上它只是运气好。如果老师(AI 训练器)没有意识到这一点,机器人就会学到错误的教训。这篇论文探讨的是:当老师被这些幸运的猜测搞糊涂时会发生什么,以及我们如何通过改进训练,让机器人在反馈有些嘈杂的情况下也能学会“正确的思考方式”?

这项研究背后的研究人员 Danhao Zhu、Peijun Shen 和 Si Shen 发现,这些机器人训练的标准方式(GRPO)有一个隐藏的弱点。他们发现,当一组机器人的尝试非常不平衡时——比如七个错误答案和一个正确答案——那一个“幸运的”正确答案可能会误导系统,让它误以为这是一个巨大的成功。这就像如果你抛了八次硬币,得到了七次反面和一次正面;那一次正面可能看起来像个奇迹,但实际上它只是个偶然。在一个不平衡的组中,这个偶然会如此严重地扭曲学习信号,以至于机器人停止了有效学习,尤其是当“幸运的猜测”频繁发生时。

为了解决这个问题,团队发明了一种新方法,称为稳定组相对策略优化(Stable Group-Relative Policy Optimization,简称 S-GRPO)。把 S-GRPO 想象成一位超级聪明的老师,她不仅看分数,还会检查整个班级的“氛围”。如果全班大部分人都失败了,只有一名学生做对了,老师就会产生怀疑:“这个学生是真的聪明,还是只是猜对了?”S-GRPO 使用一种特殊的数学技巧来计算房间里可能存在的噪声或混乱程度。如果小组是不平衡的,该方法会自动降低那个单一“获胜者”的音量,以免它盖过其他所有人的声音。它本质上是在说:“我会减少对这个奖励的信任,因为这个小组的情况看起来很可疑。”

研究人员通过模拟了一个教室环境来测试这个想法,在这个环境中,20% 的“正确答案”实际上只是幸运的猜测(噪声)。在这个混乱的环境中,标准的 GRPO 方法完全崩溃了;机器人停止了学习并变得困惑。然而,S-GRPO 保持了冷静。它忽略了嘈杂的信号,让机器人保持在正轨上。当他们在不同的机器人大脑(如 Qwen 和 Llama 模型)上使用真实的数学问题进行测试时,S-GRPO 一致地击败了旧方法。它将机器人的数学成绩全面提高了约 2.2% 到 2.5%。

也许最令人兴奋的发现是训练变得多么稳定。虽然旧方法在反馈混乱时会陷入挣扎,但 S-GRPO 平滑了学习过程。机器人不仅数学变得更好了,它们还学会了更稳健地思考,而不会出现自信心的剧烈波动。论文表明,通过简单地承认“幸运的猜测”确实存在,并调整数学模型来应对它们,我们可以构建出更加可靠的 AI 思考者。这不仅仅是一个小小的微调;这是一种让 AI 训练足够鲁棒(robust)的方法,使其能够应对现实世界——在现实世界中,答案并不总是完美的,运气也扮演着一定的角色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →