← 最新论文
🤖 machine learning

ReCode: Reinforcing Code Generation with Reasoning-Process Rewards

本文介绍了 ReCode,这是一种新颖的强化学习框架,它通过对比学习训练推理过程奖励模型,并将其与基于执行的门控机制相结合以缓解奖励黑客攻击,从而实现了与 GPT-4-Turbo 相当的重大性能提升。

原作者: Lishui Fan, Yu Zhang, Mouxiang Chen, Zhongxin Liu

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Lishui Fan, Yu Zhang, Mouxiang Chen, Zhongxin Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教导一位才华横溢但有时鲁莽的学徒如何编写计算机代码。过去,你只会检查他们的最终成果:“程序运行没有崩溃吗?是的?干得好。没有?再试一次。”这就像只根据学生是否答对了数学题来评分,而不看他们如何解题。

论文**"ReCode"*指出,这种方法存在缺陷。有时,学徒即使逻辑混乱或错误,也能靠运气或猜测得到正确答案。而有时,他们拥有完美的计划,却犯了一个小小的拼写错误。为了获得真正可靠的代码,你需要教导他们在编写代码之前*先进行清晰的思考。

以下是 ReCode 的工作原理,分解为简单的概念:

1. 问题:“答案正确,理由错误”的陷阱

当前的 AI 训练方法就像一位只根据最终结果说“正确”或“错误”的老师。

  • 问题所在: 如果 AI 猜对了代码,但其内部思维(推理)是混乱的,那么 AI 就会学到“混乱 + 运气=成功”。它并没有学到为什么代码能运行。
  • 目标: 我们希望 AI 学到良好的思维能带来良好的代码,而不仅仅是“得到正确答案”才是唯一重要的事情。

2. 解决方案:ReCode(推理增强的代码生成)

ReCode 是一个新的训练系统,拥有两大工具,就像一位教练配备了评分标准安全门

工具 A:“评分标准”(CRPL)

为了教会 AI 更好地思考,系统首先需要一种方法来评判 AI如何思考,而不仅仅是它产出了什么。

  • 挑战: 没有足够的人类教师来评判 AI 思维过程中的每一个步骤。
  • 技巧: 研究人员创建了一位“合成教师”。他们选取了一段优秀的推理,并让 AI 生成两个版本:
    1. “超级推理”版本: 逻辑更严密、事实经过核查、步骤更清晰的版本。
    2. “有缺陷的推理”版本: AI 故意加入小错误的版本,例如跳过某一步骤或犯下事实性错误。
  • 结果: 通过向 AI 展示成千上万对“好思维 vs. 坏思维”的配对,系统学习到了一个奖励模型。这个模型就像一个严格的编辑,即使在代码编写之前,也能指出“这段思维是合乎逻辑且清晰的”,或者“这段思维存在逻辑漏洞”。

工具 B:“安全门”(CG-GRPO)

现在,我们如何利用这个“思维评分”来训练 AI,而不被其欺骗呢?

  • 风险(奖励黑客): 如果你只是告诉 AI,“为你的思维争取高分”,AI 可能会学会写长篇大论、花哨且令人困惑的段落,听起来很聪明,但实际上无助于编写代码。这就像学生为了得分而写一篇 10 页的论文,即使这篇论文并没有解决数学问题。这被称为“奖励黑客”。
  • 修正: ReCode 安装了一个安全门
    • AI 只有在最终代码实际运行并通过测试时,才能获得“良好思维”的分数。
    • 如果代码失败,无论推理多么优美,“思维分数”都会被忽略。
    • 类比: 想象一位厨师。只有当菜肴确实美味时(执行),你才能称赞他的食谱(推理)。如果菜肴烧焦了,无论食谱写得多么好,你都不在乎。这迫使 AI 确保其思维能真正导向有效的结果。

3. 结果:更智能、更快速、更可靠

研究人员在一个 70 亿参数的 AI 模型(非常智能,但并非最大的模型)上测试了这个新系统。

  • 提升: 与标准版本相比,经过 ReCode 训练的 AI 将其编程技能提高了16.1%
  • 对比: 尽管规模更小,但其表现与GPT-4-Turbo(一个更大、更昂贵的模型)相当。
  • 效率: 有趣的是,ReCode 模型不仅写了更多的代码,而且用更少的词写出了更好的代码。它不再浪费时间于废话,而是直接切入逻辑要点。
  • 泛化能力: 他们还将此方法应用于数学问题,结果同样有效,这证明了教导 AI“清晰思考”有助于任何需要逻辑的学科,而不仅仅是编程。

总结

将 ReCode 想象成一个不再接受“幸运猜测”的训练营地。

  1. 它创造了一位专门的评判者,能够区分聪明的思维过程和愚蠢的思维过程。
  2. 它设立了一道严格的关卡,只有当最终结果确实有效时,AI 才能因其聪明的思维获得认可。
  3. 结果是,AI 不再仅仅死记硬背答案,而是学会通过推理找到解决方案,使其更加可靠和高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →