想象一下,你正在教导一位才华横溢但有时鲁莽的学徒如何编写计算机代码。过去,你只会检查他们的最终成果:“程序运行没有崩溃吗?是的?干得好。没有?再试一次。”这就像只根据学生是否答对了数学题来评分,而不看他们如何解题。
论文**"ReCode"*指出,这种方法存在缺陷。有时,学徒即使逻辑混乱或错误,也能靠运气或猜测得到正确答案。而有时,他们拥有完美的计划,却犯了一个小小的拼写错误。为了获得真正可靠的代码,你需要教导他们在编写代码之前*先进行清晰的思考。
以下是 ReCode 的工作原理,分解为简单的概念:
1. 问题:“答案正确,理由错误”的陷阱
当前的 AI 训练方法就像一位只根据最终结果说“正确”或“错误”的老师。
- 问题所在: 如果 AI 猜对了代码,但其内部思维(推理)是混乱的,那么 AI 就会学到“混乱 + 运气=成功”。它并没有学到为什么代码能运行。
- 目标: 我们希望 AI 学到良好的思维能带来良好的代码,而不仅仅是“得到正确答案”才是唯一重要的事情。
2. 解决方案:ReCode(推理增强的代码生成)
ReCode 是一个新的训练系统,拥有两大工具,就像一位教练配备了评分标准和安全门。
工具 A:“评分标准”(CRPL)
为了教会 AI 更好地思考,系统首先需要一种方法来评判 AI如何思考,而不仅仅是它产出了什么。
- 挑战: 没有足够的人类教师来评判 AI 思维过程中的每一个步骤。
- 技巧: 研究人员创建了一位“合成教师”。他们选取了一段优秀的推理,并让 AI 生成两个版本:
- “超级推理”版本: 逻辑更严密、事实经过核查、步骤更清晰的版本。
- “有缺陷的推理”版本: AI 故意加入小错误的版本,例如跳过某一步骤或犯下事实性错误。
- 结果: 通过向 AI 展示成千上万对“好思维 vs. 坏思维”的配对,系统学习到了一个奖励模型。这个模型就像一个严格的编辑,即使在代码编写之前,也能指出“这段思维是合乎逻辑且清晰的”,或者“这段思维存在逻辑漏洞”。
工具 B:“安全门”(CG-GRPO)
现在,我们如何利用这个“思维评分”来训练 AI,而不被其欺骗呢?
- 风险(奖励黑客): 如果你只是告诉 AI,“为你的思维争取高分”,AI 可能会学会写长篇大论、花哨且令人困惑的段落,听起来很聪明,但实际上无助于编写代码。这就像学生为了得分而写一篇 10 页的论文,即使这篇论文并没有解决数学问题。这被称为“奖励黑客”。
- 修正: ReCode 安装了一个安全门。
- AI 只有在最终代码实际运行并通过测试时,才能获得“良好思维”的分数。
- 如果代码失败,无论推理多么优美,“思维分数”都会被忽略。
- 类比: 想象一位厨师。只有当菜肴确实美味时(执行),你才能称赞他的食谱(推理)。如果菜肴烧焦了,无论食谱写得多么好,你都不在乎。这迫使 AI 确保其思维能真正导向有效的结果。
3. 结果:更智能、更快速、更可靠
研究人员在一个 70 亿参数的 AI 模型(非常智能,但并非最大的模型)上测试了这个新系统。
- 提升: 与标准版本相比,经过 ReCode 训练的 AI 将其编程技能提高了16.1%。
- 对比: 尽管规模更小,但其表现与GPT-4-Turbo(一个更大、更昂贵的模型)相当。
- 效率: 有趣的是,ReCode 模型不仅写了更多的代码,而且用更少的词写出了更好的代码。它不再浪费时间于废话,而是直接切入逻辑要点。
- 泛化能力: 他们还将此方法应用于数学问题,结果同样有效,这证明了教导 AI“清晰思考”有助于任何需要逻辑的学科,而不仅仅是编程。
总结
将 ReCode 想象成一个不再接受“幸运猜测”的训练营地。
- 它创造了一位专门的评判者,能够区分聪明的思维过程和愚蠢的思维过程。
- 它设立了一道严格的关卡,只有当最终结果确实有效时,AI 才能因其聪明的思维获得认可。
- 结果是,AI 不再仅仅死记硬背答案,而是学会通过推理找到解决方案,使其更加可靠和高效。
技术摘要:ReCode:通过推理过程奖励强化代码生成
问题陈述
强化学习(RL)已成为改进大语言模型(LLM)代码生成能力的变革性范式。然而,现有方法主要依赖基于结果的监督(如测试用例通过率),这仅能提供关于如何达成正确程序的有限指导。虽然严谨的推理通常是生成正确代码的关键驱动力,但当前的 RL 方法往往忽视了对推理过程本身质量的优化。
将优化推理过程的理念转化为实用的训练框架面临两个主要挑战:
- 细粒度偏好数据的稀缺性:训练可靠的奖励模型以评估推理质量,受到缺乏高质量、细粒度偏好数据的阻碍。人工标注既不可扩展又具有主观性,而使用“大语言模型作为裁判”在分配标量分数以评估细微的推理质量时,往往存在校准不佳的问题。
- 奖励黑客(Reward Hacking):将用于推理过程的神经奖励直接纳入 RL 存在显著风险。与严格、可验证的单元测试结果不同,神经奖励受到的约束较少。策略可能会学会通过夸大推理过程分数来“黑客”奖励,而实际上并未提升生成代码的功能正确性。
方法论:ReCode 框架
作者提出了ReCode(推理强化代码生成),这是一种新颖的 RL 训练框架,旨在使代码生成与高质量的推理过程保持一致。ReCode 包含两个核心组件:
1. 对比推理过程奖励学习(CRPL)
为解决数据稀缺挑战,CRPL 引入了一种方法,无需依赖人工标注或直接标量评分,即可自动合成对比偏好数据。
- 过程:该框架将推理质量编码为三个关键维度:事实准确性、逻辑严谨性和逻辑连贯性。
- 数据合成:利用强大的大语言模型(Qwen2.5-Coder-32B-Instruct),CRPL 通过沿这些维度应用针对性转换(例如,为优化而去除冗余,或为降级而引入事实错误),生成基础推理过程(t)的优化(t+)和降级(t−)变体。
- 偏好排序:此过程创建了多级偏好排序,形成三种类型的配对:强对比(t+≻t−)、细粒度优化(t+≻t)和细粒度降级(t≻t−)。
- 训练:奖励模型利用这些偏好配对进行训练,采用 Bradley-Terry 目标来区分推理质量,而非预测绝对分数。
2. 一致性门控 GRPO(CG-GRPO)
为应对奖励黑客风险,ReCode 通过基于组相对策略优化(GRPO)构建的门控机制,将推理过程奖励模型集成到 RL 循环中。
- 硬门控:仅当生成的代码通过所有单元测试(功能正确性)时,推理过程奖励(Rproc)才会被激活。
- 奖励结构:样本的总奖励 Ri 公式化为:
Ri=Rfmt+Rout+I(Rout=1)⋅Rproc
其中 Rfmt 是格式奖励,Rout 是二元结果奖励,I(⋅) 是指示函数。
- 效果:这确保了策略无法为了最大化神经推理分数而牺牲功能正确性。同时,它在正确解之间提供了信息丰富的梯度,鼓励模型即使在代码功能已正确的情况下,也偏好高质量的推理过程。
基准构建:LCB-RB
为了评估推理过程奖励模型的区分能力,作者引入了LiveCodeBench-RewardBench (LCB-RB)。
- 构建:该基准源自 LiveCodeBench,包含 219 对经过人工验证的优劣推理过程偏好对。
- 过滤:采用两阶段过滤流程(使用 GPT-4o 进行自动化双重一致性检查,随后进行人工裁决),确保推理与实现之间的严格对齐,过滤掉那些尽管推理 flawed 但代码通过测试,或尽管推理合理但因微小实现问题而失败的情况。
实验结果
使用 Qwen2.5-Coder-7B-Instruct 作为策略模型,在 HumanEval(+)、MBPP(+)、LiveCodeBench 和 BigCodeBench 上进行了广泛的实验。
- 代码生成性能:使用 ReCode 训练的 7B 模型相比基线模型实现了16.1% 的相对提升(平均通过率从 50.4% 提升至 58.5%),达到了与 GPT-4-Turbo 相当的性能。其表现比仅基于结果的 GRPO 基线高出 6.7%。
- 奖励模型有效性:使用 CRPL 训练的奖励模型在 LCB-RB 上表现出强大的区分性能,超越了最先进基线(包括 GPT-4-Turbo 和专用奖励模型)。值得注意的是,7B CRPL 训练模型在 LCB-RB 上的表现与 GPT-4-Turbo 相当。
- 泛化性:
- 数学领域:将 CG-GRPO 扩展到数学领域(使用 Qwen2.5-Math-7B)带来了持续的提升,在 AIME 2024 上相比无推理奖励的 RL 基线实现了 7.4% 的相对提升。
- 跨模型:学习到的推理过程奖励有效地迁移到了 Qwen3-4B-Instruct 模型上。
- 效率:与仅基于结果的 RL 相比,ReCode 在生成平均少 23.4% 的 token 的情况下实现了更高的 Pass@1 率,表明其推理更加简洁和具有针对性。
- 消融研究:
- 奖励黑客:没有一致性门控的替代公式(例如直接相加奖励)导致了奖励饱和和性能下降,证实了门控机制的必要性。
- 数据合成:在单生成器偏好数据上的训练优于跨生成器数据,表明合成过程中一致的风格特征提供了更清晰的监督信号。
意义与主张
论文声称,ReCode 成功证明了推理过程质量可以作为额外的训练信号被利用,以在最终结果之外进一步提升代码生成能力。其意义在于:
- 弥合差距:它通过合成对比数据,提供了一种可扩展的解决方案来训练推理过程奖励模型,绕过了对昂贵人工标注的需求。
- RL 中的安全性:一致性门控机制提供了一种稳健的方法,将神经过程奖励集成到 RL 中而不陷入奖励黑客,确保推理改进能转化为功能正确性。
- 泛化性:该框架不仅限于代码;它可泛化到数学推理任务,表明其在提升 LLM 推理能力方面具有更广泛的适用性。
- 新的评估标准:LCB-RB 的引入填补了现有基准的空白,专注于中间推理过程的区分,而不仅仅是最终解的正确性。
作者总结道,ReCode 代表了使 LLM 与严谨推理对齐的一步,是对现有以实现为中心的监督方法的补充。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。