← 最新论文
💬 NLP

Reinforcing Step-level Reasoning for Effective Self-Correction in LLMs

本文提出了 Self-Fix Step-DPO (SFS-DPO),这是一种两阶段强化学习框架,通过首先通过偏好优化增强步骤级推理,随后显式地进行错误验证与纠正训练,从而提升大语言模型的自我修正能力,并取得了优于现有基准模型的性能。

原作者: Vu Duc Anh, Nhat M. Hoang, Do Xuan Long, Cong-Duy Nguyen, Ponhvoan Srey, Luu Anh Tuan

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Vu Duc Anh, Nhat M. Hoang, Do Xuan Long, Cong-Duy Nguyen, Ponhvoan Srey, Luu Anh Tuan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机可以像人类一样交谈、写故事和解谜的世界。这就是人工智能,特别是大语言模型(LLM)的领域。可以将这些模型想象成那些读过几乎所有图书馆书籍、博学多才的学生。它们非常擅长预测句子中下一个出现的词,但当面对棘手的数学题时,有时会自己绊倒自己的脚。如果它们在早期犯了一个小错误,往往会基于这个错误继续构建,就像搭积木一样,每增加一层,塔就变得更摇摇欲坠,直到崩塌。科学家们一直试图教导这些 AI 学生如何发现并修正自己的错误,然后再提交作业。这被称为“自我修正”(self-correction)。这有点像给一个学生一支红笔,并要求他们为自己的测试评分,但诀窍在于教他们如何真正发现错误,而不是盲目地进行修改。

你即将阅读的论文探讨了这种“红笔”理念中的一个特定问题。以往教授 AI 自我修正的尝试往往以失败告终,因为 AI 要么会陷入恐慌而改动一切,要么会修错地方。这项研究背后的研究人员——来自新加坡和越南大学的一个团队——决定改变训练策略。他们没有仅仅告诉 AI “整个答案是错的”,而是教它一次观察问题的极小步骤。他们创建了一种名为 Self-Fix Step-DPO (SFS-DPO) 的新方法。想象一位数学导师,他不仅仅是说“你失败了”,而是指着某一行计算过程说:“等等,这一步不太稳妥,”然后精确地展示如何只修复那一行,之后再继续下一步。研究人员发现,通过先强化 AI 逐步推理的能力,然后再教它专门针对并修复这些步骤中的错误,AI 在解决复杂数学问题方面变得更加出色。他们甚至测试了一个“教师辅助”版本,其中一个超级聪明的 AI 会解释为什么某一步是错的,这帮助学生 AI 学得更快。结果表明,这种循序渐进的方法有助于 AI 模型变得更加可靠和准确,不仅是因为它们能更好地预测,更是因为它们学会了如何在过程中发现并修复自己的错误。

两阶段训练营

要理解研究人员是如何教 AI 成为自己最佳编辑的,请想象一个年轻学徒的两个阶段训练营。

第一阶段:基础构建者
首先,AI 需要学习如何建造一座坚固的房子,然后才能学习如何修补漏水的屋顶。在过去,一些训练方法试图教 AI 立即修复错误,但研究人员发现,这就像是在墙壁还是沙子做的时就试图修补屋顶。因此,他们的第一阶段侧重于步骤级偏好优化(Step-Level Preference Optimization)

这就像是一场“选择你自己的冒险”游戏,AI 会在数学问题的某个特定点面临两条前进路径。一条路径是正确的下一步,另一条是错误的。AI 因为选择了正确的路径而获得奖励。这并不涉及修复错误,而仅仅是关于学习识别什么是“好的”下一步。研究人员称之为“初始化阶段”。这就像在教一名棋手识别一记好棋,然后再教他们如何从失误中恢复。通过这样做,AI 为每一单步构建了一个强大的内部指南针,从而感知什么是“正确的推理”。

第二阶段:自我修正演练
一旦 AI 拥有了坚实的基础,它就进入了第二阶段:逐步自我修正(Step-wise Self-Correction)。现在,AI 被给出了一个已经犯了错误的题目。目标是教它去:

  1. 发现错误: “等等,最后一步不对劲。”
  2. 修复它: “让我用一个正确的步骤替换掉那个错误的步骤。”
  3. 继续下去: 沿着修正后的路径继续求解。

研究人员训练 AI 去偏好一个“经过自我修正”的解题版本,而不是保留错误原样的版本。这就像给学生一支红笔并说:“如果你看到错误,圈出来,写下修正方案,然后完成题目。”

“老师的宠儿”变体

团队还创建了一个名为 SFS-DPO-R 的特殊版本。这个“R”代表“推理”(Reasoning)。在这个版本中,他们并没有让 AI 去猜测如何修复错误,而是使用了一个超级聪明的“老师”AI,在学生 AI 尝试修复之前,先写一段关于为什么这一步是错误的简短解释。

想象一个做错数学题的学生:

  • 标准方法: 老师说:“这错了。把它改过来。”学生只能猜测如何修复。
  • SFS-DPO-R 方法: 老师说:“这里错了,因为你除以了错误的数字。这是你遗漏的规则。现在,把它改过来。”

研究人员发现,这种额外的解释起到了超强信号的作用,帮助学生 AI 更好地理解错误的本质。虽然这需要一个“老师”(更强大的 AI 模型)来生成解释,但这带来了更好的结果。

他们的发现(以及没发现的)

研究人员在七种不同的 AI 模型上测试了他们的新方法,范围从较小的模型(70 亿参数)到较大的模型(140 亿参数)。他们用来自标准测试(如 GSM8K 和 MATH)以及更难的、非传统的测试(如中国高考 GK2023 和大学水平科学问题)的数学题挑战了这些模型。

结果:
论文显示,他们的两阶段方法一致地提高了 AI 的表现。

  • 更高的分数: 在所有测试中,使用 SFS-DPO 和 SFS-DPO-R 训练的 AI 模型比使用旧方法的模型解决了更多的正确问题。例如,在 Qwen2-7B-Instruct 模型上,新方法将 MATH 数据集的准确率提高了 3.4%。
  • 泛化能力: AI 不仅仅是在它练习过的特定问题上变得更好,它在从未见过的新类型问题上也表现得更好。这表明 AI 学到的是一种通用的纠错技能,而不仅仅是记忆答案。
  • “老师”的助力: 教师辅助版本(SFS-DPO-R)通常比没有老师的版本表现得略好,这表明理解错误发生的原因是一个强大的工具。

他们排除的观点:
论文明确反对了该领域的一些常见观点:

  • 修正越多 ≠ 越好: 研究人员发现,仅仅让 AI 更频繁地进行自我修正并不会让它变得更聪明。事实上,一些旧的方法让 AI 频繁到甚至开始把正确的答案改成错误的。我们的方法教导 AI 要有选择性:只有当你确定它坏掉时才去修复。
  • 跳过基础: 他们表明,如果不在先加强逐步推理的情况下(跳过第一阶段)直接尝试教授自我修正,会导致糟糕的结果。如果你连如何写出一个句子都不会,你就无法教一个学生去修改一篇论文。
  • 一刀切: 他们发现,仅仅针对“更好的答案”(最终结果)进行优化是不够的。你必须针对中间过程的“步骤质量”进行优化。

核心结论

这篇论文表明,让 AI 变得更聪明的秘诀不仅仅是喂给它更多的数据或让它变得更大。它是要教它一个特定的习惯:停顿、检查你的工作,并修复出错的具体步骤。

通过将过程分解为“学习逐步推理”和“学习修复这些步骤”,研究人员创建了一个框架,帮助 AI 模型变得更加可靠。通过多个数据集和模型的测量结果表明,这种方法是帮助 AI 停止反复犯同样愚蠢错误的一种极具前景的方式。虽然论文并未声称这解决了所有的 AI 问题,但它提供了强有力的证据:教导模型成为自己细心的编辑,一步一个脚印地进行,是解锁更稳健、更可信推理的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →