← 最新论文
🤖 machine learning

STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning

STRIDE 是一种新颖的训练框架,它通过仅利用基于结果的奖励来协同训练生成器与生成式验证器,从而用可学习的、逐步的语言反馈取代标量分数,以显式定位失败并引导推理轨迹,进而增强大语言模型的推理能力。

原作者: Junjie Zhang, Guozheng Ma, Shunyu Liu, Zetian Hu, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Junjie Zhang, Guozheng Ma, Shunyu Liu, Zetian Hu, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教导一位才华横溢但略显困惑的学生如何解开一个复杂的迷宫。过去,我们训练这些 AI“学生”(大型语言模型)的方式,就像是给他们一场考试,然后只告知最终分数:“你答错了。”

这正是论文STRIDE试图解决的问题。以下是其工作原理的简明拆解,并辅以日常类比。

问题所在:“沉默”的成绩单

目前,大多数 AI 训练使用一种称为强化学习的方法。这就像玩电子游戏:AI 完成一个关卡,然后在最后收到“游戏结束”或“你赢了”的信息。

  • 问题:如果 AI 在 10 步数学题的第 3 步出错,老师(计算机)不会说:“嘿,你在第 3 步加法算错了。”它只会说:“答案错误。”
  • 结果:AI 必须猜测自己哪里出错了。这就像试图修理一辆无法启动的汽车,却只知道车坏了,而没有机械师告诉你哪个零件松了。这被称为信息瓶颈——老师提供的信息太少,无法修正具体错误。

一些先前的方法尝试提供逐步评分(如“第 1 步:好,第 2 步:坏”),但这些评分仅仅是数字(0 或 1)。它们仍然无法解释为什么该步骤是坏的。

解决方案:STRIDE(“健谈”的教练)

作者提出了STRIDE,其全称为Stepwise Trajectory Redirection with In-context Deep Evaluation(带上下文深度评估的逐步轨迹重定向)。

STRIDE 引入了一个生成式验证器,取代了沉默的成绩单。你可以把它想象成一位辅导助手,坐在学生旁边,实时与学生一起分析问题。

STRIDE 的工作分为三个阶段,就像一个训练营:

第一阶段:热身(基础策略)

AI 学生尝试独立解决问题。它在最后获得一个简单的“对/错”评分。这建立了基础,就像学习游戏规则一样。

第二阶段:训练教练(验证器)

现在,系统训练第二个 AI(验证器)充当教练。

  • 神奇之处:教练并非由人类提供每一步的对错列表来训练(这既昂贵又缓慢)。相反,教练通过观察学生解题并检查最终答案是否正确来学习。
  • 技能:随着时间的推移,教练学会审视学生杂乱无章的解题过程,并指出:“等等,在第 3 步,你忘了进位,”或者“你在这里跳过了一个逻辑步骤。”它学会将简单的“错误”评分转化为详细的书面评语

第三阶段:带指导的“重做”(轨迹重定向)

这是核心创新。当学生解题失败时:

  1. 找出第一个错误:教练(验证器)扫描学生的解题过程,找到首个失败点(FPF)。它精确定位逻辑断裂的确切位置。
  2. “重定向”:系统不会让学生从头开始重做整个问题(这很浪费),而是说:“好吧,你在第 2 步之前做得很好。让我们停在那里。这是我关于第 3 步为何失败的书面说明。现在,请利用我的建议,从第 2 步开始,重新尝试解决剩余部分。”
  3. 多点策略:有时,第 3 步的错误实际上是由第 1 步的一个当时看起来不错的“糟糕选择”引起的。STRIDE 足够智能,会说:“让我们尝试从第 1 步第 2 步重新开始”,给学生多次机会寻找更好的路径。

为什么这很重要

该论文声称,这种方法解决了两个主要问题:

  1. 打破“沉默”:通过使用语言反馈(文字)而不仅仅是标量奖励(数字),AI 获得了更丰富的解释。这就像老师只说“不及格”与老师说“你忘了分配负号”之间的区别。
  2. 解决“无解”问题:作者发现,对于 AI 通常正确率为 0% 的极难问题,标准方法会因为得不到任何有用信号而放弃。然而,STRIDE 仍然可以学习。即使 AI 失败了,教练也能指出错误,AI 可以从该特定点尝试不同的路径,最终破解难题。

类比总结

  • 旧方法:你参加了一场考试。你得到了"0/100"。你不知道该复习什么。
  • 之前的“逐步”方法:你得到了一份带有评分的试卷:“第 1 步:10/10,第 2 步:0/10"。你知道哪里失败了,但不知道为什么
  • STRIDE:你参加了一场考试。你得到了"0/100",但老师还递给你一张书面便条,上面写着:“你在第 2 步卡住了,因为你用错了公式。让我们回到第 1 步,看看这张便条,尝试一种不同的方法。”

结果

该论文在困难的数学和逻辑谜题上测试了这种方法。

  • STRIDE 击败了所有其他现有方法(包括之前的最先进方法)。
  • 它在数学问题、编程挑战和逻辑谜题上都有效。
  • 最重要的是,它成功解决了以前被认为对这些模型“不可能”解决的问题,将 0% 的成功率转化为学习机会。

简而言之,STRIDE 教导 AI 通过与自己对话来从错误中学习,而不是盲目猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →