← 最新论文
🤖 AI

STRIDE: Strategic Trajectory Reasoning via Discriminative Estimation for Verifiable Reinforcement Learning

本文介绍了 STRIDE,这是一个具有可验证奖励的细粒度强化学习框架,它通过从策略性 n-gram 模式中推导出可验证且结果判别性的监督信号,从而增强了大语言模型的推理能力,并实现了比现有方法更精确的信用分配。

原作者: Qinjian Zhao, Zhihao Dou, Dinggen Zhang, Xiangyu Li, Chaoda Song, Zhongwei Wan, Xinpeng Li, Yanyan Zhang, Kaijie Chen, Qingtao Pan, Chengcheng Feng, Zhiqiang Gao, Xiaoyu Xia

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Qinjian Zhao, Zhihao Dou, Dinggen Zhang, Xiangyu Li, Chaoda Song, Zhongwei Wan, Xinpeng Li, Yanyan Zhang, Kaijie Chen, Qingtao Pan, Chengcheng Feng, Zhiqiang Gao, Xiaoyu Xia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人解决复杂的数学谜题。在过去训练这些机器人(被称为大语言模型)的方法中,你会让它们尝试解决问题,如果它们得到了最终答案,你就会为整个尝试过程颁发一颗金星。如果它们错了,你只会让它们“再试一次”,而不会告诉它们究竟是在哪里出错的。

这种“全有或全无”方法的缺陷在于,机器人无法学习哪些具体的步骤是精妙的,哪些又是愚蠢的猜测。它会将它写下的每一个词都视为同等重要,即使其中一些词只是填充物。

STRIDE 是一种更聪明的新型训练方式。你可以把它想象成一位侦探教练,他不仅看最终得分,还会通过复盘整场“比赛录像”,来精准观察哪些动作导致了胜利,哪些动作导致了失败。

以下是 STRIDE 的工作原理,将其拆解为简单的概念:

1. “胜者与败者”的对决

STRIDE 不仅仅是对一个答案进行评分,而是要求机器人针对同一个问题生成一组答案。

  • 有些答案是正确的(胜者)。
  • 有些答案是错误的(败者)。

随后,STRIDE 会将这两组答案并排对比。它会寻找那些在胜者中出现频率远高于败者的特定短语或词汇模式(例如“让我们代入这个变量”或“等等,这似乎不对劲”)。

2. “困惑度计”(熵)

仅仅因为一个短语出现在成功的答案中,并不意味着这个举动就是好的。有时,机器人会无意中使用华丽的辞藻。为了过滤掉这些内容,STRIDE 使用了一个“困惑度计”。

在人工智能的世界里,高“熵”意味着机器人在那一刻处于不确定正在深度思考的状态。

  • 低熵: 机器人只是在输入常规词汇(如“然后……”)。
  • 高熵: 机器人在进行艰难的决策或检查自己的工作。

STRIDE 只关注那些同时具备“获胜短语”特征和高困惑度的短语。这确保了它是在奖励机器人进行明智、关键的决策,而不是仅仅奖励它使用华丽的词汇。

3. “加分”系统

一旦 STRIDE 识别出一个既符合以下两个条件:

  1. 在获胜答案中很常见(具有辨别性),且
  2. 处于深度思考时刻(高熵),

它就会给这个特定的短语发放额外奖励。反之,如果一个短语频繁出现在失败的答案中,并且涉及深度思考,它就会受到惩罚

这就像一位教练在说:“你在检查数学计算的那一步做得非常好!这就是你获胜的原因。但你在猜数字的那一步?那就是你失败的原因。我们要多做第一种,少做第二种。”

为什么这很重要

该论文声称,通过使用这种方法,机器人的学习速度更快、效果更好。

  • 它适用于不同的“大脑”: 他们在几种不同类型的机器人模型(如 Qwen 和 Llama)上进行了测试,它对所有模型都有帮助。
  • 它适用于不同的“谜题”: 它提升了在困难数学竞赛(如 AIME 和 AMC)上的表现,甚至在涉及图像和智能体(与世界交互的机器人)的任务中也表现出色。
  • 它是公平的: 不同于其他试图根据模糊感觉来猜测某一步是否“好”的方法,STRIDE 只奖励那些能够被证明能导致正确答案的步骤。

核心总结

STRIDE 是一种不再将机器人写的每个词都同等对待的训练系统。相反,它扮演着一位目光敏锐的教练,识别出那些真正导致成功的“战略性动作”并给予额外加分,同时惩罚那些导致失败的动作。这有助于机器人成为一个更好的思考者,而不仅仅是一个更好的猜测者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →