STRIDE: Strategic Trajectory Reasoning via Discriminative Estimation for Verifiable Reinforcement Learning
本文介绍了 STRIDE,这是一个具有可验证奖励的细粒度强化学习框架,它通过从策略性 n-gram 模式中推导出可验证且结果判别性的监督信号,从而增强了大语言模型的推理能力,并实现了比现有方法更精确的信用分配。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人解决复杂的数学谜题。在过去训练这些机器人(被称为大语言模型)的方法中,你会让它们尝试解决问题,如果它们得到了最终答案,你就会为整个尝试过程颁发一颗金星。如果它们错了,你只会让它们“再试一次”,而不会告诉它们究竟是在哪里出错的。
这种“全有或全无”方法的缺陷在于,机器人无法学习哪些具体的步骤是精妙的,哪些又是愚蠢的猜测。它会将它写下的每一个词都视为同等重要,即使其中一些词只是填充物。
STRIDE 是一种更聪明的新型训练方式。你可以把它想象成一位侦探教练,他不仅看最终得分,还会通过复盘整场“比赛录像”,来精准观察哪些动作导致了胜利,哪些动作导致了失败。
以下是 STRIDE 的工作原理,将其拆解为简单的概念:
1. “胜者与败者”的对决
STRIDE 不仅仅是对一个答案进行评分,而是要求机器人针对同一个问题生成一组答案。
- 有些答案是正确的(胜者)。
- 有些答案是错误的(败者)。
随后,STRIDE 会将这两组答案并排对比。它会寻找那些在胜者中出现频率远高于败者的特定短语或词汇模式(例如“让我们代入这个变量”或“等等,这似乎不对劲”)。
2. “困惑度计”(熵)
仅仅因为一个短语出现在成功的答案中,并不意味着这个举动就是好的。有时,机器人会无意中使用华丽的辞藻。为了过滤掉这些内容,STRIDE 使用了一个“困惑度计”。
在人工智能的世界里,高“熵”意味着机器人在那一刻处于不确定或正在深度思考的状态。
- 低熵: 机器人只是在输入常规词汇(如“然后……”)。
- 高熵: 机器人在进行艰难的决策或检查自己的工作。
STRIDE 只关注那些同时具备“获胜短语”特征和高困惑度的短语。这确保了它是在奖励机器人进行明智、关键的决策,而不是仅仅奖励它使用华丽的词汇。
3. “加分”系统
一旦 STRIDE 识别出一个既符合以下两个条件:
- 在获胜答案中很常见(具有辨别性),且
- 处于深度思考时刻(高熵),
它就会给这个特定的短语发放额外奖励。反之,如果一个短语频繁出现在失败的答案中,并且涉及深度思考,它就会受到惩罚。
这就像一位教练在说:“你在检查数学计算的那一步做得非常好!这就是你获胜的原因。但你在猜数字的那一步?那就是你失败的原因。我们要多做第一种,少做第二种。”
为什么这很重要
该论文声称,通过使用这种方法,机器人的学习速度更快、效果更好。
- 它适用于不同的“大脑”: 他们在几种不同类型的机器人模型(如 Qwen 和 Llama)上进行了测试,它对所有模型都有帮助。
- 它适用于不同的“谜题”: 它提升了在困难数学竞赛(如 AIME 和 AMC)上的表现,甚至在涉及图像和智能体(与世界交互的机器人)的任务中也表现出色。
- 它是公平的: 不同于其他试图根据模糊感觉来猜测某一步是否“好”的方法,STRIDE 只奖励那些能够被证明能导致正确答案的步骤。
核心总结
STRIDE 是一种不再将机器人写的每个词都同等对待的训练系统。相反,它扮演着一位目光敏锐的教练,识别出那些真正导致成功的“战略性动作”并给予额外加分,同时惩罚那些导致失败的动作。这有助于机器人成为一个更好的思考者,而不仅仅是一个更好的猜测者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。