← 最新论文
🤖 machine learning

Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance

本文提出了一种名为 SHEAR 的方法,通过计算正确与错误样本在隐藏状态分布上的 Span 级 Wasserstein 距离,在无需额外标注或奖励模型的情况下,实现了强化学习中更细粒度的信用分配(Credit Assignment)。

原作者: Xinzhu Chen, Wei He, Huichuan Fan, Wenzhe Niu, Zhongxiang Sun, Xuanru Wang, Jiuchong Gao, Jinghua Hao, Renqing He, Weijie Yu

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinzhu Chen, Wei He, Huichuan Fan, Wenzhe Niu, Zhongxiang Sun, Xuanru Wang, Jiuchong Gao, Jinghua Hao, Renqing He, Weijie Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一种让 AI(大语言模型)在做数学题或写代码时“更聪明、更懂得反思”的新技术,名字叫 SHEAR

为了让你听懂,我们不用那些复杂的数学术语,我们来玩一个**“侦探破案”**的游戏。

1. 背景:现在的 AI 像个“只看结果”的笨学生

想象一下,你正在教一个学生做数学证明题。这个学生每次做完题,你只看他最后写出的答案是对还是错(这就是论文里说的 Outcome-level reward)。

  • 如果他最后算对了,你就奖励他:“好棒!”
  • 如果他最后算错了,你就惩罚他:“太差了!”

问题来了: 这个学生可能在第一步就写错了,但后面运气好或者瞎猜对了;也可能前面每一步都写得完美无缺,结果最后一步算术写错了。

如果你只看结果,你就会把奖励或惩罚**“平均分配”**给整张卷子上的每一个字。这很不公平!对于那个“前面全对、最后一步错”的学生,你惩罚了整张卷子,他会很困惑:“我前面明明做得很好,为什么要罚我?”这就是目前主流 AI 训练方法(GRPO)的痛点:它分不清到底是哪一步出了问题(Credit Assignment 难题)。

2. 核心发现:AI 的“内心戏”会出卖它

这篇论文的研究者发现了一个非常神奇的现象:虽然 AI 的最终答案可能看起来差不多,但它在思考过程中的“内心世界”(也就是隐藏层状态 Hidden States)其实已经悄悄分道扬镳了。

我们可以把 AI 的思考过程想象成**“两条行驶在森林里的路径”**:

  • 正确的路径: 树木茂密、路标清晰,AI 的“内心”感觉很笃定,走得稳稳当当。
  • 错误的路径: 树木杂乱、路标模糊,AI 的“内心”其实已经开始迷茫、混乱了。

研究者发现,当 AI 从“正确思考”转向“错误思考”的那一瞬间,它内部的**“情绪波动”(分布差异)会突然变得非常剧烈。这种波动就像是森林里的信号灯,虽然答案还没出来,但“内心戏”已经告诉你:“注意!这里要出岔子了!”**

3. SHEAR 技术:给 AI 装上“精准定位器”

有了这个发现,研究者发明了 SHEAR。它的工作原理就像是一个**“超级监考老师”**,他不仅看答案,还会盯着学生的“眼神”和“笔迹”:

  1. 对比内心戏: 老师会把“做对的学生”和“做错的学生”的思考过程放在一起对比。
  2. 寻找分歧点: 老师发现,如果某个步骤里,做对的学生和做错的学生,他们的“内心想法”(隐藏状态分布)突然变得完全不一样了(用数学里的 Wasserstein 距离来衡量这种“不一样”),那么这个步骤就是**“关键分歧点”**。
  3. 精准奖惩:
    • 如果一个步骤是分歧点,且学生最后做错了,老师就会精准地惩罚这几个字:“就是这几个字写错了,别整张卷子都罚!”
    • 如果一个步骤是分歧点,且学生最后做对了,老师就会重赏这几个字:“你这一步转折写得真漂亮,抓住了重点!”

4. 总结:这有什么用?

通过这种“精准打击”的训练方式,AI 不再是盲目地通过结果来猜过程,而是学会了**“哪里错了改哪里,哪里对了重赏哪里”**。

实验结果证明:

  • 数学更强了: 在处理复杂的奥数题时,AI 的表现大幅提升。
  • 代码更稳了: 写程序时,逻辑错误变少了。
  • 更省钱、更高效: 最厉害的是,这个老师不需要专门请人来给每一步打分(不需要昂贵的标注),他只需要看一眼 AI 的“内心戏”就能自己学会教书。

一句话总结:
SHEAR 让 AI 从一个“只看分数”的死记硬背者,变成了一个“能通过察言观色来精准纠错”的思考者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →