← 最新论文
💬 NLP

Improving Value-based Process Verifier via Structural Prior Injection

本文提出通过注入结构先验将蒙特卡洛采样误差建模为分布失配,从而改进用于大语言模型推理的基于价值的过程验证器,以此在极低的计算成本下,在 Best-of-N 和束搜索(Beam search)任务上实现 1–2 个百分点的性能提升。

原作者: Zetian Sun, Dongfang Li, Baotian Hu, Jun Yu, Min Zhang

发布于 2026-01-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Zetian Sun, Dongfang Li, Baotian Hu, Jun Yu, Min Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名非常聪明但缺乏经验的学生(即 AI)如何解决复杂的数学问题。这个学生不仅仅是给出最终答案,还会向你展示他每一步的推导过程。你的任务是充当一名教练(“过程验证器”),观察他的每一步并说:“做得好,你在正确的轨道上,”或者“哎呀,你走入了一个死胡同。”

这篇论文所解决的问题是:这位教练目前使用的是一把经常不准确的粗糙卷尺

问题所在:“嘈杂”的硬币投掷

目前,为了判断一个步骤是否正确,教练会模拟问题的剩余部分多次(比如投掷 10 次硬币来观察正面向上的次数)。

  • 问题在于: 如果你只投掷几次,结果是“嘈杂”的。也许你得到了 6 个正面,但实际概率其实是 50%。教练看到了“60%”,便认为学生做得非常好,而实际上学生可能只是运气好。
  • 旧的修复方法: 人们曾尝试通过将分数视为一个简单的数字(标量)来平滑这个问题,但这忽略了数据来自于一个混乱、随机的过程这一事实。

解决方案:注入“结构化先验”

作者提出了一种让教练思考的新方式。教练不再仅仅是猜测一个数字,而是要求教练去想象一个预定义的可能性图谱(“结构化先验”)。

可以这样理解:

  • 旧方法: 教练猜测:“我认为有 60% 的概率这一步是正确的。”
  • 新方法: 教练思考:“我知道这一步就像掷骰子。根据游戏的规则,结果应该看起来像某种特定的正态分布或特定的骰子点数模式。我的任务不仅仅是猜测一个数字;我的任务是猜测哪种概率分布的形状最符合我所看到的情况。”

通过迫使教练从形状和模式(分布)的角度进行思考,而不是仅仅从单一数字的角度出发,教练可以更好地理解由有限次练习运行所产生的“噪声”。

核心技巧:“基于统计的距离”

你如何教会教练选择正确的形状?作者发明了一把新的尺子,叫做基于统计的距离

想象你有一个代表完美步骤的“金标准”图谱(地面真值)。你也有一个教练的“最佳猜测”图谱。

  • 旧的尺子(如 KL 散度)在测量这两个图谱之间的距离时表现很差,因为它们不理解某些结果彼此之间比其他结果更“接近”(例如,50% 的概率离 51% 比离 90% 更近)。
  • 这个新的基于统计的距离尺子理解这一点。它衡量两个图谱之间的距离,同时考虑到某些误差是“微小的”,而另一些误差是“巨大的”。这有助于教练学习得更快、更准确。

结果:小投入,大回报

研究人员在数学问题(MATH 数据集)上测试了这项技术。他们将旧的“单一数字”教练与新的“感知分布”教练进行了对比。

  • 结果: 新型教练能够稳定地多解决约 1% 到 2% 的问题。
  • 代价: 这种提升是以“几乎没有成本”实现的。它不需要更大的 AI 模型或更多的计算能力;它只需要一种更聪明的观察数据的方式。
  • 教训: 他们发现,你选择的图谱(先验)类型非常重要。如果你选择的图谱不符合现实情况,教练的表现就会很差。但如果你选择一个“合理的”图谱(比如模仿硬币投掷随机性的高斯分布),教练就会表现出色。

总结

本文认为,当 AI 试图评判其自身的推理步骤时,它不应该仅仅猜测一个单一的分数。相反,它应该基于预定义的结构去猜测一个概率模式。通过使用一种更聪明的测量方式来衡量其猜测与真相之间的接近程度,AI 会成为一名更好的教练,能以同样的努力解决更多的难题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →