← 最新论文
💬 NLP

Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching

该论文提出了一种名为“Stitching Noisy Diffusion Thoughts"的免训练测试时扩展框架,通过利用掩码扩散模型生成多样化推理轨迹、结合过程奖励模型对中间步骤评分,并将高质量步骤拼接后引导自回归模型生成最终答案,从而在数学和代码任务中显著提升了准确率并降低了延迟。

原作者: Roy Miles, Aysim Toker, Andreea-Maria Oncescu, Songcen Xu, Jiankang Deng, Ismail Elezi

发布于 2026-02-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Roy Miles, Aysim Toker, Andreea-Maria Oncescu, Songcen Xu, Jiankang Deng, Ismail Elezi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种让 AI 更聪明、更省力的新方法,叫做"缝合噪声扩散思维"(Stitching Noisy Diffusion Thoughts)。

为了让你轻松理解,我们可以把 AI 解决复杂问题(比如做数学题或写代码)的过程,想象成一群探险家寻找宝藏的过程。

1. 传统方法的困境:要么“孤注一掷”,要么“大海捞针”

  • 传统 AI(自回归模型):就像一个独行的探险家。他必须一步一步走,从起点走到终点。如果他在第 5 步走错了(比如算错了一个数字),整个探险就失败了,之前的努力全白费。为了保险,他必须走得非常慢、非常谨慎,这导致速度很慢。
  • 早期的扩散模型:像是一群盲目乱跑的探险家。他们可以在同一时间向各个方向快速奔跑(并行探索),产生很多条路线。但是,他们跑得太快太乱,很多路线是错的,而且大家跑完就散伙了,没有把好的经验结合起来。

2. 这篇论文的新招:组建“精英拼凑小队”

这篇论文提出了一种"缝合"策略,把上述两种方法的优点结合起来。我们可以把它想象成一个聪明的“寻宝总指挥”在指挥一群探险家

第一步:广撒网(扩散模型探索)

总指挥派出一群快速但有点迷糊的探险家(扩散模型)。

  • 他们不需要走得完美,只需要
  • 因为速度快,他们可以在短时间内跑很多条路线,产生很多“思维碎片”。哪怕有些路线最后走不通,但其中可能藏着正确的“路标”。

第二步:贴标签打分(过程奖励模型 PRM)

总指挥手里有一个超级裁判(过程奖励模型 PRM)。

  • 裁判不看整条路线,而是盯着每一个小步骤打分。
  • 比如,探险家 A 在第 3 步算对了,裁判给个高分;探险家 B 在第 3 步算错了,裁判给个低分。
  • 关键点:即使探险家 A 最后在第 10 步掉进坑里了,但他第 3 步的正确计算依然被保留下来,因为裁判知道那一步是对的。

第三步:缝合与重组(Stitching)

这是最精彩的一步!总指挥把所有探险家得分最高的“路标”收集起来,像拼乐高一样,把它们缝合成一条完美的新路线

  • 这条新路线可能由探险家 A 的第 1 步、探险家 B 的第 3 步、探险家 C 的第 5 步组成。
  • 它不再依赖某一个人的完整表现,而是集众家之长

第四步:最终冲刺(自回归模型求解)

最后,总指挥把这条缝合好的完美路线交给一位沉稳的专家(自回归模型/AR Solver)。

  • 这位专家不需要重新思考,只需要看着这条完美的路线,直接写出最终答案
  • 因为前面的路已经铺好了,专家只需要做最后的确认和收尾,速度极快。

3. 为什么这个方法很厉害?

  • 不浪费任何努力:以前如果一条路线错了,整个就扔了。现在,哪怕路线错了,只要中间有一步是对的,就被“捡”回来了。
  • 又快又准
    • :因为“广撒网”是并行的(大家同时跑),而且最后的专家只需要跑一步。
    • :因为最终答案是基于所有“最佳片段”拼凑出来的,比单靠一个人瞎猜要准得多。
  • 省钱:不需要训练新的模型,直接利用现有的工具就能达到更好的效果。

4. 生活中的类比

想象你在做一道超级难的数学题

  • 旧方法:你一个人苦思冥想,一旦中间算错,就得从头再来,或者换一种完全新的思路,非常耗时。
  • 新方法:你叫上 4 个朋友(扩散模型)同时尝试解题。
    • 朋友 A 算对了前两步,但第三步错了。
    • 朋友 B 前两步错了,但第三步对了。
    • 朋友 C 算对了第四步。
    • 你(裁判)把 A 的前两步、B 的第三步、C 的第四步剪下来拼在一起,形成一条完美的解题思路。
    • 最后,你(专家)看着这条拼好的思路,轻松写出答案。

总结

这篇论文的核心思想就是:不要指望一个人一次就把事做对,也不要因为一个人做错了就全盘否定

通过并行探索(大家快跑)、精细打分(只看哪一步对)和智能缝合(把对的拼起来),AI 可以在极短的时间内,用更少的计算资源,解决以前觉得很难的问题。这就好比用“集众家之长”的方式,让 AI 既跑得快,又走得稳。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →