Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning
本文提出了一种无需验证器的“广度-深度”框架,该框架通过利用测试时计算,通过自我批判和自我修正来迭代优化多样化的采样展开,从而增强大语言模型的推理能力,并且在多个数学基准测试中,其表现优于传统的采样和基于验证器的选择方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在尝试解决一个非常棘手的数学谜题,就像一个需要长链逻辑推理才能破解的谜语。你有一个超级聪明的伙伴(一个大语言模型,或 LLM)可以和你交流。通常,当你问这个朋友一个问题时,他们会立即给出一个答案。但有时,他们会在第一步就卡住,并带着这个错误一路错到底。
为了解决这个问题,科学家们尝试了两种主要的方法。第一种是“重采样”(resampling):让你的朋友把这个谜题尝试十遍,并挑选出出现次数最多的答案。这就像是问十个不同的人同一个谜语,看看谁的答案达成了一致。第二种方法是使用“验证器”(verifier):一个单独的、极其严格的老师,负责为每个答案评分以判断哪个最好。但问题在于,询问十个人往往只会得到十个略有差异但本质相同的错误想法,而依赖老师则意味着你必须相信这位老师不会感到困惑或带有偏见。
这篇题为《精炼优于重采样》(Refining Over Resampling)的论文提出了第三种方法。作者建议,与其只是索要更多的猜测,或者雇佣一位老师,不如教 AI 成为自己的编辑。他们让 AI 生成几个不同的初始想法,然后对于每一个想法,他们让 AI 停下来,对自己的工作进行批判,找出自己的错误,并在给出最终答案之前将其修正。这就像是给你的朋友第二次思考的机会,不是通过让他们重新开始,而是对他们说:“嘿,等等,你在第三步犯了一个小错误;让我们把它修好,然后继续。”
问题所在:“回声室”与“幻觉底线”
研究人员注意到,当他们仅仅通过生成更多答案来让 AI 模型解决数学问题时,发生了一些奇怪的现象。他们称之为“多样性饱和”(diversity saturation)。想象一下,你问一群朋友猜一个罐子里有多少颗豆子。如果你问十个人,你可能会得到十个不同的猜测。但如果你问一百个人,你可能会发现其中九十个人都在猜非常接近的数字,因为他们都看到了同一个(虽然是错误的)“显而易见”的线索。AI 也在做同样的事情:它不断生成一些错误路径的变体,在重复而非寻找新方案上浪费脑力。
除此之外,还存在“幻觉底线”(hallucination floor)。即使 AI 在内心深处知道正确答案,它也可能在书写过程中意外地在算术错误或逻辑失误上“绊倒”。由于每一次猜测都是独立进行的,每一次猜测都有同等的概率在同样的类型错误上“绊倒”。仅仅增加猜测次数并不能提供帮助,因为它并没有修复那个“绊脚石”,它只是给了你更多的“绊跤”。
解决方案:广度与深度
作者提出了一种他们称为“广度-深度精炼”(Breadth-Depth Refinement)的策略。把它想象成探索迷宫。
广度(Breadth) 是关于撒开一张大网。AI 不仅仅走一条路,而是生成几条不同的起始路线(称为“展开路径/rollouts”)。这确保了它们不会都困在同一个错误想法的“回声室”里。
深度(Depth) 才是真正的魔力所在。一旦有了这些不同的路径,他们并不会立即挑选最好的那一个。相反,他们会对每一条路径进行循环自我改进。
- 生成器(The Generator): AI 写下解题的下一个部分。
- 评论家(The Critic): AI 停下来,扮演一个严格的编辑,阅读它刚刚写下的内容,并说道:“等等,这部分的数学计算不对,”或者“那部分的逻辑讲不通。”
- 修正器(The Corrector): AI 听从评论家的意见,并重写那个特定的部分以修复错误。
他们对每一条路径都进行几次这样的循环(称为“深度”)。最后,他们将所有经过润色、自我修正后的答案汇总,并让它们进行投票。赢得投票的答案就是最终答案。
研究发现
团队在一些非常难的数学竞赛上测试了这个想法,例如 AIME(美国数学邀请赛)和 MATH500 数据集。他们将这种方法与旧方法进行了对比:仅仅进行一次猜测(贪婪算法/Greedy)、进行八次猜测并投票(多数投票/Majority Voting),或者进行八次猜测并让一个“老师”AI 选出胜者(基于验证器的 Best-of-N)。
结果非常令人振奋。他们的这种方法一致优于其他方法。例如,当他们使用一个较小的、能力较弱的 AI 模型 Qwen2.5-1.5B 时,旧的“老师”方法在 MATH500 问题上的准确率约为 29.6%。但通过这种新的“自我编辑”方法,同一个模型在 MATH500 上的准确率跃升至 58.0%。这几乎翻了一倍!在 AMC(美国数学竞赛)测试中,同一个小模型从 25.0% 提升到了 32.5%。
即使是对于更大、更聪明的模型,他们的方法仍然提高了得分,尽管增幅稍小,因为那些聪明的模型本身就已经做得相当不错了。
为什么有效(以及为什么它与众不同)
核心洞察在于,AI 不需要外部老师来告诉它哪里错了。如果给予正确的结构,它可以学会发现自己的错误。论文指出,“评论家”这一步至关重要;当他们移除 AI 明确批判自身工作的环节时,得分就会下降。事实证明,仅仅要求 AI “再试一次”是不够的;它需要被告知“该修复什么”。
此外,这种方法是“无需训练的”(training-free)。他们不需要教 AI 任何新知识,也不需要向它展示成千上万个如何自我修正的例子。他们只是以一种更聪明的方式利用了 AI 现有的脑力进行测试。
权衡
当然,这也是有代价的。这种方法需要更多的计算能力和时间。因为 AI 必须针对每个问题进行多次生成、评论和重写,所以它比仅仅进行一次猜测消耗更多的“计算量”(compute,即计算机脑力的专业术语)。然而,作者计算出,就其带来的准确度提升而言,所付出的额外工作量是值得的,尤其是对于那些在第一次尝试时难以获得正确答案的小型模型。
最后,这篇论文表明,当我们希望 AI 变得更聪明时,我们不应该仅仅要求它更努力地尝试或要求它进行更多次的猜测。我们应该给予它时间、结构,让它去思考、检查自己的工作,并在递交最终答案之前修复自己的错误。这是一种从“多即是好”到“好即是好”的转变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。