← 最新论文
💬 NLP

Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B

本文表明,在各种开源模型(1.5B 至 7B 参数)和数学基准测试中,在等同的 Token 成本下,重复采样一致地优于或等同于复杂的自我修正与反思方法,这揭示了后者表现出的增益往往源于生成量的增加,而非更优的推理策略。

原作者: Iliya Mirzaei

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Iliya Mirzaei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

伟大的 AI 大脑增强实验

想象你有一个非常聪明但有点分心的学生。你给他们一道很难的数学题,他们尝试去解决它。有时他们做对了,有时做错了。在人工智能的世界里,研究人员一直试图找出如何让这些“学生”(被称为大语言模型)在不从头开始重建它们的情况下思考得更好。一个流行的想法是告诉 AI 要“更努力地思考”。这意味着要求它规划步骤、与自己辩论、批判自己的错误,或者在提交答案前重写答案。这就像告诉一个学生:“不要只写出答案;要写一篇完整的文章来解释为什么你认为那个答案是正确的,检查你的工作,甚至可能再试一次。”

核心问题在于:所有这些额外的思考真的有帮助吗,还是只是在浪费时间?这里有一个核心概念叫做 token(标记/词元)。把 token 想象成 AI 花费的“单词”或“努力单位”。每当 AI 写下一个词,都会消耗一个 token。如果一种方法让 AI 为了解决一个原本可以用 100 个词解决的问题而写了 1,000 个词,那么它就多花了十倍的努力。科学界的争论在于,这种额外的努力究竟是来自于“策略”(比如自我批判),还是仅仅因为 AI 有机会写了更多的词。如果你给一个学生十倍数量的纸张,他们之所以能拿到更高的分数,可能仅仅是因为他们有了更多的尝试空间,而不是因为他们突然变得更聪明了。这篇论文旨在测试这一点:当你给不同的策略提供完全相同数量的纸张(token)时,哪一个才是真正的赢家?

论文:多采样,少反思

这篇名为《多采样,少反思》(Sample More, Less Reflection)的论文是一项旨在解决关于 AI 是否需要通过“反思”其工作来变得更聪明的争论的大规模实验。研究人员选取了七种让 AI “更努力思考”的热门方法——包括让 AI 批判自身、与自己的副本辩论或尝试从列表中挑选最佳答案的方法——并将它们与一个非常简单、枯燥的基准线进行了对决:重复采样(repeated sampling)

这个基座方法就像抛十次硬币并选择出现次数最多的那一面。用 AI 的术语来说,这意味着对同一个问题提问十次,然后取出现次数最多的答案。研究人员确保每种方法使用的 token(生成的单词数)完全相同,从而确保了竞争环境的公平性。他们在三种不同规模的 AI 模型(15 亿、30 亿和 70 亿参数)上,使用两个数学基准测试(GSM8K 和 MATH-500,各包含 150 个问题)进行了测试。

重大发现:
结果令人惊讶。在几乎所有案例中,那些让 AI 进行“反思”、“批判”或“辩论”的高级方法,都输给了仅仅多次提问并计票的简单方法。

当研究人员仔细观察为什么这些高级方法会失败时,他们发现了一个清晰的模式。那些要求 AI 评判自身工作(例如重写答案或从列表中挑选“最佳”答案)的方法,表现始终不如基准线。例如,在较小的 15 亿参数模型上,一种名为“Best-of-N”(即从 8 个答案中选出最好的一个)的方法,其得分比直接统计这 8 次尝试中最常见答案的方法低了约 8 到 11 个百分点。即使是在较大的 70 亿参数模型上,这种差距也消失了:两者的差异在统计学上与零无异,这意味着“评判者”不再明显比“计数器”差,其造成的损失不再具有显著性。

论文明确排除了“通过自我反思进行深度思考”是神奇要素的可能性。相反,它表明将 token 花在另一次尝试上,比花在自我修正上是更好的投资——在研究人员测试的所有模型规模中都是如此。 如果你有足够的 token 来写一篇关于你答案的长篇批判性文章,你最好把这些 token 用来写两到三个独立的全新答案,然后直接挑选最受欢迎的一个。

“幽灵”方法与“规模决定论”的教训

实验中最有趣且最具启发性的部分之一涉及一种名为 Reflexion(反思) 的方法。这种方法的设计初衷是这样的:AI 尝试解决一个问题,然后问自己:“我做对了吗?”如果它说“不”,它就会重试;如果它说“是”,它就停止。

研究人员在最小的模型(15 亿参数)中发现了一个有趣的故障。在这个微型模型上,AI 从未说过“不”。它会将每一次最初的回答都判定为“正确”,即便这些回答是错误的。因此,Reflexion 方法从未真正触发重试机制。它在无形中坍缩成了一次廉价的单次尝试。由于它很便宜(没有消耗额外的 token),它看起来表现不错。但当研究人员强制要求它无论判断结果如何都必须重试三次时,性能显著下降,这证明了“反思”机制本身实际上是在损害得分。

随着模型变大(从 15 亿到 70 亿),“计数投票”与“让 AI 评判”之间的差距开始缩小。在 70 亿参数时,AI 已经足够擅长评判,以至于它不再具有破坏性;两者之间的差异不再能与零区分开来。然而,论文指出,即使到了这个规模,AI 在评判方面也并没有比计数法更好,它只是不再比计数法更差了。研究人员认为,如果想要 AI 真正超越简单的“投票计数”法,可能需要专门对其进行“评判者”训练,而不仅仅是让它在运行中即兴评判。

这对未来意味着什么

该论文向所有构建此类 AI 系统的开发者传达了一个强有力的信息:不要把事情复杂化。 如果你有一个 token(单词)预算,获得正确答案最有效的方法通常是生成许多不同的尝试,并让多数原则起作用,而不是要求 AI 批判并重写自己的工作。

作者还警告说,某些方法在理论上看起来很好,但在实践中可能会失败,因为它们“隐藏”了真实的成本。如果一个方法由它自己决定何时停止(如 Reflexion),它可能会立即停止以节省开支,使其看起来很高效,但它实际上并没有完成它被设计用来做的工作。

最终,这项研究表明,对于有明确对错答案的数学问题,“自我反思”的神奇魔力是一个神话——至少对于目前测试的模型而言是如此。最强大的工具不是更聪明的策略,而是单纯地尝试更多次。正如研究人员所言,重新考虑一个答案所花费的 token,不如将同样的 token 用于另一次全新的尝试。AI 不需要被告知要思考得更深,它只需要被给予更多的尝试机会。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →