When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs
本文表明,对于在困难科学问题上的小型指令微调大语言模型而言,通过多数投票实现的自一致性往往会降低准确率,相比于单样本推理,这是因为生成答案之间的高一致性并不一定可靠地与正确性相关联。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图解开一个非常棘手的谜题。你向一位朋友询问答案,但他们似乎并不确定。于是,你问了他们同一个谜题十次。如果他们有八次给出了相同的答案,你可能会想:“好吧,他们一定是正确的!”这有点像现代的“计算机大脑”,即大语言模型(LLMs)试图变得更聪明的方式。它们不仅仅是尝试猜一次,而是经常被要求对一个问题进行多次“思考”,生成不同的思维链,然后选择出现次数最多的那个答案。这种技术被称为自一致性(Self-Consistency)。这就像是在征求一群人的投票;其核心理念是“多数票”几乎总是正确的。
这为什么重要?因为这些计算机大脑正被用于解决困难的科学问题,从生物学到物理学。如果“群众投票”的技巧奏效,我们就可以让计算机思考得更久、更深入,从而获得更好的结果。但如果这群人其实是错的呢?如果计算机对一个错误的答案如此自信,以至于让它多问几次只会让它在错误的道路上越陷越深呢?这就是这篇论文提出的可怕问题。研究人员想知道:在最难的科学问题上,让计算机对自己生成的答案进行投票,究竟是会有所帮助,还是会适得其反?
伟大的投票背离效应
在这项研究中,研究人员在两个流行的较小规模计算机大脑(一个叫 Qwen2.5-7B,另一个叫 Llama-3-8B)上测试了一个非常困难的测试,名为 GPQA Diamond。这个测试包含 198 个研究生水平的科学问题,涵盖生物、化学和物理领域。这类题目足以让一名大学高年级学生感到汗流浃背。
团队使用了一种巧妙的、预先计划好的方法,来观察当他们让这些模型对自己的答案进行“投票”时会发生什么。他们要求模型针对每个问题生成最多 64 次不同的尝试,然后取出现次数最多的答案(多数票)。
转折点在于:多数票产生了背离效应。
模型并没有变得更聪明,反而是在大多数问题上表现得更差了。
- 对于 Qwen 模型,投票法在 56.6% 的问题上降低了准确率。
- 对于 Llama 模型,它在 65.7% 的问题上造成了损害。
你可以这样理解:想象一个学生正在参加一场很难的数学考试。他对一个问题不太确定,于是他问自己:“答案是什么?”十次。如果他在脑海中偶然犯了同样的错误八次,那么“多数票”就会告诉他,要以极高的信心去选择那个错误的答案。随着他问得越多,他对自己那个错误答案的信心就越强。论文称之为“背离效应(backfire)”。事实证明,在这些困难的科学问题上,计算机的信心是一个骗子。
“先知”之梦 vs. 现实
研究人员随后提出了一个实际的问题:“我们能否建立一个廉价且智能的过滤器,来告诉我们何时该投票,何时只需猜测一次?”
他们设想了一个完美的“先知”(一个知道正确答案的神奇向导)。如果这个先知能够观察每个问题并说:“对于这个问题,投票 64 次”或者“对于那个问题,只需猜测一次”,那么模型的得分可以提高 14 到 17 个百分点。这是一个巨大的飞跃!
但研究人员测试了两种现实中的、“无需验证器(verifier-free)”的信号,看看它们是否可以作为这个神奇先知的廉价替代品:
- 一致性门槛(The Agreement Gate):“如果答案之间的意见足够统一,就信任投票。”
- 熵门槛(The Entropy Gate):“如果计算机看起来很‘不确定’(高熵),就不要投票;如果它看起来很‘确定’(低熵),就投票。”
结果如何?这两个门槛都失败了。
这两种方法都无法接近神奇先知所具备的潜力。事实上,使用这些门槛并不能比盲目进行 64 次投票获得更高的分数。其中“一致性门槛”几乎毫无用处(差异小于 0.002),而“熵门槛”也是一条死路。
为什么会发生这种情况?
论文解释说,问题既简单又令人沮丧:信心并不等于正确性。
在这些困难的科学问题上,计算机模型经常卡在一个错误的答案上。当它们生成 64 个答案时,它们可能会生成 50 次那个错误的答案。“多数票”看到 50 票支持错误答案,便认为:“这一定是正确的!”计算机在自信地犯错。
研究人员查看数据后发现,Llama 模型有一个有趣的现象:那些答案达成一致程度最高的问题,实际上是准确率最低的问题。计算机与其自身达成共识的程度越高,它出错的可能性就越大。这就像一群朋友都在对一个糟糕的电影情节达成共识;他们越一致,你就越知道那个情节是荒谬的。
这意味着什么
论文得出结论,对于这些特定的、困难的科学问题,你不能仅仅假设“更多的思考”或“投票”会有所帮助。
- 坏消息是: 如果你依赖计算机自身的共识来判断其是否正确,你可能会被欺骗。所谓的“多数派”往往是错误的。
- 好消息是: 我们确切地知道它为什么失败(因为信心并不追踪正确性),并且我们也知道像检查一致性或不确定性这样的简单技巧无法解决问题。
- 开放性问题: 研究人员没有测试最新的、“推理原生(reasoning-native)”的模型(即那些专门为逻辑设计的超强模型)。他们将这个谜团留给了未来。也许这些新的模型不会产生背离效应?我们目前还不得而知。
简而言之,在处理最难的科学问题时,要求计算机对其自身答案进行投票,往往只是锁定了它的错误。为了获得真正的收益,我们可能需要一种更聪明的检查工作的方法,而不仅仅是一个更大的声量。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。