← 最新论文
📊 statistics

When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs

该论文介绍了 CALVER,这是一种无需训练的符号验证器,它通过根据 Pearl 的因果标准对结构化推理轨迹进行评分,在因果推理方面超越了传统的投票法和基于奖励的方法,从而即使在存在多个正确解的情况下也能识别出有效的答案。

原作者: Omatharv Bharat Vaidya, Connor Thomas Jerzak, Zayne Rea Sprague, Fangcong Yin, Nhat Ho

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Omatharv Bharat Vaidya, Connor Thomas Jerzak, Zayne Rea Sprague, Fangcong Yin, Nhat Ho

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图解开一个谜题,比如弄清楚为什么你房间里的一盆植物快死了。你可能会请一位超级聪明的 AI 侦探来观察线索。这位 AI 不仅仅是给出一个答案;它会尝试通过十种不同的方式来思考这个问题,就像侦探尝试出十种不同的理论一样。通常,如果 AI 很聪明,那么这十个理论中的大多数都会是相同的,而出现次数最多的那个很可能就是正确的答案。这被称为“投票”或“自洽性”(self-consistency),它在只有唯一正确答案的数学问题或简单的逻辑谜题中效果非常好。

但当谜题有许多个正确答案时,会发生什么呢?想象一下,植物枯萎可能是由三个不同的原因造成的:阳光太强、水分不足或有虫害。这三个理由都是合理的。如果你让 AI 思考十次,它可能会猜“阳光”三次,“水分”三次,以及“虫害”三次。选票被分散了!与此同时,AI 可能会不小心猜“植物饿了”四次。尽管“饿了”是一个愚蠢的错误答案,但它仅仅因为是最受欢迎的猜测而胜出了。这就是这篇论文所解决的棘手问题:当存在许多正确解时,通常的“少数服从多数”方法实际上可能会选出一个错误的答案。

研究人员在人工智能和因果推理(这只是一个表示“弄清楚因果关系”的专业说法)领域工作,他们发现这种“选票分散”问题是 AI 面临的一个重大难题。他们发现,当要求 AI 寻找任何一种有效的解决问题的方法时,正确的答案往往会散落在许多不同的选项中,而一个错误的答案却可能意外地成为最受欢迎的选项。

为了解决这个问题,团队发明了一个名为 CALVER(Causal Axiom-Level VERification,因果公理级验证)的新工具。把 CALVER 想象成一个严格遵守规则的裁判,而不是一场人气竞赛。它不再计算一个答案出现了多少次,而是根据一套不可逾越的因果律来检查每一个猜测。它会问:“这个答案是否符合物理学和逻辑学的规律?”如果一个答案遵循规则,它就会得到高分,即使它是唯一的同类。如果一个答案违反了规则,它就会得到零分,即使它是最受欢迎的猜测。

论文表明,这种“裁判法”比单纯的“投票法”效果要好得多。在测试中,CALVER 能够大约 42.1% 的时间找到正确答案,而旧的“投给最受欢迎者”的方法仅能大约 30% 的时间找对。当他们让 AI 多尝试几次(最多 32 次)时,这种差距变得更大,CALVER 以巨大的优势保持领先。他们还证明了,即使 AI 必须通过阅读一个混乱的故事来理解规则,而不仅仅是在规则被清晰给出时,这种方法依然有效。

作者非常谨慎地指出,这并非魔法;这是一个针对特定问题的特定修复方案。他们从数学上证明了,当存在许多有效答案时,投票法往往会失败,并通过实验展示了检查规则是如何奏效的。他们甚至在与植物或因果关系无关的逻辑谜题上进行了测试,而同样的“检查规则”的思想仍然奏效。不过,他们也提到,如果问题很简单且只有一个正确答案,那么旧的投票法仍然没问题。但对于那些有许多正确解法的复杂情况,CALVER 是新的冠军,它阻止了 AI 被“人气”所迷惑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →