← 最新论文
🤖 AI

Claim-Level Reliability Assessment for Efficient Test-Time Reasoning

本文提出了断言级可靠性评估(Claim-Level Reliability Assessment, CLR),这是一个无需训练的框架,通过从全过程评估转向针对性的断言级证伪,将计算资源重新分配给验证决策关键型断言,从而提升测试时推理效率,在显著提高准确率的同时减少了 Token 使用量。

原作者: Sen Xu, Wei Wang, Shixi Liu, Jixin Min, Yingwei Dai, Zhibin Yin, Yirong Chen, Junlin Zhang

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Sen Xu, Wei Wang, Shixi Liu, Jixin Min, Yingwei Dai, Zhibin Yin, Yirong Chen, Junlin Zhang

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解开一个非常棘手的谜题,但你不是独自一人,而是请了一屋子的聪明朋友来写下他们的答案。这就是现代“大语言模型”(LLM)在尝试解决难题时的运作方式。它们不仅仅是进行一次性的猜测,而是可以生成许多不同的尝试,或者说“轨迹”(traces),来解决问题。过去挑选最佳答案的方法很简单:计票。如果五个朋友说答案是“蓝色”,三个说“红色”,你就选“蓝色”。这被称为“自一致性”(self-consistency)。

但问题在于:仅仅因为一群人达成了一致,并不意味着他们就是正确的。有时候,整间屋子的人可能会自信满满地达成一个错误的共识,因为他们都在很早的阶段犯了同一个微小的错误,或者因为被一段冗长且令人困惑的解释分散了注意力,从而隐藏了错误。你即将阅读的这篇论文正是在解决这个问题的。它在问:我们如何能更明智地利用计算机的脑力?与其仅仅要求提供更多的答案,如果我们将这些能量用于检查现有答案中是否存在隐藏的缺陷,情况会怎样?研究人员提出了一种全新的方法,它就像一个超级侦探,寻找那个能证明某个答案是错误的唯一证据,而不是试图证明它是正确的。

侦探的捷径:断言级可靠性评估

这篇论文介绍了一个聪明的全新框架,称为断言级可靠性评估(Claim-Level Reliability Assessment, CLR)。把它想象成一场由一位非常聪明的侦探参与的“找茬/识破谎言”游戏。

通常,当计算机尝试解决数学或逻辑问题时,它会写下一段长长的故事(即“推理轨迹”),解释每一个步骤。如果你试图检查整个故事中的错误,就像是在试图从一部 50 页的小说中寻找一个错别字,而剩下的文本都只是枯燥、正确的填充内容。错误会淹没在噪音之中。

CLR 改变了游戏规则,它要求模型以两种不同的方式进行操作:

  1. 提取“锚点”: 模型不再阅读整部小说,而是首先提取出五到六个最关键的句子——即“断言”(claims)——它们支撑着整个论证。这些是逻辑锚点。如果这些特定的句子是真的,那么答案可能是正确的;如果其中一个句子是假的,整个答案就会崩塌。
  2. “证伪”搜寻: 这是神奇之处。论文指出,打破一个断言要比构建一个完美的解决方案容易得多。想象一下你在用积木搭一座塔(构建解决方案);你需要每一块积木都完美无瑕。但如果你试图证明一座塔是不安全的(证伪一个断言),你只需要找到一个摇晃的积木将其推倒即可。

CLR 利用了这种“不对称性”。它提取每个解决方案中的关键断言,并询问模型:“你能找到一个理由来证明这个特定断言是错误的吗?”它并不是要求模型重新解决问题,而是要求它扮演一个寻找致命缺陷的批评者的角色。

实际运作流程

这个过程分为两个阶段,就像一场两轮面试:

  • 第一轮(生成): 模型生成多个不同的解决方案(例如 32 个)。对于每个解决方案,它还会写下支持其最终答案的 5 个关键断言。
  • 第二轮(证伪): 模型回到这些断言面前。它试图“驳斥”它们。模型是否发现了矛盾?数学错误?还是逻辑漏洞?
    • 如果一个断言在攻击中幸存了下来,它就会获得一分。
    • 如果一个断言被驳回(证明错误),整个解决方案都会受到重罚。

论文使用了一种特殊的评分系统。如果一个解决方案中哪怕只有一个关键断言被击倒,它的得分就会大幅下降。这使得一小部分“可靠”的解决方案(那些在攻击中幸存下来的方案)能够战胜一大群“自信但错误”的解决方案(那些带有隐藏缺陷的方案)。

数据说明

研究人员在四个不同的 AI 模型和四个非常困难的数学基准测试(如 HMMT25 和 CMIMC25)上测试了这个想法。他们将这种新方法与标准的“投票计数”方法进行了对比。

以下是他们的发现:

  • 更高的准确率: 在 GPT-OSS-20B 模型上,使用 CLR 将 CMIMC25 基准测试的准确率从 77.50% 提升到了 82.19%。这是一个 4.69 个百分点 的跨越。
  • 节省成本(Token): 更棒的是,他们实现这一目标时使用的 Token(计算机生成的数字“单词”)比标准方法减少了 37.0%
  • 拯救少数派: 在许多情况下,标准方法会因为某个答案最受欢迎(例如 5 比 3 的投票)而选错。CLR 成功地在约 37% 的此类案例中“拯救”了正确答案,通过发现多数派推理中的隐藏缺陷,扭转了错误的共识。

这为什么重要

论文指出,我们并不总是需要让 AI 模型变得更大,或者以同样的方式让它们思考得更久。相反,我们可以更聪明地利用我们现有的计算能力。通过将重心从“生成更多答案”转向“对答案中最重要的部分进行针对性检查”,我们可以以更少的投入获得更好的结果。

作者也谨慎地指出,这并不是一个能瞬间解决一切问题的万能药。它在模型本身具备生成初始想法的能力、但需要帮助识别自身盲点时效果最好。然而,结果表明,这种“断言级证伪”是让 AI 推理变得更加可靠的一种强大的新途径,它将模型从一个自信的猜测者转变为一个严谨的批评家。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →