← 最新论文
📊 statistics

Reliable Chain-of-Thought via Prefix Consistency

本文介绍了“前缀一致性”,这是一种在推理时评估可靠性的信号,它通过对候选答案在截断并重新生成后的可复现性进行加权,从而提升思维链推理的效率,在无需访问对数概率或自评分提示的情况下,以更少的生成 token 数量实现了与标准多数投票相当的准确率。

原作者: Naoto Iwase, Yuki Ichihara, Mohammad Atif Quamar, Junpei Komiyama

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Naoto Iwase, Yuki Ichihara, Mohammad Atif Quamar, Junpei Komiyama

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在请一位才华横溢但有时思维散漫的学生解答一道难题。你要求他们“逐步思考”(一种称为思维链的技术)。他们写下长篇解释并给出答案。

有时他们答对了,有时答错了。

为了提高成功率,你让学生将同一道题解答 100 次。然后你查看所有 100 个答案,选出出现频率最高的那个。这被称为多数投票。它效果不错,但代价高昂:让学生写出 100 份完整解释需要耗费大量时间和能量(token)。

这篇论文的作者发现了一个巧妙的捷径,能让这个过程更快、更智能。他们称之为前缀一致性

核心思想:“故事中段”测试

这里有一个类比:想象学生正在向你讲述一个故事来解释他们的答案。

  1. 标准方法:你听 100 遍完整的故事。如果学生在 51 个故事中说“答案是 42",在 49 个故事中说“答案是 17",你就选 42。
  2. 新方法(前缀一致性):你听学生讲故事,但在讲到一半时打断他们。你说:“好的,你已经解释了背景和最初几步。现在,替我把故事讲完。”你针对那个相同的中断点重复这样做 5 次。

神奇的观察:
论文发现了一个有趣的模式:

  • 如果学生一开始思路正确:当你要求他们从中断点继续完成故事时,他们几乎总是以与开头相同的正确答案结束。他们的路径是稳定的。
  • 如果学生一开始思路错误:当你要求他们从中断点继续完成故事时,他们往往会陷入混乱。他们可能以另一个错误答案结束,甚至以第三个错误答案结束。他们的路径是摇摆不定且不稳定的。

新方法如何运作

这种方法不再仅仅统计最终答案,而是根据答案的“稳定性”对其进行加权。

  1. 生成:模型生成几个初始答案(例如 10 个)。
  2. 截断:对于每个答案,系统将解释内容截断一半。
  3. 重新生成:它要求模型从该截断点开始,多次完成解释。
  4. 检查一致性
    • 如果模型在被截断后仍 consistently 回到同一个答案,该答案获得高权重(它是一个“可靠”的轨迹)。
    • 如果模型改变主意,或在被截断后给出不同的错误答案,该答案获得低权重
  5. 投票:最终答案根据这些加权投票选出。

为何这意义重大

论文提出了三点主要主张,并引用了一些令人印象深刻的数字:

  1. 它是更出色的侦探:在试图从 100 个答案中找出真正正确的那个时,这种“稳定性测试”比之前的方法更能精准识别正确答案。之前的方法试图通过询问模型“你确定吗?”或查看内部数学得分来猜测置信度,但这些方法在难题上往往失效。而新方法只需观察模型是否能一致地完成它自己开启的故事。
  2. 它节省巨额成本(Token):由于模型能更早地识别出正确答案,你就不需要让它写出 100 份完整解释。你可以用多达 21 倍更少的 token(生成的单词/字符)达到相同的准确率水平。
    • 类比:这就像你意识到不需要阅读 100 份完整书稿来找出最好的一本。你只需阅读 10 份草稿的前半部分,看看哪一份行文连贯一致,就可以跳过其余部分。
  3. 它无需“秘密”信息:许多之前的方法需要访问模型的内部“置信度得分”(对数概率),而这些信息通常是隐藏的或难以获取的。新方法只需要模型生成的文本,使其更容易应用于不同类型的 AI 模型。

总结

这篇论文提出了一种让 AI 推理更可靠、更经济的方法。通过检查 AI 是否能一致地完成它自己开启的思路,我们可以更信任其答案,并停止在那些可能失败的答案上浪费资源。它将 AI 自身“坚守其故事”的能力转化为真理的信号。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →