← 最新论文
🤖 AI

Measuring Black-Box Confidence via Reasoning Trajectories: Geometry, Coverage, and Verbalization

本文提出了一种新颖的黑盒置信度估计方法,该方法嵌入思维链推理轨迹以测量向答案锚点的几何收敛,并证明将这种基于轨迹的得分与覆盖率和语言化通道相融合,能够在无需访问模型内部状态的情况下,在多样化的基准测试和大语言模型上显著超越传统的自一致性基线。

原作者: Marc Boubnovski Martell, Josefa Lia Stoisser, Kaspar Märtens, Jialin Yu, Robert Kitchen, Philip Torr, Jesper Ferkinghoff-Borg

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Marc Boubnovski Martell, Josefa Lia Stoisser, Kaspar Märtens, Jialin Yu, Robert Kitchen, Philip Torr, Jesper Ferkinghoff-Borg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在聘请一位才华横溢却神秘莫测的顾问来解决一道难题。你只能看到他们的书面笔记(即“思维链”),却无法窥见他们的大脑波、置信度评分或正在处理的原始数据。你需要知道的是:我们能否信任他们的答案?

通常,为了检查这位顾问是否自信,你会让他们把同一道谜题解 10 次,看看他们是否每次都给出相同的答案。这种方法被称为“自一致性”。它确实有效,但代价高昂(你需要为 10 个答案付费),而且略显笨拙——这就像在问“你 10 次都得到相同的结果了吗?”,而不是去观察他们如何得出这个结果。

本文介绍了一种新的、更廉价且更聪明的方法,通过观察顾问笔记的几何特征(形状与路径)来衡量其置信度。

以下是他们发现的拆解,使用了简单的类比:

1. “行走路径”类比(几何特征)

想象顾问的推理过程就像一个人穿过迷雾森林,走向一个特定的目的地(正确答案)。

  • 旧方法: 你只是等到他们到达终点,然后问:“你确定吗?”
  • 新方法: 你观察他们的路径。在他们行走的过程中,即使在他们大声说出目的地名称之前,他们是否开始越来越靠近正确的目的地?

研究人员发现,如果你在他们写下最终答案之前(即“倒数第二步”)查看顾问的笔记,他们的文字在数学空间中会自然地聚集在正确答案附近。这就像看到行人的脚印在最终指向那棵树之前,越来越紧密地围绕在那棵正确的树周围。这种“几何收敛”是一个强烈的信号,表明他们既自信又正确,即使你无法窥见他们的大脑内部。

2. 三部分置信度检查

该论文认为,不能仅依赖单一信号。他们将置信度分解为三个不同的通道,就像在长途旅行前检查汽车一样:

  • 覆盖度(地图检查): 顾问是否查看了正确的地图?他们是否将正确答案视为一种可能性?如果他们从未想过正确答案,那么无论多么自信都毫无意义。这是一种“可达性”检查。
  • 几何特征(路径检查): 一旦他们查看了正确的地图,他们是否正稳步走向正确的位置?这就是上述的“路径”信号。它衡量他们的推理在锁定某个特定选项时有多么紧密。
  • 言语表达(自我报告): 最后,你问顾问:“在 0 到 100 的尺度上,你有多确定?”
    • 令人惊讶的发现: 最后这一部分单独来看是最不可靠的。有时顾问声称自己 100% 确定,但实际上他们只是在原地打转。只有当其他两项检查表现良好时,这一项才有帮助。

3. “倒数第二步”的秘密

最酷的发现之一是何时进行观察。

  • 如果你看的是他们说出答案的那最后一句话,信号会变得混乱。这就像行人在停下并大喊“我到了!”时,实际上却站在一棵错误的树旁。
  • 研究人员发现,最佳时机是最终答案之前的那句话。这是顾问的内在逻辑最坚定地指向真相的时刻,在他们被写下最终单词这一行为分散注意力之前。

4. 结果:更聪明、更廉价

通过结合这三个信号(地图、路径和自我报告),研究人员创建了一个系统,该系统:

  • 成本更低: 它只需要 4 次尝试,就能获得比旧方法 8 次尝试更好的置信度评分。
  • 效果更好: 它在医学和科学考试中能更准确地预测正确答案(更高的"AUC"分数)。
  • 鲁棒性强: 即使你使用不同的 AI 模型或不同的方式来衡量词语之间的“距离”,它依然有效。

核心结论

你不需要成为读心术者就能知道 AI 是否自信。你只需要观察它如何思考。如果它的推理路径在它开口说话之前自然地围绕正确答案收紧,并且它从一开始就考虑了正确答案,那么你可以比仅仅让它重复答案十次更信任它。

重要局限性: 论文指出,如果 AI 从一开始就从未想过正确答案,那么无论进行多少“路径观察”都无法弥补这一点。该系统只能告诉你 AI 对其实际考虑的选项有多自信。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →