← 最新论文
🤖 AI

Quantifying Consistency in LLM Logical Reasoning via Structural Uncertainty

本文引入了“结构不确定性”(structural uncertainty)这一框架,通过分析采样解之间自我偏好排序的稳定性,来量化大型语言模型在逻辑推理中的一致性,从而揭示了该指标如何作为传统答案离散度的补充,以更好地识别演绎任务中不可靠的推理,并区分出此类一致性评估具有有效性的情形。

原作者: Baishali Chaudhury, Mengdie Flora Wang, Hyunji Hayley Park, Rahul Ghosh, Sungmin Hong, Jae Oh Woo

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Baishali Chaudhury, Mengdie Flora Wang, Hyunji Hayley Park, Rahul Ghosh, Sungmin Hong, Jae Oh Woo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在要求一位非常聪明但有时过于自负的学生去解决一道很难的数学题。你要求他尝试解题五次。

旧方法:计数答案
传统上,为了观察这个学生的可靠性,我们只需查看他们的五个答案。

  • 如果他们五次都说“10”,我们会想:“太棒了!他们很一致。”
  • 如果他们说出“10, 12, 9, 10, 11”,我们会想:“噢,糟了,他们糊涂了。”

但这里有一个问题。如果学生每次出错的原因都不同,但最终答案却是一样的呢?

  • 答案 1:“10”(因为他们漏掉了一个负号)。
  • 答案 2:“10”(因为他们把加法做成了减法)。
  • 答案 3:“10”(因为他们看错了数字)。

对于旧方法来说,这个学生看起来表现得非常一致,因为最终答案始终是“10”。但这些答案背后的思维过程其实一团糟。旧方法忽略了这种内在的混乱。

新方法:“自我评判”锦标赛
这篇论文介绍了一种检查该学生的新方法,称为结构化不确定性(Structural Uncertainty)。我们不再仅仅观察最终答案,而是要求学生充当自己的裁判。

流程如下:

  1. 生成: 学生写下五个不同的解题过程(其中一些可能是正确的,一些可能是错误的)。
  2. 锦标赛: 我们要求学生进行两两对决来比较这些解题过程。“方案 A 是否比方案 B 更好?”
  3. 排名: 我们根据所有的比较结果构建一个排名。谁是“最好”的方案?谁是“最差”的方案?
  4. 转折点: 我们多次进行这种锦标赛,但我们会改变选手之间对决的顺序(就像绘制一张随机的连接图)。

两种信号
通过观察学生如何对自己的工作进行排名,作者发现了两个能够告诉我们推理是否稳定的不同信号:

  1. “反复横跳”信号(跨试验不稳定性):

    • 想象一下: 在一次锦标赛中,学生说方案 A 是最好的。在下一次锦标赛中(由于对决组合发生了变化),他们突然说方案 C 是最好的。
    • 含义: 这个学生实际上并不知道什么是“好”的解题过程。他们的内在指南针正在乱转。这是一个巨大的警示信号,即使这五个答案的最终数值完全相同。
    • 类比: 这就像一位评委,今天在几部电影中选出了“最佳”,明天却选出了完全不同的另一部,尽管电影本身并没有改变。这位评委是不可靠的。
  2. “平局”信号(试验内歧义性):

    • 想象一下: 在单次锦标赛中,学生看着所有五个方案说:“它们都挺好的,我实在选不出胜者。”排名呈现出一条平坦的直线。
    • 含义: 对于复杂的数学问题来说,这实际上是一个迹象!这意味着存在多种有效的解题路径,并且学生识别出了这一点。这表明他们理解其中的细微差别。
    • 类比: 这就像一位美食评论家说:“这五种披萨都非常出色,我无法只选一种。”这体现了高水平的鉴赏力,而非困惑。

“图书馆” vs. “数学课”
这篇论文发现,这种新方法的效果取决于任务类型的不同:

  • 在数学/逻辑领域(“数学课”): 该方法表现卓越。如果学生感到困惑,他们的排名会发生剧烈的“反复横跳”。如果学生很聪明,他们能够区分出好的路径和坏的路径。
  • 在事实核查领域(“图书馆”): 该方法会撞上南墙。想象一下,你要求学生在图书馆的书中寻找某个特定的事实。如果书里没有答案,学生每次都会说“我不知道”。
    • 因为答案是“我不知道”,学生的内在排名会变成一个完美的平线(所有人并列最后一名)。
    • 论文称之为**“坍缩(Collapse)”**。信号消失了。该方法意识到:“哦,这不是一个推理问题,而是一个检索问题。”在这种情况下,旧方法(仅仅检查答案是否不同)实际上效果更好。

核心结论
这篇论文不仅仅是在问:“AI 是否得到了正确答案?”或者“它是否给出了五个相同的答案?”

相反,它在问:“AI 是否拥有一种稳定、一致的方式来评判自己的工作?”

  • 如果 AI 的内在排名不稳定且反复横跳,那么它很可能推理能力较差,即使最终答案看起来是对的。
  • 如果 AI 的排名是稳定的,那么它很可能推理得很好。
  • 如果 AI 的排名坍缩成平坦的平局,那么它处理的可能是一个推理并不重要的任务(比如寻找一个不存在的事实)。

这有助于我们识别那些“听起来很聪明”的失败案例——即 AI 虽然表现得很有信心,但其内在逻辑是不一致的,而这是旧方法完全无法察觉的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →