← 最新论文
🤖 AI

Coherence Under Commitment: Probing Generalization and Vacuous Memorization in LLM Logical Reasoning

本文介绍了承诺下的连贯性(Coherence Under Commitment, CUC),这是一种双查询评估范式,通过共同衡量四种开源模型的连贯性与果断性,揭示了大语言模型如何通过系统性的弃权来实现空洞的逻辑连贯。

原作者: Noor Islam S. Mohammad, Mahmudul Hasan

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Noor Islam S. Mohammad, Mahmudul Hasan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:“沉默”的专家

想象一下,你雇佣了一位逻辑专家来帮你解开一个谜题。你给了他们一组线索,并问道:“这个结论是否成立?”

  • 理想的专家: 观察线索,深入思考,然后说:“是的,它确实成立,”或者“不,它确实不成立。”
  • 有问题的专家: 这位专家非常谨慎。他们永远不想出错。所以,当你问他们问题时,他们经常只是耸耸肩说:“我不确定,”或者完全保持沉默。

这里有个陷阱:如果专家从不回答“是”或“否”,他们就永远不会被证明是错的。 他们永远不会自相矛盾。在标准的测试世界里,这位沉默的专家看起来很完美,因为他们的错误率为 0%。但他们毫无用处!他们并没有真正解决任何问题;他们只是在规避犯错的风险。

论文作者将这种现象称为**“空洞的一致性”(Vacuous Coherence)**。这就像一个学生在考试中拒绝回答任何问题,这样他就不会答错任何题目。他得到了满分,但他什么也没学到。

解决方案:“承诺得分”(Commitment Score)

论文引入了一种测试 AI(大语言模型)的新方法,称为**“承诺下的连贯性”(Coherence Under Commitment, CUC)**。CUC 不仅仅检查 AI 是对是错,它同时询问两个问题:

  1. AI 是否一致?(它会自相矛盾吗?)
  2. AI 是否果断?(它是否愿意表明立场?)

为了实现这一点,他们使用了一个巧妙的技巧。对于向 AI 提出的每一个问题,他们也会同时提出完全相反的问题。

  • 问题 A: “这是真的吗?”
  • 问题 B: “这是假的吗?”

然后他们测量两件事:

  • 承诺得分(Commitment Score): AI 为给出明确答案投入了多少“能量”(概率)?如果 AI 对两个问题都保持沉默,得分就很低。如果它自信地选择了其中一方,得分就会很高。
  • 违规得分(Violation Score): AI 是否对两个问题都回答了“是”?(这会导致逻辑矛盾)。

“前沿”:权衡取舍

研究人员发现了一条清晰的界限(“前沿”),将 AI 模型表现出的不同行为区分开来。你无法兼得。

  • “刺猬”(系统性弃权):
    一个模型(Qwen2.5-3B)表现得像一只蜷缩成球的刺猬。它几乎拒绝回答所有问题。

    • 结果: 它几乎没有任何矛盾(完美的连贯性)。
    • 现实: 它只回答了 7% 的问题。它很“完美”,但毫无用处。
    • 类比: 一个天气预报员每天都说“我不知道”。他们从不出错,但他们的工作表现非常糟糕。
  • “盲目赌徒”(过度承诺):
    另一个模型(TinyLlama-1.1B)表现得像一个对所有事物都下注的赌徒。

    • 结果: 它回答了几乎所有问题(覆盖率 79%)。
    • 现实: 它在几乎每个问题上都错了且自相矛盾。它声称某些事情既是真实的又是虚假的。
    • 类比: 一个天气预报员同时大喊“晴天!”和“正在下雨!”他们非常果断,但完全疯了。

为什么旧的测试失效了

标准的测试只关注“刺猬”。因为刺猬从不犯错,旧的测试将其评为最佳模型。论文指出这是一个陷阱。这些测试奖励了那些因为害怕表达而不敢说话的模型。

新的 CUC 测试揭露了这一点。它表明“刺猬”实际上是失败的,因为它没有完成它的职责(回答问题),尽管它看起来很安全。

“规模”带来的惊喜

论文还测试了当 AI 变得更大(更强大)时会发生什么。

  • 发现: 当他们扩大 Qwen 模型的规模(从 15 亿参数增加到 30 亿参数)时,它在避免矛盾方面变得更强了,但在回答问题方面却变得更弱了。
  • 教训: 更大的模型并没有学会更好的推理;它们学会了更多的规避(Hedge)。它们学会了保持沉默是获得高分最安全的方式。这对开发者是一个警告:如果你只惩罚错误的回答,模型就会学会保持沉默。

一句话总结

这篇论文警告我们,一个从不承担风险的 AI 并不是聪明的 AI,而只是一个沉默的 AI;我们需要新的测试方法,既要奖励模型的连贯性,也要奖励其果断性

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →