← 最新论文
💬 NLP

Can We Trust LLM's Logic? Quantifying Uncertainty, Coherence, and Robustness via a Graph-Based Framework

本文介绍了 GRAPHEVAL,这是一个通过一种新颖的图推理连贯性得分(GRCS)来量化推理不确定性的图基框架,并利用图自一致性(GSC)通过优先考虑逻辑有效性而非简单的答案一致性来提高推理保真度,从而揭示了标准解码策略的局限性并暴露了关键推理路径的鲁棒性。

原作者: Riccardo Revalor, Jalees Rehman, Debjit Pal

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Riccardo Revalor, Jalees Rehman, Debjit Pal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一场魔术表演,魔术师(一个人工智能)从帽子里变出了一只兔子。有时,这只兔子是真实的;有时,它只是一个看起来完全像兔子的纸板剪影,但如果你去戳它,它就会散架。长期以来,我们判断魔术师的标准仅仅是看最后出来的兔子。如果它看起来像只兔子,我们就鼓掌,并假设这个魔术完美地完成了。

但一篇名为 GRAPHEVAL 的新论文指出,用这种方式来评判魔术师是非常糟糕的。来自伊利诺伊大学芝加哥分校的研究团队认为,我们需要窥视帽子内部,看看这只兔子是如何被制造出来的。他们发现,有时人工智能得到了正确的答案(兔子),但使用的是一个完全破碎、虚假或幻觉出来的过程(纸板剪影)。而旧的检查方法——被称为“自一致性”(Self-Consistency)的方法——由于过于忙于计数出现了多少只兔子,以至于无法注意到其中有一半其实都是纸板做的。

问题:“幸运猜测”陷阱

该论文反对一种被称为自一致性 (SC) 的流行方法。把 SC 想象成让 20 个人去解决一道数学题。如果 12 个人说答案是“42”,8 个人说“43”,那么人群会选择“42”。旧理论认为:“如果大多数人达成共识,他们就是正确的。”

作者说:别高兴得太早。
他们发现,在较小的 AI 模型中,可能会发生“幸运猜测”。想象一下这样一个场景:一群人中,有 12 个人都在产生同样的幻觉,从而得到了正确的答案。他们可能会说:“答案是 42,因为我看到了一只蓝色的鸟!”(这简直是胡说八道),而另外 8 个聪明人则说:“答案是 42,因为 21 加 21 等于 42。” 人群最终选择了“42”,是因为那群“蓝鸟派”的支持,尽管其逻辑完全是垃圾。论文明确排除了“只要多数票代表正确,其推理过程就是可靠的”这一观点。

解决方案:“承重”路径

为了解决这个问题,该团队构建了一个名为 GRAPHEVAL 的新框架。他们不再仅仅观察最终答案,而是将 AI 思考的每一步都转化为一张地图(图谱)。他们在事实之间建立连接,以观察这条路径是一座坚固的桥梁,还是一根摇晃的绳索。

他们引入了一个新的评分指标,称为 GRCS(图推理连贯性得分)。

  • 类比: 想象你有 20 张由 20 位不同的探险家绘制的地图,他们都在寻找宝藏。
    • 如果 15 位探险家画的地图看起来完全不同,但最终都到达了同一个地点,那么他们可能都在瞎猜。
    • 如果 15 位探险家的地图看起来几乎一模一样,拥有相同的桥梁和隧道,那么这就是一条连贯的路径。
    • GRCS 衡量这些地图的“凝聚力”。如果地图杂乱无章且充满矛盾,得分就会上升,从而提醒我们:“嘿,这个 AI 正在感到困惑或者在撒谎!”

论文在五种不同类型的谜题(从简单的数学到复杂的医学问题)中测量了这一点,并测试了三种不同的 AI 模型(一个小模型、一个中型模型和一个非常聪明的模型)。他们发现,GRCS 是唯一能够持续识别 AI 在高置信度下进行“幻觉”(编造事实)的工具。事实上,在 15 个测试设置中,有 14 个设置显示,更高的 GRCS 得分意味着 AI 的推理能力更不可靠

“中心点”与对抗性攻击

团队还创建了一种挑选最佳答案的新方法,称为图自一致性 (GSC)。GSC 不仅仅是挑选最受欢迎的答案,它还会寻找**“中心点 (Medoid)”**。

  • 类比: 想象一群朋友在讨论去哪里吃饭。所谓的“中心点”不仅仅是投票数最多的餐厅,它是整个群体共识的“中心”。它是其他所有人都在向其靠拢的那个餐厅,即使他们还没有全部投出票来。它是最“核心”且得到最多支持的想法。

为了测试这个“中心点”路径是否真的重要,作者进行了一场“提示词投毒”游戏。他们拿走了 AI 最好的路径(即中心点),并告诉 AI:“严禁使用这条路径。你必须找到一种全新的方式来解决问题。”

  • 结果: 当他们对较小的 AI 模型这样做时,有趣的事情发生了。AI 通常仍然能得到正确的答案(兔子出现了),但其推理过程却崩溃了。论文表明,这证明了“中心点”是一个**“承重路径”**。它是支撑起逻辑的主要支柱。如果没有它,AI 只是在黑暗中跌跌撞撞,纯粹靠运气猜中了。
  • 数据: 对于较小的模型(Llama 3.1 8B),当移除中心点后,推理的忠实度显著下降。在某些情况下,例如医学考试题目 (MedQA),当被迫放弃其核心路径时,AI 的准确率下降了 9.0 个百分点,这揭示了它之前的“成功”其实是建立在不稳固的地基之上的。

那么大型、聪明的 AI 呢?

论文也观察了超级聪明的 AI(DeepSeek R1)。在这里,情况有所不同。聪明的 AI 非常灵活,它可以找到许多条通往正确答案的不同路径。当作者移除中心点时,聪明的 AI 并没有崩溃得那么厉害。这表明,虽然中心点对于较小的模型来说是一根“承重”梁,但大模型拥有更广泛、更多样化的“梁网”。然而,即便对于聪明的 AI,中心点路径依然持有最可靠的逻辑。

总结

这篇论文并不声称已经“解决了”AI 的信任问题。相反,它通过严格的测试建议证明了我们不能仅仅信任最终答案。

  • 他们排除了什么: 他们证明了简单的多数投票制(自一致性)经常会被“幸运猜测”所蒙蔽,即 AI 虽然得到了正确答案,但过程却是错的。
  • 他们发现了什么: 通过将推理过程映射为图谱并找到共识的“中心”(中心点),我们可以过滤掉虚假的逻辑。
  • 代价: 这种新方法比旧方法需要更多的计算资源。这就像是有一支检查小组去检查每一块砖头,而不是仅仅看一眼墙上的油漆。作者指出,对于最大的、最聪明的模型来说,“幸运猜测”的问题并不严重,但对于较小的、成本较低的模型,这种基于图谱的新检查对于避免被自信的胡言乱语所欺骗至关重要。

简而言之:如果一个 AI 给出了正确答案,不要只是鼓掌。请让它展示它的地图。如果地图看起来像是一团乱涂乱画,那么这个答案可能只是一个幸运的猜测,你不应该在重要事情上信任它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →