← 最新论文
📊 statistics

Discovery of Hidden Miscalibration Regimes

本文提出了一种诊断框架,通过学习输入空间的校准感知表示,发现大型语言模型中隐藏的、依赖于输入的校准失调模式,从而实现比传统全局方法更有效的局部置信度校正。

原作者: Katarzyna Kobalczyk, Mihaela van der Schaar

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Katarzyna Kobalczyk, Mihaela van der Schaar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常自信的天气预报员。当他们说“有 70% 的概率会下雨”时,通常 70% 的情况下是正确的。在人工智能领域,这被称为校准(calibrated)。如果一个人工智能表示它有 90% 的把握,那么它应该在 90% 的情况下是正确的。

通常,我们通过将置信度分数视为一个单一列表来检查人工智能是否经过校准。我们将所有"70%"的预测归为一组,看看它们是否在 70% 的情况下是正确的。

问题:“平均”陷阱
本文的作者认为,这种“平均”视角就像在看一张模糊的照片。它可能会掩盖严重的问题。

想象一位天气预报员,在预测沿海城市过度自信(认为会下雨,但实际上不会),而在预测山区城镇信心不足(认为不会下雨,但实际上会)。

  • 如果你将"70% 置信度”组作为一个整体来看,沿海地区的错误和山区的错误可能会相互抵消。
  • 全球报告会显示:“嘿,这位预报员完全经过校准!”
  • 但事实上,他们在特定地点的表现非常糟糕。“平均”掩盖了这样一个事实:他们对特定类型的输入是不可靠的。

这就是本文所称的隐藏校准失调机制(Hidden Miscalibration Regimes)。人工智能并非总体上“坏”或“好”;它在特定方面存在系统性的错误,而这些错误是标准工具无法察觉的。

解决方案:学习一张新地图
作者提出了一种新方法,可以在无需预先知道什么是“沿海”或“山区”输入的情况下,发现这些隐藏的角落。

将人工智能的输入(如文本问题)想象成巨大且混乱地图上的点。

  1. 旧方法:我们仅根据人工智能的置信度来观察这些点(就像按身高对人进行排序)。
  2. 新方法:作者教导人工智能学习一张新地图(一种“表示”)。在这张新地图上,他们重新排列这些点,使行为相似的输入彼此靠近。

这就像面对一个堆满各种玩具的杂乱房间,学习不再按颜色分类,而是按它们如何损坏来分类。突然间,所有倾向于折断的玩具都集中在一个角落,而所有倾向于卡住的玩具都集中在另一个角落。

一旦人工智能拥有了这张新地图,他们就会使用一种称为平滑(smoothing)的简单技巧。他们观察新地图上的一个小邻域,并问道:“这个邻域里的玩具主要是倾向于折断,还是主要倾向于卡住?”

  • 如果邻域充满了“过度自信”的错误,地图就会亮起红色。
  • 如果充满了“信心不足”的错误,它就会亮起蓝色。

这就创建了一个校准失调场(Miscalibration Field)——一张热力图,精确显示人工智能在哪里对自己撒谎,即使我们不知道问题的具体主题。

他们的发现
他们在 12 种不同的大语言模型(LLMs)上测试了这种方法,涵盖了四个不同的现实世界任务(如医疗问题、常识和判断帮助性)。

  • 发现:他们发现,几乎所有这些模型都存在过度自信和信心不足的隐藏角落。标准的“全局”检查往往完全忽略了这些,因为错误相互抵消了。
  • 证明:当他们仅查看发现的“过度自信”角落时,错误率远高于全局平均值所暗示的水平。
  • 修复:因为他们知道人工智能在哪里撒谎,所以他们可以局部修复。与其试图一次性修复整个模型,他们只调整那些特定“红色”和“蓝色”区域的置信度分数。这比仅基于置信度分数尝试修复整个模型的标准方法效果更好。

要点
本文表明,人工智能的可靠性不仅仅是一个单一的数字或一条简单的曲线。它是一个复杂的景观,隐藏着错误的山谷。通过学习一种新的数据组织方式,我们可以找到这些隐藏的山谷,并在需要的地方具体修复人工智能的置信度,而不是基于模糊的平均值进行猜测。

重要说明:本文侧重于发现这些错误,并针对二元选择(是/否,正确/错误)修复置信度分数。它并不声称能修复人工智能的实际推理能力,或使其在临床应用中更安全;它只是提供了一种更好的诊断工具,以查看人工智能目前在哪些地方不可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →