← 最新论文
💻 computer science

Calibration Is Not Enough: Evaluating Confidence Estimation Under Language Variations

本文介绍了一种用于语言模型置信度评估的新颖框架,该框架评估了鲁棒性、稳定性以及对语言变化的敏感性,并揭示现有方法尽管与正确性一致,却往往无法区分语义不同的答案。

原作者: Yuxi Xia, Dennis Ulmer, Terra Blevins, Yihong Liu, Hinrich Schütze, Benjamin Roth

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuxi Xia, Dennis Ulmer, Terra Blevins, Yihong Liu, Hinrich Schütze, Benjamin Roth

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在向一位非常聪明但有时过于自信的机器人助手提问。你问:“法国的首都是哪里?”它回答:“巴黎”,并给出了 99% 的置信度。这看起来很棒。但如果你换一种稍微不同的方式问同一个问题,比如“请告诉我法国的首都是哪里”,机器人还会给出"99%"吗?还是说它的置信度会突然降到"45%"?

本文旨在探讨:当与机器人交流的方式发生变化时,其“置信度计”是否真的可靠。作者认为,仅仅检查机器人是否“正确”(即校准性)是不够的。我们还需要检查其置信度在语言变化时是否保持稳定,以及它是否能在含义改变时意识到自己实际上错了。

以下是他们研究发现的简要说明,并辅以简单的类比:

问题所在:“摇晃的指南针”

作者指出,当前用于检测 AI 置信度的方法,就像只在船只完全静止时检查指南针。他们检查指南针在船只静止时是否指向北方。但在现实世界中,船只会摇晃(提示词发生变化),即使指南针指向北方,它也可能剧烈旋转。

他们发现,许多 AI 置信度检测器是校准良好的(平均而言是正确的),但不稳定(仅仅因为你提问方式不同,它们对同一答案给出的置信度分数就不同)。

三项新测试

为了解决这一问题,作者引入了三项针对这些置信度计的新测试:

  1. 鲁棒性(“相同答案,不同措辞”测试)

    • 类比:想象你问一位天气预报员:“会下雨吗?”他说“有 80% 的概率”。然后你问:“你觉得会下雨吗?”如果预报员仅仅因为你换了措辞就突然说“只有 20% 的概率”,那么他的计量器就是坏的。
    • 发现:大多数 AI 置信度方法通过了这项测试。它们能够很好地忽略你提问措辞上的细微变化。
  2. 稳定性(“相同含义,不同词语”测试)

    • 类比:想象机器人先回答“巴黎”,一秒钟后又回答“光之城”。两者含义相同。如果机器人对第一个回答说“置信度 99%",对第二个回答却说“置信度 10%",那就是不一致的表现。
    • 发现:大多数方法也通过了这项测试。即使措辞不同,只要答案含义相同,它们给出的分数就是一致的。
  3. 敏感性(“不同含义,不同分数”测试)

    • 类比:这是主要的失败之处。想象机器人回答“巴黎”(置信度 99%),然后回答“伦敦”(置信度 99%)。尽管一个是正确的,另一个是错误的,但两者都被赋予了同样的高置信度分数。机器人的置信度计变得麻木了。如果错误的回答看起来像正常的句子,它的置信度计就无法感知正确答案与错误答案之间的区别。
    • 发现:几乎所有方法都在这项测试中失败了。它们极不擅长察觉答案含义的变化。只要胡言乱语看起来像正常的句子,它们就会继续给出高置信度分数。

为什么会发生这种情况?

作者发现,那些只关注问题而忽略答案的方法最为“麻木”。

  • “盲目”方法:有些方法只看问题(就像一个学生只读考题,但在给自己答案打分前却不看自己的答案)。因为它们不看答案,所以无法判断答案是否正确。
  • “专注”方法:那些真正阅读生成答案的方法在察觉差异方面稍好一些,但仍然不够好。

“越大越好”的迷思

人们普遍认为,更大的 AI 模型总是更聪明、更可靠。作者对此进行了测试。

  • 发现:扩大模型规模(扩展)只带来了一点帮助,但并未解决“麻木”问题。一个巨大的模型在自信地给出错误答案方面,与小型模型一样可能。

核心结论

本文得出结论:我们不能为每项任务都挑选“最佳”的置信度检测器。这取决于你的需求:

  • 如果你需要一个在重新措辞问题时不会惊慌失措的系统,你需要鲁棒性
  • 如果你需要一个能从十个不同选项中选出最佳答案的系统(就像法官一样),你迫切需要敏感性(即区分正确答案与错误答案的能力)。

目前,大多数系统在前三项中表现优异,但在第三项上表现极差。作者警告说,如果我们不解决这种“麻木”问题,就将这些系统用于高风险决策(如医疗建议或法律判决),我们可能会同样信任一个自信的错误答案和一个正确的答案。

简而言之:AI 的置信度计擅长忽略你的拼写错误,但它在意识到自己胡言乱语方面表现极差。我们需要教会它倾听自己的答案,而不仅仅是问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →