Asking Is Not Enough: Protocol Sensitivity in LLM Confidence Calibration
本文表明,大语言模型的置信度校准对测量协议高度敏感——具体包括条件上下文、词元概率读取和答案选择——揭示出语言化置信度往往反映的是答案的合理性而非正确性,并呼吁采用标准化报告清单以实现可靠的评估。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图弄清楚一个大语言模型(LLM)对其答案的把握程度有多大。你有两种提问方式:
- “耳语”:你让模型大声说出一个数字,比如“我有 85% 的把握”。(这被称为语言化置信度)。
- “内心独白”:你查看模型“大脑”内部的数学计算,看看它认为每个词出现的概率有多大。(这就是词元概率)。
长期以来,研究人员认为这两种方法就像从两个略微不同的角度观察同一个物体。他们假设,如果你将它们进行比较,就能得到一幅关于模型“自我认知”的稳定、可靠的图景。
但本文指出:停下。这幅图景完全取决于你“如何”手持相机。
作者认为,比较这两种信号,与其说是拍摄一座山的照片,不如说是站在蹦床上试图测量一栋楼的高度。结果完全取决于你站在哪里、站在什么上面,以及你使用哪把尺子。
以下是他们研究发现的分解,使用了简单的类比:
1. “你站在哪里”的问题(条件语境)
这是最大的惊喜。想象你问一名学生:“你有多确定巴黎是法国的首都?”
- 场景 A:你在他只是坐在书桌前时问这个问题。
- 场景 B:你在他已经写了一篇关于巴黎的长文章之后问这个问题。
研究发现,如果你在模型开始说话之前测量其内部数学计算(词元概率),与在模型被提示给出置信度分数之后进行测量,结果会截然相反。
- 在一种设置下,模型似乎校准得完美无缺(其口头表达的置信度与其内部数学计算相匹配)。
- 在另一种设置下,模型看起来极度过度自信或极度缺乏自信。
结论:“语境”(模型刚刚阅读的内容或被要求执行的任务)会极大地改变数学计算,以至于可以逆转结论。这就像测量影子:影子的长度完全取决于太阳的位置,而不仅仅取决于物体本身。
2. “我们在谈论哪个答案”的问题(答案来源)
有时模型自己生成答案,有时你给它一个答案并问:“你有多确定这是对的?”
- 自生成:模型自己想出答案。
- 外部提供:你给模型一个正确答案,并要求它给出置信度分数。
研究发现,当你给模型一个看似合理但错误的答案(听起来很聪明但事实错误)时,模型给出的置信度分数几乎与正确答案一样高。
- 类比:想象一位天气预报员。如果你给他们看一张看起来非常逼真的假天气图,他们可能会说:“我有 90% 的把握这是准确的”,尽管它是错的。他们评判的是故事听起来有多合理,而不是它是否真实。
3. “使用哪把尺子”的问题(词元读取)
在计算内部数学时,你是查看答案第一个词的概率,还是整个句子的平均概率?
- 研究发现,改变这个微小的细节(就像从英寸尺换成厘米尺),足以在许多情况下改变结果,甚至翻转结论的符号。这是一个微小的技术调整,但它非常重要。
4. “使用哪个计算器”的问题(估计量选择)
研究人员使用不同的数学公式(估计量)来计算“校准误差”。
- 好消息:改变计算器(公式)并没有显著改变结果。
- 坏消息:改变你“站的位置”(语境)或你“测量什么”(答案来源)会极大地改变结果。
主要结论
本文得出结论,无论是口头表达的置信度(“我有 90% 的把握”)还是内部数学计算,都不是关于模型心智的直接、不可改变的真理。
相反,它们是行为测量。它们就像一个人对特定情境下特定问题的反应。如果你改变情境(提示、语境、答案来源),反应就会改变。
“检查清单”比喻:
作者建议,如果你想报告 AI 的置信度,你不能只说“我们的模型校准度为 90%"。这就像说“这栋楼高 100 英尺”,却不说明你是从地下室还是从屋顶测量的。
你必须报告**“协议”**:
- 谁写了答案?(是模型自己写的,还是你给它的?)
- 你站在哪里?(你是在模型开始说话之前还是之后测量数学计算的?)
- 你如何读取数学计算?(你是看了第一个词还是整个句子?)
总结:
不要相信任何声称能显示 AI 有多“确定”的单一数字。那个数字是脆弱的。它完全取决于你所玩游戏的特定规则。如果你改变规则,分数就会改变。因此,我们需要非常谨慎地测量和报告这些数字,特别是如果我们希望将它们用于重要决策时。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。