Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification
本文揭示了大语言模型中言语化置信度估计的极端稀疏性会根据插值方法严重扭曲如 AUARC 等评估指标,并提出了一种无需成本的“言语化对数概率(verbalization logprobs)”方法,该方法缓解了这种稀疏性,从而实现了更优且更公平的性能排名。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一群超级聪明、爱说话的机器人来将堆积如山的邮件分类为“好”和“坏”两堆。你不仅希望它们能进行分类,还希望它们能告诉你对每一封信有多大的把握。如果一个机器人的确定度只有 50%,你可能想把这封信单独拿出来,交给人类进行复核。这就是**大语言模型(LLM)**作为分类器时的世界。这些 AI 系统就像是才华横溢但有时过于自信的学生;它们能写文章、解谜题,但当被要求进行分类时,它们需要能够说出:“我挺有把握的,”或者“我是在瞎猜。”
核心问题在于科学家们正在追问:我们如何知道这些机器人是否真的在对其信心程度负责? 如果一个机器人说:“我有 95% 的把握,”这是一种真实的、经过计算的感觉,还是仅仅是一个幸运的猜测?为了测试这一点,研究人员使用了一个特殊的计分板,叫做准确率-拒绝曲线(Accuracy-Rejection Curve)。想象一个滑动刻度:随着你要求机器人变得更加严格(只接受它声称有 99% 把握度的情况),被接受的信件数量会变少,但留在堆里的信件几乎总是正确的。目标是找到那个“甜点”——既能保留尽可能多的信件,又能保持极高的准确率。问题在于,如果机器人的回答是成簇且重复的,测量这个计分板就会变得非常棘手。
机器人的“95% 习惯”
在这篇论文中,Elena Merdjanovska 及其团队发现了一个关于 AI 机器人如何表达其信心的奇怪癖好。当你要求一个机器人大声说出一个数字(比如“我有 95% 的信心”)时,它并不会像人类掷骰子那样随机选择数字。相反,它会陷入一种惯性思维。
把它想象成一个正在参加选择题考试的学生,他并没有思考,而是因为觉得“95”是一个稳妥的整数,就在每一张答题卡上都写下了“95”。研究人员发现,一个流行的 AI 模型(Qwen3-32B)仅使用了八个独特的数字(0.6, 0.65, 0.7, 0.75, 0.85, 0.9, 0.95, 和 0.98)来描述其在数千个问题中的信心。更疯狂的是,超过一半的时间里,它直接说了 95%。
这是一个问题,因为这就像是在调收音机,但旋钮只能点击到八个特定的位置。如果你想过滤掉“坏”信件以达到 98% 的准确率,你可能不得不扔掉 40% 的邮件。但如果机器人能给出更精确的数字,比如 96.3%,你可能只需要扔掉 28% 的邮件。由于机器人的回答如此“稀疏”(困在这么少的数字里),它浪费了大量的有效数据。
“平滑曲线”的陷阱
故事在这里变得扑朔迷离。研究人员发现,科学家衡量机器人表现的方式实际上在欺骗他们。
为了计算计分板(称为 AUARC),研究人员通常会在图表上的点之间画一条线。大多数人使用线性插值(linear interpolation),即在点之间画一条平滑的直线,假设机器人的信心是逐渐变化的。但如果机器人只有八个数字,那么点与点之间就会存在巨大的间隙!在这些间隙中画一条平滑的线,就像是用一把直尺去连接连绵起伏的山脉中的点——它创造了一个并不存在的、虚假的平滑小丘。
作者指出,使用这种“平滑线”方法会让机器人看起来比实际表现得更好。事实上,当他们切换到正确的方法——阶梯式插值(stepwise interpolation),即在下一个实际数字出现之前保持一条水平线——时,排名发生了彻底的反转。一个在使用平滑线时看起来像是“冠军”的方法,在改用阶梯式线后跌到了最后一名。事实证明,平滑线只是一种视觉错觉,让那些稀疏的机器人看起来比实际更具灵活性。
“Logprobs”魔法技巧
那么,我们该如何修复一个只会说八个数字的机器人呢?团队提出了一个聪明的黑客手段,叫做言语化概率(Verbalization Logprobs)。
通常,当机器人说“95%”时,它只是输出了“9”和“5”这两个字符。使用这种方式的标准做法只是直接取数字 95。但机器人实际上知道更多:它知道自己选择“9”而不是“8”的可能性有多大,以及选择“5”而不是“6”的可能性有多大。这些隐藏的概率被称为 logprobs。
作者的新方法不仅仅是向机器人索要数字,更是询问数字背后的“感觉”。他们不再仅仅取“95”,而是根据机器人对每个数字的确定程度进行加权平均。这把机器人那种成簇的、只有八个数字的回答,转化为了一个平滑且连续的信心流。
结果令人印象深刻。通过使用这个技巧,机器人的信心得分变得更加详细(从仅仅 8 个唯一值跃升到了 600 多个唯一值!)。这并没有消耗额外的计算能力或时间;它只是利用了机器人已经拥有的信息。通过这种新方法,机器人可以更好地找到那个“甜点”,使其性能得分比旧方法提高了 2.3 点。这就像是给了机器人一个高分辨率的旋钮,而不是一个破损的、只能咔哒作响的旋钮,从而让它能以更少的浪费来处理邮件。
总结
论文的结论是,我们需要停止假装这些机器人是圆滑流畅的,因为它们实际上是非常僵硬的。如果我们继续使用“平滑线”方法来评判它们,我们就会获得一种虚假的安全感。通过转向使用“阶梯式”测量方法,并使用“logprobs”技巧来获取更详细的答案,我们终于可以信任这些 AI 分类器,让它们告诉我们何时是真的有信心,何时只是在瞎猜。这只是改变了我们倾听的方式,但对于我们如何更好地使用这些数字助手来说,这意义重大。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。