Evaluating and Calibrating LLM Confidence on Questions with Multiple Correct Answers
本文指出,现有的置信度校准方法在面对具有多个正确答案的问题时,由于系统性低估,会导致大语言模型的校准失效,并据此提出了一个新的基准测试(MACE)和一种语义置信度聚合(SCA)方法,以实现在单答案和多答案场景下的鲁棒校准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是该论文的通俗化解释,采用了日常生活的类比。
核心问题:当“正确”看起来像“困惑”时
想象你正在参加一场知识问答竞赛。
- 场景 A: 问题是“谁写了《哈姆雷特》?”只有一个唯一的标准答案:莎士比亚。如果你说“莎士比亚”,你是正确的,并且你会感到非常有信心。
- 场景 B: 问题是“请说出一种红色的水果。”这里有许多个正确答案:苹果、草莓、樱桃、树莓。
论文指出,目前的语言大模型(LLMs)在面对场景 B 时会感到困惑。
当模型知道存在多个正确答案(比如苹果、草莓和樱桃)时,它往往会“分散投票”。它可能会在 20 次尝试中,6 次说“苹果”,6 次说“草莓”,6 次说“樱桃”。因为它并没有在每一次都只选择同一个答案,模型的内部“信心计”就会下降。它会想:“噢不,我不确定该选哪一个,所以我一定是不确定的。”
讽刺之处在于: 在场景 B 中,模型实际上更有可能答对(因为正确答案更多),但它的信心值却显示得更低。这就像一个人知道三种不同的路线可以到达商店,但因为无法决定只走哪一条路,便说服了自己其实已经迷路了。
新工具:MACE(“多答案”测试)
为了证明这个问题确实存在,研究人员构建了一个名为 MACE 的新测试。你可以把 MACE 看作是一个专门用于测试模型如何处理具有多个正确答案问题的“专项健身房”。
- 设置: 他们创建了涵盖六个主题(如奖项、政治职位和河流)的 12,000 个问题。
- 变化: 对于每个主题,他们设计了分别具有恰好 1、2、4 或 6 个正确答案的问题。
- 目标: 观察模型的置信度得分在正确答案数量发生变化时,是否能保持准确。
他们的发现:“大模型”悖论
他们测试了 15 种衡量置信度的方法,涵盖了四类不同规模的 AI 模型(从小型到超大规模)。结果如下:
- 准确率上升,信心下降: 随着正确答案数量的增加(从 1 个增加到 6 个),模型答对问题的频率反而更高了。然而,它们估算的置信度却显著下降了。
- 模型越大,受害越深: 那些最强大、最聪明的模型(如 700 亿参数的模型)表现得最为困惑。因为它们掌握的知识更广博,所以能生成更多样化的正确答案。这种多样性让它们在置信度检测器面前看起来像是“优柔寡断”,导致它们的置信度得分大幅跳水。
- “信任危机”: 在现实世界的混合问题中(既有 1 个答案的问题,也有 6 个答案的问题),现有的最佳方法都失效了。它们会将一个正确的答案标记为“不可靠”,仅仅是因为模型提供了几种不同的正确变体。
解决方案:SCA(“团队投票”法)
研究人员提出了一种名为 语义置信度聚合(SCA) 的新方法。
旧方法(“一枝独秀”法):
大多数方法只看模型给出的最受欢迎的那一个答案。如果模型给出了 20 个答案,其中 10 个是“苹果”,10 个是“草莓”,旧方法会判定:“你们只有 50% 的时间达成了一致。因此,你们并不自信。”
新方法(SCA —— “团队投票”法):
SCA 查看所有正确答案的总概率。
- 它按含义对答案进行分组(例如,所有的“苹果”答案属于一组,“草莓”属于另一组)。
- 它将所有正确组的置信度分数相加。
- 结果: 即使模型在“苹果”和“草莓”之间分散了投票,SCA 也能看到“红色水果”的总票数是 100%。它意识到:“啊,模型很自信,它只是拥有几个有效的选项而已。”
总结
- 问题所在: 现有的 AI 置信度工具认为,拥有多个正确答案意味着 AI 不确定。
- 解决方法: 新的 SCA 方法通过汇总所有有效答案的置信度来修复这一问题,而不仅仅是看最受欢迎的那一个。
- 结果: SCA 在处理具有多个答案的问题时表现出色,且不会破坏仅有一个答案的问题。它能让 AI 在真正自信时表现得更有信心,即使它有多种正确的表达方式。
简而言之,这篇论文告诉我们:对于 AI 来说,以多种方式答对并不应该被误判为不确定。我们只需要一种更好的计数方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。