Popular but Wrong: Understanding and Mitigating LLM Overconfidence through Knowledge Popularity
本文揭示了大型语言模型在错误答案具有高流行度或与查询高度共现时会表现出过度自信,并证明了引入知识流行度信号能有效缓解这种过度自信,同时显著提高置信度估计的准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在服务器集群静谧的嗡鸣声中,一种新型的智能已经出现,它能够创作诗歌、求解方程,并以一种近乎人类的流利程度回答问题。这些大型语言模型是在浩如烟海的文本上训练出来的,通过识别人类知识中的模式,学习预测句子中的下一个词。但问题在于:这些机器并不像我们那样真正“了解”事实。它们没有对世界的记忆,只有一种关于哪些词通常会出现在一起的统计学感知。当它们不确定时,往往不会承认。相反,它们经常以绝对的确定性产生错误的答案,研究人员将这种现象称为“过度自信”。对于任何依赖这些工具进行安全、医疗或金融领域工作的人来说,这是一个关键问题,因为一个自信的谎言比一个犹豫的真相要危险得多。科学家们核心的问题在于,为什么这些模型如此深信自己的错误。这是一种随机的故障,还是在它们学习的过程中存在某种隐藏的模式,导致它们对错误的事情深信不疑?
一个研究小组致力于通过研究“流行度”的概念来调查这个谜团。他们想知道,模型是否仅仅是在偏好那些在其训练数据中著名或频繁出现的答案,即使这些答案对于所提出的特定问题是错误的。为了测试这一点,他们专注于一种特定类型的任务:关于现实世界实体的客观事实问题,例如询问谁导演了某部特定的电影,或者某位篮球运动员出生在哪里。他们收集了数千个此类问题,并将正确答案与模型生成的错误答案进行了对比。他们通过计算互联网上有多少链接指向这些人或地点,以及他们在书面文档中共同出现的频率,来衡量涉及对象的“流行度”。这种方法使他们能够观察模型是否在向着最熟悉的名称而非正确答案靠拢。
研究人员发现,当这些模型犯错时,它们的错误绝非随机的。模型并不会猜测晦涩或不太可能的名称,而是倾向于幻觉出比正确事实更受欢迎的答案。例如,如果一个模型不知道一部知名度较低的电影的导演,它更有可能自信地命名一位它见过多次的著名导演,而不是一个随机的无名氏。此外,模型经常选择那些经常出现在问题所在句子中的答案,即使这种联系是不正确的。一个模型可能会通过命名制片人来回答关于电影导演的问题,仅仅因为这两个角色经常在文章中被共同提及。研究发现,这些流行但错误的替代选项不仅常见,而且是模型最信任的选项。即使答案是错误的,模型也会为流行的、听起来熟悉的响应分配比为较不著名的正确响应更高的置信水平。
这一模式在不同类型的提问和不同规模的模型中都成立,表明这些系统处理知识的方式存在根本性的缺陷。研究人员发现,一条信息在训练数据中被重复的次数越多,模型生成它的可能性就越大,其置信度也就越高,无论它是否是针对特定查询的正确答案。这创造了一个危险的反馈循环:最熟悉的错误答案被视为最可能的真相。研究强调,显著的领域知识差距与更强的流行度偏差生成相关,这意味着当模型对特定主题了解较少时,它们更有可能依赖于熟悉但错误的关联。研究结果揭示了流行度与过度自信之间存在强烈的系统性关联,尽管研究人员指出,这些是相关关系而非因果关系,这意味着它们展示了清晰的联系,但并未证明仅靠流行度就导致了过度自信的预测。
为了解决这个问题,研究人员开发了一种方法,帮助模型识别其置信度何时可能放错了地方。他们创建了一个系统,在接受模型的置信度评分之前,会先考察答案的流行度以及问题与答案之间的关系。通过将答案的流行度以及它与问题的出现频率纳入考量,该系统可以在模型对一个流行但可能错误的答案过于笃定时,将其置信度向下调整。当他们在六个不同的模型上测试这种方法时,结果令人瞩目。模型对其错误答案的平均置信度大幅下降,从高达 0.765 降至 0.254。与此同时,模型置信度的整体准确性显著提高,这意味着模型变得更擅长于识别自己何时是对的,何时是错的。
研究结论指出,流行度是人工智能过度自信的关键驱动因素。模型不仅仅是在猜测;它们是在沿着通往最熟悉名称和关联的最省力路径前进。通过理解这种偏差,可以构建更好的防护机制,防止这些系统在实际出错时表现得权威。研究人员指出,虽然他们的工作侧重于关于特定实体的客观事实问题,但这一原则很可能延伸到模型可能偏好常见模式而非特定事实的其他领域。他们还承认,他们的流行度衡量标准是基于公开的互联网数据,这作为模型在训练期间所见内容的代理指标,并且他们发现的关系是强相关而非已证实的因果关系。尽管如此,利用这些流行度信号来平息机器的过度自信,为使这些强大的工具在日常使用中更加可靠和值得信赖提供了一个切实可行的步骤。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。