Double-Calibration: Towards Reliable LLMs via Calibrating Knowledge and Reasoning Confidence
本文介绍了 DoublyCal,这是一个通过利用轻量级代理模型生成具有校准置信度的知识图谱证据,从而提升黑盒大语言模型准确性与可靠性的框架,进而使大语言模型能够生成可追溯至支持证据不确定性的校准预测。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在向一位非常聪明但有时过于自信的图书管理员(即大型语言模型,LLM)提出一个棘手的问题。这位图书管理员擅长交谈,但他们经常凭空捏造(产生幻觉),或者即使错了也表现得过于笃定。
为了解决这个问题,人们开始给图书管理员提供一本参考书(知识图谱)来核实事实。但出现了一个新问题:如果参考书本身有缺页或条目混乱怎么办? 图书管理员可能会读到半截句子,然后自信地宣称:“我知道答案!”而实际上他们并不知道。
论文《双重校准》(Double-Calibration)引入了一种名为DoublyCal的新系统来解决这一问题。你可以将其视为一个两步质量控制流程,确保图书管理员只在应该自信时才表现出自信。
以下是其工作原理,使用简单的类比说明:
问题:那位“自信却错误”的图书管理员
目前,如果你问图书管理员:“史努比的兄弟是谁?”而他们发现一张纸条写着“贝尔是兄弟姐妹”,他们可能会自信地说:“是贝尔!”即使这张纸条不完整或模棱两可。他们不知道那张纸条的可信度有多高。他们只是猜测,却听起来非常确定。
解决方案:“双重检查”系统(DoublyCal)
作者创建了一个系统,它像一个智能助手,在图书管理员给出最终答案之前先检查参考书。这位助手会做两件具体的事情:
第一步:校准证据(“事实核查员”)
在图书管理员甚至查看问题之前,一个轻量级的“代理”模型(即助手)会查看参考书(知识图谱)。
- 类比:想象助手是一名正在查看线索的侦探。线索写着:“史努比有一个叫斯派克的兄弟。”
- 创新点:助手不仅仅是递交线索;它会像天气预报一样,为线索附加一个置信度分数。
- “这条线索 100% 可靠。”(高置信度)
- “这条线索不可靠;可能是真的,也可能不是。”(低置信度)
- 实现方式:他们使用了一种称为“贝叶斯平滑”的数学技巧。这就像一张安全网。如果参考书很稀疏(事实很少),这种数学方法可以防止助手仅仅因为找到了一点点证据就声称"100% 确定”。它保持了置信度分数的诚实性。
第二步:校准推理(“聪明的图书管理员”)
现在,助手将线索及其置信度分数交给主图书管理员(即 LLM)。
- 类比:图书管理员阅读线索:“史努比的兄弟是斯派克 [置信度:1.0]"和“史努比的兄弟是贝尔 [置信度:0.5]"。
- 结果:因为图书管理员看到了置信度分数,他们可以权衡答案。他们会意识到:“好吧,‘斯派克’这条线索非常强,但‘贝尔’这条线索很弱。”
- 结局:图书管理员给出最终答案(“是斯派克”),并说:“我对这个答案非常有信心。”如果线索很弱,图书管理员会说“我不确定”,而不是自信地猜测。
为什么这是“双重”校准?
大多数其他系统只做第二步:它们在图书管理员已经猜完之后,问图书管理员:“你有多确定?”但图书管理员不擅长判断自己的确定性。
DoublyCal 做了两次:
- 第一次:校准证据(参考书中的笔记),以确保事实可信。
- 第二次:基于这些可信事实,校准最终答案。
结果
该论文在困难的常识问答问题上测试了此系统。他们发现:
- 准确率提高了:由于系统停止在弱线索上猜测,它答对了更多问题。
- 置信度降低了(这是好事):系统不再在实际上不确定时声称"100% 确定”。它变得更善于承认自己不知道。
- 成本低廉:“助手”(代理模型)小巧且快速,因此运行它不需要花费很多金钱或时间。
一句话总结
将DoublyCal视为 AI 的质量管控经理。与其让 AI 猜测然后再问“我答对了吗?”,不如让该系统先检查原始材料,为每条信息分配一个“信任分数”,然后引导 AI 给出与该信任分数相匹配的答案。它阻止了 AI 出现“自信的错误”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。