← 最新论文
💬 NLP

Calibrating LLMs with Semantic-level Reward

本文提出了语义奖励校准(CSR)框架,该框架通过将不一致的言语化置信度分数替换为一种语义级奖励,鼓励正确输出之间达成一致并抑制错误输出之间的虚假一致性,从而提升大语言模型的不确定性校准能力,在各类基准测试中实现了显著更低的错误率和更高的可靠性。

原作者: Fengfei Yu, Ruijia Niu, Dongxia Wu, Yian Ma, Rose Yu

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Fengfei Yu, Ruijia Niu, Dongxia Wu, Yian Ma, Rose Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《Calibrating LLMs with Semantic-Level Reward》(利用语义级奖励校准大语言模型)的解释。

问题:过度自信的猜谜游戏

想象你正在参加一场非常重要的考试,比如医师资格考试。你有一个学习伙伴(即人工智能)帮你回答问题。

目前,大多数人工智能训练方法就像一位只关心最终答案是还是的老师。

  • 如果你的学习伙伴以 100% 的自信猜“天空是绿色的”并且猜错了,老师会给它零分。
  • 如果你的学习伙伴以 100% 的自信猜“天空是蓝色的”并且猜对了,老师会给它一颗金星。

问题出在哪里?老师将自信的错猜自信的对猜在“对/错”信号方面完全等同对待。这教会了人工智能成为一个“自信的赌徒”。它学会了大声且肯定地回答是好事,哪怕它是错的。在高风险情境下(如法律或医学),一个自信的错答案是非常危险的,因为你可能会过度信任它。

旧方案:要求人工智能“说出它有多确定”

研究人员曾试图通过教导人工智能说“我有 80% 的把握”来解决这个问题。如果它的自信数值与其实际答对的频率相匹配,就会给予奖励。

缺陷: 论文指出,这就像要求一个人在纸上写下自己的自信程度。但如果你用略微不同的方式向同一个人问同一个问题(例如,“天空是什么颜色的?”对比“告诉我天空的颜色”),即使他们感觉一样,也可能对前者写下"80%",对后者写下"90%"。

论文表明,这些“口头表达的自信”分数是不稳定的。它们会根据你提问的方式而改变,而不是基于实际真理。这就像一位天气预报员,仅仅因为你让他穿蓝衬衫而不是红衬衫,就改变了他的预测。

新方案:CSR(利用语义奖励进行校准)

作者提出了一种名为CSR的新方法。与其让人工智能它有多自信,不如让它通过行为来展示自信。

类比:“探险家小队”

想象你派 8 名不同的探险家(称为“ rollout",即 rollout 采样)进入森林寻找隐藏的宝藏(正确答案)。

  1. 如果宝藏很容易找到(正确答案):

    • 使用 CSR 时: 所有 8 名探险家都回来并说:“我们在大橡树那里找到了它!”他们意见一致。因为他们对地点的含义达成一致,系统就知道:“哇,人工智能非常自信且很可能正确。”
    • 奖励: 人工智能因这种一致性获得加分。
  2. 如果宝藏很难找到(错误答案):

    • 使用 CSR 时: 探险家们带着不同的故事回来。一个说:“它在河边。”另一个说:“它在洞穴里。”还有一个说:“它在岩石下面。”他们都在谈论不同的事情。
    • 奖励: 系统看到这种混乱,会说:“这个人工智能很困惑,很可能错了。”它会因缺乏一致性而惩罚人工智能。

魔法成分:
论文引入了一种特殊的“语义奖励”。它不在乎探险家们是否使用完全相同的词语(例如,“橡树”对比“那棵大橡树”)。它使用一个裁判来判断他们是否意指相同的事物

  • 如果人工智能是对的,奖励会促使 8 名探险家聚拢成一个紧密的群体(高一致性)。
  • 如果人工智能是错的,奖励会促使 8 名探险家散开到不同的方向(低一致性)。

为什么这更好

  1. 不需要“自信标记”: 人工智能不必停下来并说“我有 90% 的把握”。它只需回答问题。系统通过观察 8 个不同答案之间的一致性程度来推断自信度。
  2. 结果稳定: 因为它关注的是答案的含义而不是具体的措辞,所以不会因为提问方式的不同而感到困惑。
  3. 更好的安全性: 论文在三种不同的人工智能模型(Llama、Qwen、Mistral)和四种不同类型的问题上测试了这种方法。他们发现,CSR 使人工智能在判断自己何时正确、何时错误方面表现更好。
    • 它将“期望校准误差”(衡量人工智能困惑程度的指标)降低了高达 40%。
    • 它将正确答案排名高于错误答案的能力提高了高达 31%。

总结

论文指出:停止要求人工智能告诉你它有多确定。相反,要求它给你 8 个不同的答案。如果这 8 个答案都意味着相同的事情,那么人工智能是自信的且很可能是对的。如果这 8 个答案各不相同、杂乱无章,那么人工智能是困惑的且很可能是错的。

这种方法使人工智能更安全、更可靠,而无需它编写关于其感受的额外句子。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →