← 最新论文
💬 NLP

Human-Alignment and Calibration of Inference-Time Uncertainty in Large Language Models

本文评估了大型语言模型中各种推理时不确定性度量指标,发现尽管其中一些指标与人类答案偏好并不相关,但若干指标仍表现出与人类不确定性的高度一致性,以及中度至强度的模型校准性。

原作者: Kyle Moore, Jesse Roberts, Daryl Watson

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Kyle Moore, Jesse Roberts, Daryl Watson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在向一个非常聪明、博学多才的机器人提问。你想知道两件事:

  1. 机器人真的说对了吗?(这被称为校准度/Calibration)。
  2. 机器人的“不确定感”是否与人类感到不确定的方式一致?(这被称为对齐/Alignment)。

长期以来,研究人员在构建能够了解自己对错的机器人(校准度)方面表现出色,但他们并没有真正检查机器人的“直觉”是否与人类群体的感觉一致。这篇论文就像是一个侦探故事,试图弄清楚机器人与人类在对待不确定性时,是否处于相同的“情感波长”上。

侦探工作:他们是如何测试的

研究人员把机器人当作一个正在参加多项选择题考试的学生。他们不仅询问机器人的答案,还要求机器人展示其“解题过程”,即揭示它对每一个可能的选项有多大的信心。

他们使用了两个主要的“教室”(数据集)来测试:

  • 小班级: 来自一家著名的民调机构(皮尤研究中心 Pew Research)的 38 个微型问题组。
  • 大班级: 来自公共舆论调查(罗珀中心 Roper Center)的近 3,000 个大规模问题组。

在这些班级中,他们将机器人的答案和信心水平与真实的人类群体进行了对比。

大发现:“感觉” vs. “思考”

这里是论文发现的一个转折点,就像是发现学生和老师虽然在考不同的试,但却有着相同的“氛围”:

  • 他们在“答案”上并不一致: 如果你问人类群体和机器人同一个问题,他们选出的答案通常是不同的。机器人的“偏好顺序”(它最喜欢的答案、次优的答案等)通常与人类的完全不同。
  • 但在“感觉”上,他们确实一致: 尽管他们选择的答案不同,但机器人的不确定性指标往往会与人类的不确定性同时上升或下降。

类比: 想象你和朋友正在猜测一场体育比赛的比分。你们猜出的比分都不同(也许你猜 24-20,他猜 21-19)。然而,你们对自己的猜测都感到同样紧张。你们都觉得:“我不确定,情况可能向任何一方发展。”论文发现,大语言模型(LLMs)就像那个朋友:他们可能会猜错比分,但他们的“紧张程度”与人类的紧张程度完美匹配。

他们使用的工具(“不确定性测量仪”)

研究人员测试了许多衡量这种“紧张感”的方法。把这些想象成测量机器人焦虑程度的不同温度计:

  1. Top-1 概率: “我对我的第一个猜测有多确定?”(这作为一种对齐人类感觉的测量仪效果并不好)。
  2. 熵(Entropy,即“混沌”测量仪): 这衡量了机器人的猜测分布得有多散。如果机器人 90% 确定一个答案,它就很平静(低熵)。如果它在四个答案之间各占 25%,它就很混乱(高熵)。
    • 胜出者: 他们发现,专门针对正确答案选项进行测量的“选择熵”(Choice Entropy),以及观察前 10 个最可能的猜测(Top-10 Entropy),是匹配人类感觉的最佳方法。
  3. Top-P 采样: 这就像机器人说:“我要抓取那些总和达到我 90% 信心度的前一部分答案。”这个部分的规模告诉我们机器人的不确定性有多大。

机器人真的知道自己什么时候错了?(校准度)

仅仅因为机器人的不确定感与人类一致,并不意味着它在感到确定时就是正确的。研究人员使用了一个名为 MMLU 的标准测试(一个庞大的困难多项选择题集)来检查这一点。

  • 结果: 那些能匹配人类感觉的“不确定性测量仪”(如选择熵)也被证明在预测机器人何时出错方面表现得相当不错。
  • 注意点: 机器人的校准并不是完美的。它属于“中等”水平。这就像天气预报说“有 50% 的降水概率”,然后确实有一半的时间下了雨——它很有用,但不是预知未来的水晶球。

“顿悟时刻”

论文提出了一个以前从未有人注意到的巧妙联系:

  • Top-P 采样(一种常见的机器人生成文本的方式)在数学上与统计学中的“贝叶斯置信集”(Bayesian Credible Set)概念非常相似。作者意识到,这种联系有助于解释为什么观察 Top-P 组的“规模”是衡量不确定性的好方法。

总结

这篇论文告诉我们,大语言模型具有“类人”的不确定感,即使它们在最终答案上并不总是与人类达成一致。

  • 什么方法效果最好: 测量机器人的信心在正确答案选项中分布得多么“分散”(选择熵),或者观察前 10 个猜测。
  • 为什么这很重要: 如果我们能使用这些特定的“测量仪”,我们就可以给用户提供一种直观的信号。与其给出一个令人困惑的数字,不如让机器人表达:“我对这件事感到非常不确定”,这种方式能与人类的感觉相匹配。这有助于建立信任,即便机器人并非 100% 正确。

这篇论文没有做的事情:

  • 它没有在开放式对话(如写诗)中测试这一点,仅限于多项选择题。
  • 它没有在最大、最昂贵的超级计算机模型上进行测试,仅针对参数量在 80 亿(8B)或更少的模型。
  • 它没有进行临床试验或用户研究来观察这是否会让人们更开心;它只测量了数学逻辑和对齐程度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →