← 最新论文
🤖 machine learning

"very likely" Means "uncertain"? How LLMs Diverge from Humans in Linguistic Uncertainty Quantification

本文通过引入一种基于优化的算法 METHODNAME,研究了人类与大语言模型在言语不确定性量化方面的差异,该算法直接从模型输出中学习言语标记的最佳概率映射,从而在无需重复采样的情况下揭示系统性的置信度差异。

原作者: Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu, Tianlong Chen

发布于 2026-10-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu, Tianlong Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

我们在说话时,经常会进行“对冲”。我们会说某事是“很可能的”、“可能的”或“几乎确定的”,利用这些词汇来传达我们真实的认知程度。这种表达怀疑的能力是一种元认知,即一种通过承认自身知识边界来进行的心理检查。这是人类交流中至关重要的一部分,让我们能够在不假装拥有并不掌握的答案的情况下,应对不确定性。在人工智能领域,特别是对于大型语言模型而言,这种能力正成为一项关键的安全特性。这些模型有时会生成听起来充满自信但事实错误的信息,这种现象被称为“幻觉”。为了信任这些系统,特别是在医学或法律等敏感领域,我们需要知道它们何时处于不确定状态。挑战在于,弄清楚人工智能用来表达怀疑的词汇,其含义对于人类听众是否与对于机器本身而言是相同的。

一个研究团队致力于调查大型语言模型所表达的言语不确定性是否与人类的理解相一致。他们首先收集了大量关于人类如何解读诸如“极有可能”或“不确定”等短语的数据。他们借鉴了数十年的心理学和决策科学研究,编制了一份参考指南,将这些常见的短语映射到特定的数值概率上。例如,在人类的心智中,“极有可能”这个短语对应着高度的信心,而“可能”则处于中间位置。随后,研究人员测试了几种先进的语言模型,要求它们回答问题并使用这些相同的自然语言短语来解释它们的信心程度。他们将模型的回答与人类参考指南进行了对比,以观察机器是否在用与用户相同的语言进行交流。

结果显示出显著的脱节。虽然模型能够使用这些词汇,但它们赋予这些词汇的确定性水平与人类并不一致。例如,当人类听到“极有可能”时,会将其理解为很高的概率,但研究中的模型经常使用这个短语来描述它们实际上相当不确定的情况。相反,模型可能会为那些在人类看来仅仅是猜测的短语表达高度的信心。这种错位意味着,仅仅阅读模型的输出并假设其言语线索反映了其内部状态是具有误导性的。研究表明,仅仅依靠人类制定的不确定性词汇词典,不足以准确衡量机器的信心;这些模型对于这些词汇有着自己独特的内部逻辑。

为了弥补这一差距,研究人员开发了一种名为 VOCAL 的新方法。该方法并非强迫模型符合人类的定义,而是直接从模型自身的行为中学习不确定性词汇的具体含义。该系统分析了数千个模型的响应,记录它在正确和错误时分别使用了哪些短语。然后,它构建了一个定制的映射表,将模型特定的言语习惯转化为准确的概率得分。这个过程涉及一种数学优化,用于平滑数据,确保即使是那些很少使用的相似短语也能获得相似的得分。通过针对特定机器量身定制解释方式,该方法创造了一种更可靠的方式来检测模型何时处于不确定状态。

实验证明,这种定制化的方法比试图将人类标准强加于机器的效果要好得多。在包括复杂数学问题和医学问题在内的各种数据集测试中,与仅使用人类参考指南相比,这种新方法在预测模型答案正确或错误方面要准确得多。在某些情况下,这种提升是巨大的,它将一种表现几乎仅比随机猜测稍好一点的方法,转变为一种能够可靠识别错误的方法。研究人员发现,这种技术可以达到与那些需要模型生成多个答案并进行比较的、成本高得多的方法相当的性能水平,且无需额外的计算时间或计算能力。

研究结论指出,尽管大型语言模型可以模仿人类的言语模式,但它们对不确定性的内部理解与我们有着本质的不同。像“极有可能”这样的短语,对于机器而言并不具备与人类相同的分量。为了使这些系统真正值得信赖,我们不能仅仅要求它们像人类一样说话,并期望它们表达的意思也相同。相反,我们必须学会阅读它们特有的不确定性“方言”。通过创建定制的映射表,将模型独特的言语信号转化为清晰的信心信号,我们可以更好地区分正确答案与自信的幻觉,从而使这项技术在现实应用中更加安全、可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →