← 最新论文
💬 NLP

Human-Alignment, Calibration, and Activation Patterns in Large Language Model Uncertainty

本文研究了大语言模型在显式行为和内部激活中表现出类人确定性信号的程度,探讨了这种“不确定性对齐”与各种数据集上的传统校准指标之间的关系,以及指令微调所带来的影响。

原作者: Kyle Moore, Jesse Roberts, Daryl Watson, William Ward, Grayson Heyboer

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Kyle Moore, Jesse Roberts, Daryl Watson, William Ward, Grayson Heyboer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在和一个非常聪明但有时过于自信的机器人朋友玩“猜答案”的游戏。你问它一个问题,它给出一个答案。有时它是对的,有时又是错的。但这里有一个棘手的问题:机器人是如何知道自己不确定的?

这篇论文就像是一个调查这个问题(即:机器人如何感知不确定性)的侦探故事。研究人员想要了解:大型语言模型(LLMs)感受到的“不确定性”是否与人类感受到的方式相同? 如果是这样,我们能否在它的“大脑”(内部代码)中看到这种不确定性,还是只能通过它的“嘴巴”(它输入的文字)来观察?

以下是他们调查过程的拆解,使用了简单的类比:

1. 核心问题:机器人像我们吗?

当人类对一个答案不确定时,我们可能会犹豫、说“我觉得是这个,但我不是 100% 确定”,或者需要更长时间来回答。我们有一种自然的“不确定性信号”。

研究人员问道:AI 模型也有这种信号吗?

  • 类比: 想象一个人类和一个机器人一起参加测验。当人类不知道答案时,他们可能会挠头。研究人员想看看机器人是否也会“挠头”(表现出内部的困惑),还是仅仅自信地猜错(产生幻觉)。

2. 两大主要测试

研究人员观察了两个具体的事物:

  • 校准度(“诚实度”测试): 这是在问,“当机器人说它有 80% 的把握时,它是否真的在 80% 的情况下是正确的?”
    • 类比: 如果天气应用说“有 80% 的降水概率”,那么实际上是否在 10 次中有 8 次下雨?如果是,它就是经过良好校准的。
  • 对齐(“类人化”测试): 这是在问,“机器人是否会对人类感到困惑的相同问题感到困惑?”
    • 类比: 如果人类觉得一个谜题很难且需要很长时间来解决,机器人是否也会在同一个谜题上挣扎?如果他们都在同样的事情上感到挣扎,那么他们就是“对齐”的。

3. 实验:30 个机器人,许多问题

团队测试了 30 种不同的 AI 模型(如 LLaMa、Mistral 和 Gemma),它们的大小各异。他们向这些模型提出了来自四个不同“测验书”的问题:

  • 多项选择题: 标准的常识问答。
  • 开放式问题: “讲一个故事”或“首都是什么?”这类没有选项的问题。
  • 人类数据: 至关重要的一点是,他们拥有关于真实人类如何回答这些相同问题的资料。他们知道哪些问题人类觉得难(基于多少人答错或花费了多长时间)。

4. 重大发现

A. “指令(Instruct)”陷阱

许多 AI 模型都有两个版本:

  1. 基础模型(Base Model): 未经训练的原始版本。
  2. 指令模型(Instruct Model): 经过训练以遵循人类指令并进行友好对话的版本。

研究结果: 研究人员发现,训练机器人成为一名“好学生”(Instruct)实际上让它更难察觉到自己何时是不确定的。

  • 隐喻: 想象一个天生擅长数学的学生,但在老师要求他们“扮演老师”时会变得紧张。“指令”训练让机器人变得更加自信,但在不确定时却不再那么诚实。它们变得更加“过度自信”,并且在不确定时变得不再像人类。

B. “大脑” vs. “嘴巴”

这是最令人惊讶的部分。研究人员观察了 AI 的“大脑”(其内部电信号,称为激活值/activations),并将其与 AI 实际说出的话(其输出/output)进行了对比。

研究结果: AI 的“大脑”展现出了比它的“嘴巴”更强烈的类人式不确定性。

  • 隐喻: 想象一个人非常害怕蜘蛛,但试图表现得很冷静并说:“我没事。”
    • 嘴巴(输出): 说“我没事”。(看起来很自信)。
    • 大脑(激活值): 心跳加速,瞳孔放大。(实际上很害怕)。
      研究人员发现,即使 AI 的“声音”听起来很自信,其“心跳”也明显地展示了它何时感到困惑。类人的不确定性隐藏在代码深处,而不是在最终的答案中。

C. 群体 vs. 个体

研究人员还发现,AI 模仿群体比模仿个人做得更好。

  • 隐喻: AI 擅长知道“平均而言,人们觉得这个问题很难”。但它并不擅长知道“这个特定的人现在正感到困惑”。

5. 这意味着什么?(严格基于论文内容)

论文得出结论:

  1. AI 的不确定性是真实的,但很微弱: 它确实存在,但它并不是人类不确定性的完美镜像。
  2. 训练会损害诚实度: 使 AI 模型遵循指令(指令微调/Instruct Fine-Tuning)似乎破坏了它们传达不确定性的能力,无论是在行为表现还是在校准度方面。
  3. 看向盒子内部: 如果你想知道一个 AI 是否真的不确定,你不能只听它说了什么。你必须观察它的内部“脑电波”(激活值),在那里,类人的信号要强烈得多。

简而言之: 论文表明,虽然 AI 模型并不是人类怀疑情绪的完美镜像,但它们确实拥有一个与人类反应相似的“隐藏神经系统”来应对困惑。然而,我们越是训练它们成为有用的聊天机器人,它们似乎就越是在那副自信的面具下隐藏起这种紧张感。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →