想象一个大型语言模型(LLM)就像一个非常聪明、但有时过于自信的学生,正在参加一场多项选择题考试。当学生答完一道题时,他们通常会给你一个“置信度分数”(比如会说:“我有 95% 的把握这是正确答案”)。这是我们检查模型对错的标准方式。
然而,这篇论文指出,这个置信度分数往往是个谎言。模型可能会说“我有 95% 的把握”,即使它完全错了。这就像一个学生胡乱猜测,却对自己的猜测感到非常有信心。
问题:只看终点,不看过程
大多数检查 AI 是否自信的方法,只关注最终答案(即终点)。它们将模型的思考过程视为在最终时刻拍摄的一张单帧快照。
这篇论文的作者说:“等一下!要理解一个人是否真的确定,你不应该只看他们的最终答案。你应该观察他们是如何到达那里的。”
他们将模型内部的思考过程比作徒步者攀登高山:
- 标准方法(MSP): 只在徒步者到达山顶时观察他们。如果他们在山顶看起来很开心,我们就假设他们经历了一次轻松、笔直的徒步。
- 新方法(轨迹): 观察徒步者的整条路径。他们是直线行走的吗?他们是否偏离了悬崖并不得不折返?他们是否在最终跌跌撞撞登上顶峰之前剧烈地左右摇摆?
论文声称,即使两名徒步者以同样开心的表情到达同一座山顶,他们的路径也可能讲述截然不同的故事。其中一人可能经历了一次平稳、自信的攀登(很可能正确),而另一人可能全程迷失、困惑并与风搏斗(很可能错误),即使他们最终都在山顶露出了笑容。
解决方案:“运动探测器”
研究人员构建了一种工具,充当模型内部思考的运动探测器。
- 追踪步骤: 当模型处理一个问题时,它会经过许多层“神经元”(就像建筑物的楼层)。在每一层,模型都会对其答案进行微小的调整。
- 绘制地图: 该工具不是只看最终结果,而是绘制出模型穿过这些楼层的路径地图。
- 测量形状: 该工具测量这条路径的 11 个具体特征,例如:
- 平滑度: 模型是否突然改变了主意?
- 方向: 模型是否持续朝同一方向推进,还是与其之前的想法相互抵触?
- 效率: 模型是走了直接路线,还是原地打转?
结果:更聪明的“停止”按钮
利用这种“运动地图”,研究人员训练了一个简单、透明的系统(一种“稀疏线性探针”)来预测错误。
- 优于标准方法: 这个新系统在发现模型对其置信度撒谎方面表现更好。在测试中,与标准方法相比,它显著减少了“高置信度错误”的数量。
- “选择性放弃”技巧: 由于该系统非常擅长发现异常,它可以告诉模型:“嘿,你认为自己有 95% 的把握,但你内部的路径很混乱。我要让你停止,不要给出答案。”这防止了模型自信地给出错误答案。
- “原因”因素: 最酷的部分是,由于该工具使用简单的几何测量(例如“路径弯曲了多少?”),我们实际上可以看到它标记错误的原因。它可以告诉我们:“模型开始时很自信,然后在中间层突然改变了主意,接着又试图强行将答案拉回最初的想法。”这就像医生能够说:“病人不仅仅是生病了;他们的的心率在下午 2 点飙升,体温在下午 3 点下降”,而不仅仅是说“病人病了”。
总结
简而言之,这篇论文教导我们停止信任模型最终的“我确定!”陈述。相反,我们应该观察模型如何思考问题的全过程。通过观察其内部步骤的“运动”和“形状”,我们可以捕捉到那些否则可能溜走的自信错误,从而使 AI 更安全、更可靠,而无需昂贵或复杂的新系统。
技术摘要:从语言模型轨迹中读取校准的不确定性
1. 问题陈述
当前针对具有结构化输出的大语言模型(LLM)的不确定性量化(UQ)方法,面临着计算效率与校准性之间的权衡。默认方法最大软概率(MSP)计算成本为零,但往往校准不良,倾向于对错误预测赋予高置信度。相反,现有的探测内部激活的方法通常将隐藏状态视为静态快照(来自单层或平均值),丢弃了表征形成过程中的逐层轨迹。这种静态视角忽视了证据如何在网络深度中积累、增强或反转,可能掩盖了存在于计算路径中但未体现在最终输出分布里的不确定性信号。
2. 方法论
作者提出了一种将模型激活视为表征轨迹而非静态状态的方法。该方法包含三个主要组成部分:
2.1. 基底:MLP 写入向量
该方法不分析原始隐藏状态,而是关注每个 Transformer 块的多层感知机(MLP)对残差流贡献的MLP 写入向量(mℓ)。先前的机制可解释性研究表明,MLP 是事实知识存储的关键位置。
- 该方法在单次前向传播过程中,捕获提示词最终位置(读出位置)处这些向量的序列。
- 通过计算这些向量的累积和 sℓ=∑k≤ℓmk,在表征空间中构建一条离散轨迹。
- 该轨迹定义为从初始状态(s0=0)到最终端点(sL)。
2.2. 几何特征提取
该轨迹使用每层十一种尺度不变的几何特征进行总结,分为四类:
- 深度分布:衡量计算努力(更新幅度)如何在各层之间分布(例如,前重后轻 vs. 前轻后重)。
- 局部轨迹形状:捕捉方向一致性(连续余弦)、突变(曲率),以及更新是增强还是反驳先前状态(更新 - 状态对齐)。
- 与端点的关系:衡量各层与最终方向的关系,包括收敛性(指向最终的方向)、单个更新的对齐度(更新指向最终),以及识别主动反对端点的层(矛盾支持)。
- 效率:衡量净位移与总路径长度之比(累积相干性),指示轨迹到达其端点的直接程度。
2.3. 稀疏线性探针
这些特征被输入到一个稀疏线性探针(稀疏逻辑回归)中,以预测错误的概率。
- 输入:每层的 11 个特征向量(ϕ(x))以及模型的 MSP 分数(pmsp)。
- 交互:模型包含特征与 MSP 之间的交互项,允许探针根据模型的基线置信度对几何信号进行差异化加权。
- 训练:探针经过训练以最小化针对错误指示器的类别平衡二元交叉熵,并使用弹性网惩罚进行正则化以强制稀疏性。这使得模型能够直接识别预测性特征,而无需单独的筛选阶段。
3. 主要贡献
- 基于轨迹的 UQ:作者提出了一组紧凑的几何特征,用于描述表征随网络深度的演变。当将这些特征输入稀疏线性探针时,该方法在选择性 abstention(放弃预测)下优于 MSP,且性能提升幅度随基线校准不良的程度而增加(最高提升 21 个 AURC 点)。
- 端到端可解释性:与基于原始激活的不透明密集探针不同,每个特征都具有封闭形式的几何意义。探针的系数揭示了错误发生的方式:识别哪些层过早地做出承诺,哪些层与运行状态相矛盾,以及轨迹在何处偏离其端点。
- 全面的实证评估:该方法在 9 个指令微调的 LLM(Qwen、Llama、DeepSeek 系列,参数量从 3B 到 72B 不等)上进行了评估,涵盖五个多样化的 NLP 任务(MMLU、CosmosQA、HellaSwag、HaluDial、HaluSum)。
4. 实验结果
- 性能:该探针在45 个模型 - 数据集对中的 41 个上优于 MSP。在 MSP 表现最差(高度校准不良)的地方,增益最为显著,在最困难的配置中将 AURC(风险 - 覆盖率曲线下面积)降低了 11.45 至 21.83 个点。
- 与基线的比较:尽管仅使用 11 个标量特征,该探针在 24 种配置上匹配或优于基于完整隐藏状态训练的高容量“原始激活探针”,并在另外 6 种配置中保持在 2 个 AURC 点以内。
- 选择性:该探针产生平滑、单调的风险 - 覆盖率曲线,避免了 MSP 常见的低覆盖率不稳定尖峰。即使 MSP 置信度分数相同,它也能有效区分正确与错误的预测。
- 可解释性发现:
- 正确与错误:具有相同 MSP 分数的预测表现出截然不同的轨迹特征。例如,错误的预测通常显示在早期层过早地与最终方向对齐,随后出现“折返”或漂移。
- 任务特异性:错误的几何特征因任务而异。在 HaluSum 上,错误表现为过早承诺,随后在后期出现打破状态的修正;在 CosmosQA 上,错误表现为中深度的、垂直于答案方向的漂移。
- 系数分析:探针的系数定位了错误机制。例如,在 HaluSum 上,错误信号集中在网络的后四分之一部分,而在 CosmosQA 上,它们则分布在各个深度。
5. 意义与主张
该论文主张,将激活视为运动而非静态快照,提供了一条介于密集探针的不透明性和 MSP 信号有限性之间的“可处理的中间路径”。
- 可审计的不确定性:由于特征是构建时可解释的,生成的置信度信号允许从业者不仅检查模型是否不确定,还能检查不确定性在其计算过程中的何处产生(例如,特定层或几何偏差)。
- 效率:该方法在推理过程中增加的计算成本微乎其微,仅需单次前向传播和简单的几何计算,避免了基于采样或集成方法的高昂成本。
- 局限性:作者指出,他们的分析仅限于离散选择设置(多项选择题),且探针目前是针对(模型,任务)对进行拟合的,跨模型和任务的迁移能力仍是一个未解决的问题。
总之,这项工作表明,语言模型构建预测的几何过程包含了关于不确定性的丰富且可解释的信号,这些信号对最终输出分布是不可见的,从而实现了更可靠、可审计的选择性预测。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。