← 最新论文
🤖 machine learning

Reading Calibrated Uncertainty from Language Model Trajectories

本文提出了一种通过从每层前馈神经网络更新轨迹中提取尺度不变几何特征并将其输入稀疏线性探针,以改进语言模型不确定性量化的方法,该方法在提供关于错误如何在模型深度中产生及分布的可解释见解的同时,其表现优于标准的最大 softmax 概率方法。

原作者: Aliai Eusebi, Alexander Herzog, Xiaoyu Liang, Marie Vasek, Enrico Mariconti, Lorenzo Cavallaro

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Aliai Eusebi, Alexander Herzog, Xiaoyu Liang, Marie Vasek, Enrico Mariconti, Lorenzo Cavallaro

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个大型语言模型(LLM)就像一个非常聪明、但有时过于自信的学生,正在参加一场多项选择题考试。当学生答完一道题时,他们通常会给你一个“置信度分数”(比如会说:“我有 95% 的把握这是正确答案”)。这是我们检查模型对错的标准方式。

然而,这篇论文指出,这个置信度分数往往是个谎言。模型可能会说“我有 95% 的把握”,即使它完全错了。这就像一个学生胡乱猜测,却对自己的猜测感到非常有信心。

问题:只看终点,不看过程

大多数检查 AI 是否自信的方法,只关注最终答案(即终点)。它们将模型的思考过程视为在最终时刻拍摄的一张单帧快照。

这篇论文的作者说:“等一下!要理解一个人是否真的确定,你不应该只看他们的最终答案。你应该观察他们是如何到达那里的。”

他们将模型内部的思考过程比作徒步者攀登高山

  • 标准方法(MSP): 只在徒步者到达山顶时观察他们。如果他们在山顶看起来很开心,我们就假设他们经历了一次轻松、笔直的徒步。
  • 新方法(轨迹): 观察徒步者的整条路径。他们是直线行走的吗?他们是否偏离了悬崖并不得不折返?他们是否在最终跌跌撞撞登上顶峰之前剧烈地左右摇摆?

论文声称,即使两名徒步者以同样开心的表情到达同一座山顶,他们的路径也可能讲述截然不同的故事。其中一人可能经历了一次平稳、自信的攀登(很可能正确),而另一人可能全程迷失、困惑并与风搏斗(很可能错误),即使他们最终都在山顶露出了笑容。

解决方案:“运动探测器”

研究人员构建了一种工具,充当模型内部思考的运动探测器

  1. 追踪步骤: 当模型处理一个问题时,它会经过许多层“神经元”(就像建筑物的楼层)。在每一层,模型都会对其答案进行微小的调整。
  2. 绘制地图: 该工具不是只看最终结果,而是绘制出模型穿过这些楼层的路径地图。
  3. 测量形状: 该工具测量这条路径的 11 个具体特征,例如:
    • 平滑度: 模型是否突然改变了主意?
    • 方向: 模型是否持续朝同一方向推进,还是与其之前的想法相互抵触?
    • 效率: 模型是走了直接路线,还是原地打转?

结果:更聪明的“停止”按钮

利用这种“运动地图”,研究人员训练了一个简单、透明的系统(一种“稀疏线性探针”)来预测错误。

  • 优于标准方法: 这个新系统在发现模型对其置信度撒谎方面表现更好。在测试中,与标准方法相比,它显著减少了“高置信度错误”的数量。
  • “选择性放弃”技巧: 由于该系统非常擅长发现异常,它可以告诉模型:“嘿,你认为自己有 95% 的把握,但你内部的路径很混乱。我要让你停止,不要给出答案。”这防止了模型自信地给出错误答案。
  • “原因”因素: 最酷的部分是,由于该工具使用简单的几何测量(例如“路径弯曲了多少?”),我们实际上可以看到它标记错误的原因。它可以告诉我们:“模型开始时很自信,然后在中间层突然改变了主意,接着又试图强行将答案拉回最初的想法。”这就像医生能够说:“病人不仅仅是生病了;他们的的心率在下午 2 点飙升,体温在下午 3 点下降”,而不仅仅是说“病人病了”。

总结

简而言之,这篇论文教导我们停止信任模型最终的“我确定!”陈述。相反,我们应该观察模型如何思考问题的全过程。通过观察其内部步骤的“运动”和“形状”,我们可以捕捉到那些否则可能溜走的自信错误,从而使 AI 更安全、更可靠,而无需昂贵或复杂的新系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →