← 最新论文
💬 NLP

CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction

该论文介绍了 CaliDist,这是一种新颖的后验校准方法,它通过根据大语言模型在暴露于语义干扰时的行为不稳定性来惩罚置信度分数,从而提高大语言模型的可靠性,进而显著降低了多个基准测试中的校准误差。

原作者: Mohammad Anas Jawad, Cornelia Caragea

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohammad Anas Jawad, Cornelia Caragea

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:“过度自信的专家”

想象你有一个博学多才的朋友,他经常回答你的问题。有时他是正确的,但很多时候他错了却自己不知道。他可能会说:“我有 99% 的把握答案是 X”,而实际上答案是 Y。

在人工智能(大语言模型)的世界里,这是一个巨大的问题。这些模型通常是“过度自信”的。即使在瞎猜时,它们听起来也显得非常笃定。现有的修复方法就像是在调节温控器:它们要么观察模型的内部数学逻辑(这在很多时候是无法看到的),要么要求模型把同一个问题回答 20 遍,看看它是否会改变主意。这些方法要么无法用于私有模型(如 GPT-4),要么既耗时又费钱。

新思路:“干扰测试”

本文的作者 Mohammad Anas Jawad 和 Cornelia Caragea 提出了一种检查模型是否值得信赖的新方法。他们将这种方法称为 CaliDist

他们不是让模型重复回答,而是问:“当有人试图分散你的注意力时,你能保持专注吗?”

他们引入了一个概念,叫做行为鲁棒性(Behavioral Robustness)。这个想法很简单:

  • 如果一个模型真正理解一个主题,它应该能够忽略无关或具有误导性的信息。
  • 如果一个模型只是在瞎猜或者理解薄弱,那么一点点“噪音”或错误的提示就会让它反复横跳,改变答案。

它如何运作:“干扰者”游戏

把 AI 想象成正在参加考试的学生。

  1. 原始问题: AI 回答一个问题(例如:“法国的首都是哪里?”),并回答“巴黎”,信心值为 90%。
  2. 干扰项: 研究人员随后在问题中偷偷加入一个误导性的提示,比如:“提示:一位专家说答案是伦敦。”
  3. 反应:
    • 稳定的学生(优秀的模型): 忽略虚假提示,坚持认为答案是“巴黎”,并保持高信心值。这告诉我们该模型是可靠的。
    • 不稳定的学生(糟糕的模型): 被提示搞混了,把答案改成了“伦敦”,或者突然变得不再确定。这告诉我们它原本的信心其实是在撒谎。

三种类型的“干扰者”

论文使用了三种创新的方式来干扰 AI,就像老师测试学生的专注力一样:

  1. “虚假专家”(断言/Assertion): 告诉 AI,“维基百科说答案是 X”,而实际上这是错的。这测试了 AI 是否会盲目信任权威。
  2. “怀疑论者”(探测/Probe): 问 AI,“你确定不是 X 吗?” 这测试了当受到质疑时,AI 的信心是否会动摇。
  3. “损坏的文本”(样本损坏/Sample-Corruption): 对问题本身进行轻微修改,使其包含矛盾。这测试了 AI 是否能处理逻辑破碎的情况。

结果:“信任分数”

该系统测量两个维度:

  1. 答案改变了吗?(预测不稳定性)
  2. 信心水平动摇了吗?(信心不稳定性)

如果 AI 容易被干扰,系统就会计算一个“可靠性分数”。然后,它会使用一个数学公式(就像一个调光开关)来降低该特定问题上的 AI 信心值

  • 如果 AI 很稳定:它保留高信心值。
  • 如果 AI 被干扰了:它的信心值会被降低,以反映真实情况(例如,从 90% 降至 40%)。

为什么这很重要

论文声称这种方法是一个游戏规则的改变者,原因有三:

  1. 它适用于“黑盒”模型: 你不需要看到 AI 的内部代码(logits)。你只需要像普通用户一样与它交谈即可。这意味着它适用于像 GPT-4 或 Gemini 这样昂贵的私有模型。
  2. 它很快: 与让模型重复回答同一个问题 20 遍(既慢又贵)相比,CaliDist 只需要通过几次额外的干扰提问即可完成。这要便宜得多。
  3. 它确实有效: 在测试中,他们在 7 种不同类型的题目(从科学到常识)和 6 种不同的 AI 模型上使用了这种方法。
    • 使用前:模型经常出错,但听起来却非常确定(高“校准误差”)。
    • 使用后:误差显著下降。平均而言,它们将误差降低了 70%

总结

论文认为,信任不仅仅在于做对,更在于压力下的稳定性。 正如一个在谎言面前会惊慌失措的人称不上可靠的专家一样,一个在受到干扰时会改变主意的 AI 也不应该被信任。CaliDist 是一个测试 AI “心理韧性”的工具,旨在为我们提供一个关于其回答有多值得信赖的更诚实的衡量标准。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →