← 最新论文
💬 NLP

Consistent but Miscalibrated: Evaluating LLM Limitations for Risk Communication in Natural Language

本研究评估了九种大型语言模型作为概率风险传播事后解释器的表现,并发现尽管它们总体上具有一致性,但在校准方面仍存在显著偏差——尤其是在不确定性方面——这表明它们尚不足以成为将数值预测转化为自然语言的可靠零样本工具。

原作者: Diego Cerda-Mardini, Sarath Chandar, Sreenath Madathil

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Diego Cerda-Mardini, Sarath Chandar, Sreenath Madathil

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个可以预言未来的水晶球,但它不会直接给你清晰的“是”或“否”,而是向你低语着数字,比如“73% 的概率”或“预测非常不稳定”。现在,想象你要求一个超级聪明的机器人(大语言模型,简称 LLM)将这些数字翻译成普通人能听懂的白话。你希望当数字很高时,机器人说“很有可能下雨”;而当数字很不稳定时,它说“非常不确定”。

这个核心问题是:这些机器人真的能在不出错的情况下胜任这项工作吗?

研究人员设置了一场大规模的“翻译”游戏来寻找答案。他们不仅仅是让机器人进行猜测,而是向它们输入了来自“水晶球”的模拟预测(在数学上使用被称为 Beta 分布的模型),这些预测具有特定的、已知的可能性水平和不确定性。然后,他们要求九种不同的 AI 模型从一个严格的菜单选项中(例如“极有可能”或“高度不确定”)挑选出最完美的短语来描述这种情况。他们反复进行这项测试,通过改变“温度”(即机器人被允许进行创作或随机发挥的程度),并在六个不同的现实场景中(从预测洪水到猜测赌徒是否会赢)进行测试。

以下是来自实验室的结论:这些机器人表现得很一致,但在校准方面表现糟糕。

把它想象成一位天气预报员:他非常可靠,每次你问他时,他都会给出完全相同的话,但他对于这些话背后的实际含义却完全理解错了。

  • 一致性(“可靠的机器人”): 如果你问同一个机器人同一个问题十次,它几乎总是会给出完全相同的答案。它就像一只从不忘记剧本的鹦鹉。大多数模型在此项得分很高,其中一个顶尖模型(GPT-5.4)甚至得到了 1.0 的满分。它从未动摇。
  • 校准度(“诚实的说话者”): 这是机器人栽跟头的地方。校准意味着让文字与实际的数学逻辑相匹配。如果数学显示“95% 的概率”,机器人应该说“几乎确定”;如果数学显示“10% 的概率”,它应该说“极不可能”。研究发现,大多数机器人都是失校准的。无论数学数据是在高喊“几乎不可能”还是“板上钉钉”,它们往往都会选择中间地带的词汇(比如“有些确定”)。它们就像一个无论掷出什么点数都只会说“也许吧”的人。

论文明确排除了以下可能性:
你可能会想:“也许机器人只是不会做数学!也许如果我们直接给它们最终的数字,而不是原始数据,它们就能做对了。”研究人员测试了这种想法。他们直接在提示词中提供了预先计算好的“众数”(最可能的数字)和“样本量”(数学上的确定程度)。结果如何? 并没有帮助。机器人仍然无法将数字映射到正确的词汇上。这表明问题不在于它们不会做数学,而是在于翻译步骤本身。它们只是没有一套能够将数字与词汇联系起来的稳固内部字典。

“温度”的权衡:
研究人员还调整了控制机器人选择随机性的“温度”设置。

  • 低温度: 机器人变得很乏味。它每次都会选择一个安全的词。一致性很高,但它会陷入思维定式,无法很好地匹配数字。
  • 高温度: 机器人变得有点狂野。它开始挑选不同的词,这实际上有助于它更好地匹配数字(提高了校准度),但它也会变成一个靠谱度下降的机器人,会对同一个问题给出不同的答案(破坏了一致性)。

唯一的明星选手:
有一个例外:GPT-5.4。这个模型在描述可能性方面表现得像头猛兽。它得到了接近完美的 0.96 校准分和 1.0 的完美一致性得分。它似乎学习到了一套完美且僵化的规则手册:“如果数字是 X,我就说 Y。”然而,即使是这个超级机器人,在处理不确定性时也失败了。它在不确定性任务上的得分仅为 0.37,和其他模型一样,倾向于使用模糊的中立短语。事实证明,即使是最聪明的机器人,也不知道如何用一种符合数学逻辑的方式来说出“我真的不太确定”。

底线结论:
论文得出结论:目前这些 AI 模型尚未准备好作为向公众解释风险的独立工具。它们就像是一个非常连贯的翻译官,但所使用的语言中,词汇与实际意义并不匹配。如果你让它们解释医疗风险或洪水预警,它们可能会给出一个听起来很自信、但实际上具有误导性的答案。

作者们指出,虽然这些模型擅长生成流畅、易读的句子,但我们不能直接把它们接入风险计算器并期望它们是准确的。这个“瓶颈”不在于数学,而在于机器人无法真正理解如何将一个数字转化为一个值得信赖的词汇。在解决这个问题之前,我们需要非常谨慎地对待让 AI 解释关乎生死的概率情况。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →