← 最新论文
💬 NLP

Reverse Probing: Supervised Token-level Uncertainty Quantification for Large Language Models in Clinical Text

本文介绍了反向探测,这是一种新颖的框架,它利用模型内部激活来估计临床文本摘要中的词级不确定性,而无需进行新的采样,从而在准确性和效率上超越现有基线,同时提供关于模型置信度的可解释性见解。

原作者: Bushi Xiao, Sarvesh Soni, Daisy Zhe Wang

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Bushi Xiao, Sarvesh Soni, Daisy Zhe Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名医生,正在阅读一位非常聪明但有时过于自信的 AI 助手撰写的患者摘要。AI 撰写了一份关于患者住院情况的长篇报告。大多数时候,这份报告完美无缺。但偶尔,AI 可能会编造一个症状或弄错一个数字——即“幻觉”。在现实世界中,一个错误的词都可能带来危险。

问题是:我们如何知道 AI 对哪个具体的词感到不确定?

目前大多数方法试图通过让 AI 将同一份报告撰写十次,并观察故事是否发生变化来解决这个问题。如果故事不同,说明 AI 不确定。但这就像让一位疲惫的医生为了检查其信心而将同一份出院摘要撰写十次。这耗时太长、成本太高,且不适用于长篇医疗文档。

本文介绍了一种名为**反向探测(Reverse Probing)**的新方法。其工作原理如下,辅以简单的类比:

1. “反向”理念:阅读思想,而非言语

研究人员决定不再让 AI“说话”(生成新文本)以判断其是否自信,而是将 AI 已有的文本喂给它,观察其“大脑”如何反应。

将 AI 的内部“大脑”想象成一个巨大的连接图书馆。

  • 常规方法: 你问图书管理员:“请讲一个关于这位患者的故事。”如果图书管理员结结巴巴或讲述不同的故事,你就知道他们不确定。
  • 反向探测: 你递给图书管理员一个已完成的故事,说:“把这句话读给我听,但假装你不知道最后一个词。”然后,你观察图书管理员的“眼睛”(内部信号)。
    • 如果这句话是真实的(有患者真实记录支持),图书管理员的“眼睛”会亮起,显示出通往答案的清晰、自信的路径。
    • 如果这句话是虚假的(缺乏支持),图书管理员的“眼睛”会显得困惑,或者看向错误的方向。他们无法在真实记录中找到“依据”。

研究人员称之为“反向”,因为他们关注的不是 AI 生成了什么,而是 AI 如何处理已存在的内容。

2. “探测”:检查脉搏

研究人员使用了一种称为**探测(probing)**的技术。想象 AI 是一个黑盒。你无法看到内部,但你可以用一根棍子(“探针”)去戳它,观察它如何振动。

在这项研究中,他们取了一份临床摘要和一份“简要住院病程”(来自医院的原始、事实性笔记),并将两者都输入 AI。

  • 测试: 他们一次隐藏一个词(就像“填空”),并要求 AI 根据上下文猜测该词。
  • 信号: 他们测量 AI“大脑”内部的四种“振动”:
    1. 内部信号: AI 的“思想”从其大脑的一层到下一层变化的程度。
    2. 不确定性信号: AI 的置信度有多“分散”。它是确信自己 99% 正确,还是在 50/50 的选项中猜测?
    3. 医学知识: AI 是否将该词识别为医学术语?
    4. 分布信号: 这是最关键的一点。他们比较 AI 在看到真实医院笔记时的反应与未看到时的反应。如果 AI 在移除真实笔记后置信度显著下降,那么该词很可能缺乏支持。

3. “侦探”:发现谎言

一旦他们为每个词获得了这些“振动”(数据点),他们便训练一个智能计算机程序(分类器)充当侦探。

  • 侦探学会:“当 AI 的‘大脑’显示出这种特定的困惑模式时,该词很可能是一个谎言。”
  • 结果是生成一份文档地图,其中每个词都获得 0 到 1 的评分。高分意味着“这个词不可靠;请检查”。

4. 结果:快速且准确

研究人员在真实的医疗数据上测试了该方法,这些数据的专家部分已经标记了虚假内容。

  • 速度: 由于无需让 AI 撰写新故事,该过程极其迅速。他们可以在10 分钟内检查 100 份文档。而旧方法(要求 AI 撰写 10 次)完成同等数量需要7 小时
  • 准确性: 他们的“反向探测”方法在发现虚假词汇方面比次优方法高出 4 倍
  • 意外发现: 他们发现,较小的 AI 模型(70 亿参数)实际上比巨大的 700 亿参数模型更能表现出其不确定性。巨大的模型过于自信,以至于掩盖了它们的困惑,使得发现谎言变得更加困难。

总结

反向探测就像针对 AI 文本的测谎仪。与其让 AI 多说一些话以观察其是否紧张,不如将句子喂给它并观察其内部“脉搏”。如果当它试图将某个词与真实的医学事实联系起来时,“脉搏”出现漏跳,你就知道该词很可能是幻觉。它更快、更便宜,并且在发现长篇医疗报告中的具体错误方面更加精确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →