← 最新论文
💬 NLP

Disentangling Ambiguity from Instability in Large Language Models: A Clinical Text-to-SQL Case Study

本文介绍了 CLUES,这是一个通过将语义不确定性分解为不同的评分,从而将输入歧义与模型不稳定性从临床文本到 SQL(Text-to-SQL)任务中解耦的框架,进而实现相比现有方法更具针对性的干预和更高效的错误分诊。

原作者: Angelo Ziletti, Leonardo D'Ambrosi

发布于 2026-07-09
📖 2 分钟阅读☕ 轻松阅读

原作者: Angelo Ziletti, Leonardo D'Ambrosi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图利用超级智能 AI 助手来破解谜题的侦探。你向它提出了一个关于海量医疗记录的问题,比如:“有多少位 18 岁以上的患者患有特应性皮炎?”AI 可能会返回一个 SQL 查询(一种向数据库提问的特殊语言)和一个答案。但问题在于,有时 AI 会出错,而且它出错的方式有两种截然不同的原因。

这篇名为《通过熵与 Schur 分解解构大型语言模型中的歧义性与不稳定性》(Disentangling Ambiguity from Instability in Large Language Models)的论文介绍了一种新的侦探工具——CLUES。它的主要任务是弄清楚 AI 为什么会感到困惑。是因为问题本身是一个具有多种含义的谜题(歧义性/Ambiguity)?还是因为 AI 只是状态不佳、表现得有些反复无常(不稳定性/Instability)?

两种类型的困惑

把 AI 的大脑想象成一个厨房。

1. 歧义问题(谜题)
想象你对厨师说:“给我做一个三明治。”

  • 解释 A: “做一个火鸡三明治,不要加蛋黄酱。”
  • 解释 B: “做一个火腿三明治,多加点奶酪。”
    如果厨师把这两个都做了,结果你得到了两个不同的三明治,这就是歧义性。问题不在于厨师的烹饪技巧,而在于你的订单太模糊了。在医疗领域,询问“18 岁以上的人有多少?”是很棘手的。这个“18 岁以上”是指他们现在的年龄,还是指他们初次确诊时的年龄?如果 AI 猜错了意思,它就会给出错误的答案。论文建议,当这种情况发生时,应该询问人类:“嘿,你是说现在的年龄,还是确诊时的年龄?”

2. 不稳定性问题(反复无常的厨师)
现在,你给厨师一个非常清晰的订单:“做一个火鸡三明治,不要加蛋黄酱。”

  • 尝试 1: 一个完美的火鸡三明治。
  • 尝试 2: 一个烤焦了的火鸡三明治。
  • 尝试 3: 一个带了蛋黄酱的火鸡三明治(哎呀!)。
    在这里,订单非常完美,但厨师的表现很不稳定。这就是不稳定性。AI 对自己的内部规则感到困惑,或者只是出现了小故障。论文建议,在这种情况下,你不应该询问人类进行澄清;你应该将该答案标记出来,交由人类进行复核或修正 AI 的训练。

旧方法 vs. CLUES 方法

在此论文之前,研究人员使用一个单一的分数(称为核语言熵,简称 KLE)来衡量 AI 回答的“混乱程度”。

  • 旧方法: 如果 AI 给出了五个不同的答案,分数就会上升。但旧的分数无法告诉你为什么。是因为问题是个谜题,还是因为 AI 在出故障?这就像一个只会在着火时尖叫“起火了!”却无法告诉你到底是真正的火灾还是仅仅烧焦了面包的烟雾报警器。
  • 论文的观点: 作者明确反对仅使用单一分数。他们认为,你必须将两种类型的困惑区分开来,才能知道下一步该做什么。

CLUES 如何运作:神奇的图表

作者构建了一个名为 CLUES(通过熵与 Schur 分解实现的条件语言不确定性)的框架。他们将 AI 的思考过程视为一个两阶段的表演:

  1. 第一阶段(解释): AI 猜测问题可能意味着什么。它写下几种不同版本的提问方式。
  2. 第二阶段(回答): 对于每一个版本的提问,AI 都会尝试多次回答。

为了衡量困惑程度,他们绘制了一张巨大的地图(一个“二分语义图”)。

  • 地图的一侧是问题(解释)。
  • 另一侧是答案
  • 他们用线将两者连接起来。如果两个问题很相似,线就粗;如果两个答案很相似,线也粗。

然后,他们使用了一个高级数学技巧——Schur 补(想象它是一个数学过滤器,可以减去“问题的困惑度”)。

  • 结果: 他们得到了两个独立的分数:
    • HIH_I(歧义性得分): 问题之间差异的大小。
    • HRIH_{R|I}(不稳定性得分): 即使问题固定下来后,答案之间的差异大小。

这些数字说明了什么

团队在两种类型的谜题上进行了测试:

  1. 通用常识: 他们使用了来自 AmbigQASituatedQA 的 300 个问题。

    • 他们发现,新的不稳定性得分HRIH_{R|I})在预测 AI 何时失败方面,比旧的单一得分表现得好得多。
    • 例如,在 KimiK2 模型上,旧分数的预测准确率(AUROC)为 0.663,而新的 CLUES 得分跃升至 0.770
    • 他们还注意到,如果只是简单地尝试将两个分数相减(一种“天真”的方法),效果会非常糟糕,经常出现负数(37% 到 60% 的情况)。这证明了他们复杂的数学技巧是必要的。
  2. 医疗记录(实战演练): 他们在一个包含 2,180 个问题的临床 Text-to-SQL 数据集上进行了测试。

    • 在这里,新的得分表现更出色。旧分数的准确率为 0.600,而 CLUES 达到了 0.762
    • 他们发现,“不稳定性”得分在识别 AI 是否处于反复无常状态方面特别有效。

“机制”策略:分类处理混乱

论文建议根据这两个得分将每个问题归入四个“机制”(Regimes)之一:

  • 机制 I(自信型): 低歧义性,低不稳定性。-> 自动回答。
  • 机制 II(歧义型): 高歧义性,低不稳定性。-> 请求人类进行澄清。
  • 机制 III (不稳定性): 低歧义性,高不稳定性。-> 标记以供人工复核。
  • 机制 IV (复合型): 高歧义性,高不稳定性。-> 两者兼顾!

这种分类法是提高效率的游戏规则改变者。在他们的部署测试中,他们发现机制 IV(混乱的高风险区)包含了 51% 的所有错误,尽管它只占总问题的 25%

  • 核心结论: 如果你只把这混乱的 25% 的问题交给人类检查,你就能抓住一半的错误!这比随机检查问题要高效两倍。

他们有多确定?

作者对他们的结果相当自信,但也谨慎地没有过度夸大其发现的性质。

  • 他们通过在特定数据集(AmbigQA、SituatedQA 以及他们的临床基准测试)上的经验证据,展示验证了该框架的有效性,而不是提供关于底层方程的理论数学证明。
  • 他们在类似于现实世界的设置中测量了改进情况,表明新得分能更一致地识别失败。
  • 然而,他们承认在现实世界的部署中(例如在他们的测试中,错误仅占约 4.4%),该系统尚不完美。它是一个很好的“分诊”(排序)工具,但它并不能自动解决所有问题。
  • 他们还指出一个局限性:该系统需要先生成多个解释,这会消耗更多的计算资源。如果生成解释的 AI 本身很差,整个系统可能会变得困惑。

总结

这篇论文并不声称已经“解决了”AI 的不确定性。相反,它提出通过使用两阶段过程和特殊的数学过滤器(Schur 补),我们终于可以区分开“令人困惑的问题”和“出故障的 AI”。这让我们能够停止盲目猜测,转而采取正确的行动:当问题模糊时请求帮助,或者当 AI 表现不稳定时复核其工作。这是让 AI 医生和研究人员变得更安全、更可靠的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →