← 最新论文
🤖 AI

A Comparative Explainability Framework for DeBERTa-v3 in Zero-Shot Medical Abstract Classification

本文提出了一种比较解释性框架,通过评估五种归因方法的一致性来审计 DeBERTa-v3 对医学摘要的零样本分类,揭示了解释稳定性与预测确定性之间的相关性,并识别了如词汇过度敏感性之类的系统性失效模式,以指导未来的模型改进。

原作者: Javier Diaz Esteban-Herreros, David Muñoz-Valero, Raquel Martínez-España, Jose M. Juarez, Juan Moreno-Garcia

发布于 2026-10-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Javier Diaz Esteban-Herreros, David Muñoz-Valero, Raquel Martínez-España, Jose M. Juarez, Juan Moreno-Garcia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的世界中,计算机在阅读和理解人类语言方面已变得异常出色。它们可以在几秒钟内扫描数千份医学报告,发现人类医生可能需要数小时才能找到的模式。这些系统通常构建在被称为“Transformer”的复杂结构之上,它们就像强大的引擎,通过观察词语之间的相互关系来处理文本。然而,一个重大问题依然存在:尽管这些引擎非常准确,但它们往往是不透明的。它们以“黑盒”的形式运作,在给出诊断或分类的同时,并不解释是哪些特定的词汇导致了该结论。在医疗这一高风险领域,错误的判断可能会影响患者的安全,医生不能仅仅因为机器给出了输出就盲目信任它,而不了解其推理过程。如果计算机说一名患者患有某种特定疾病,医生需要知道机器注意到的是正确的症状,还是被某个误导性的词汇所欺骗。这种对透明度的需求催生了一个致力于打开“黑盒”的领域,试图让这些机器的内部逻辑对人类可见且可理解。

一组研究人员开展了一项测试,旨在检验当我们要求一个先进语言模型在没有任何特定医学数据训练的情况下对医学摘要进行分类时,我们目前能多好地观察其内部情况。他们专注于一个名为 DeBERTa-v3 的模型,该模型以其理解语言细微差别能力而闻名。研究人员并没有教模型识别疾病;相反,他们要求模型基于其已经学到的通用知识来猜测医学文本的类别,这种方法被称为“零样本学习”(zero-shot learning)。为了实现这一点,他们将任务视作一个逻辑谜题:对于每篇医学摘要,模型都被要求判断该文本是否支持对某一疾病类别的特定描述。他们在五种不同的疾病组上进行了测试:癌症、消化系统问题、神经系统疾病、心血管问题,以及一个涵盖一般或全身性疾病的广泛笼统类别。

他们调查的核心在于观察使用不同方法来解释模型决策时的意见是否一致。想象一下,向五位不同的专家提问,让他们指出句子中导致某个结论的最重要词汇。如果这些专家是可靠的,他们应该会指向大致相同的词汇。研究人员使用了五种不同的技术来生成这些解释,其范围从将模型视为一个需要从外部探测的谜团的方法,到直接观察模型内部数学路径的方法。随后,他们比较了针对同一段文本、每种方法所强调的前二十个单词列表。他们测量了这些列表的重叠程度,本质上是在问:“这些不同的观察模型的方式是否看到了相同的东西?”

结果揭示了一个清晰且具有启发性的模式。当模型对癌症或心脏病等特定疾病进行分类时,不同的解释方法在很大程度上是一致的。它们都会指向相同的关键医学术语,例如针对癌症指向“转移性”(metastatic),针对消化系统问题指向“肝脏”(liver)。在这些情况下,模型是自信的,且解释是稳定的,这表明系统确实在使用正确的临床逻辑。然而,当模型面对广泛的一般医学状况类别时,情况发生了剧烈变化。在这里,模型的准确度显著下降,且不同的解释方法不再达成一致。不同方法强调的不再是共享的一组医学术语,而是转向了完全不同的词汇,通常漂移向常见的语法颗粒或无关的术语。解释工具之间缺乏一致性,这成为了一个警告信号,表明模型正处于挣扎状态,且其决策并非基于坚实的临床基础。

通过详细观察模型在这一通用类别中所犯的错误,研究人员确定了该系统失效的三种具体方式。首先,模型表现出对特定词汇的过度敏感。如果文本中包含像“活检”(biopsy)或“恶性”(malignancy)这样强力的单个词汇,即使其余文本描述的是没有癌症背景的常规程序,模型也会立即跳向癌症诊断。其次,模型在语义重叠方面存在困难。当一段文本描述涉及血管的全身性问题时,模型经常会将其与特定的心脏状况混淆,无法权衡事实——即问题实际上是在影响全身而非仅仅是心脏。最后,当文本缺乏明确的主导线索时,模型的解释会完全崩溃。重要词汇散落在句子中,模型似乎会抓住诸如“它”(it)或“诊断”(diagnose)之类的随机语法词,而不是形成连贯的临床理由。

研究得出结论,在医学领域仅依赖单一方法来解释人工智能的决策是不够的。由于不同的方法可能会产生如此迥异的结果,尤其是在模型不确定时,医生和监管机构需要观察多种解释工具之间的一致性。如果工具达成一致,则决策可能是值得信赖的。如果它们产生分歧,则表明模型感到困惑,或者它试图分类的类别过于模糊。研究人员建议,为了使医疗 AI 具备安全性且可审计,我们应该专注于特定、定义明确的疾病类别,而不是广泛的一般标签。通过将范围缩小到清晰的临床定义,我们可以确保 AI 的推理保持稳定,并确保其提供的解释对人类专家真正有用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →