← 最新论文
📄 health informatics

How Best to Explain Machine Learning Models to Clinicians: A User Study of Explanation Types

这项涉及 39 名临床医生的用户研究表明,虽然基于归因的解释在临床环境中能最显著地增强对机器学习预测的信任度和理解度,但近半数参与者更倾向于查看多种类型的解释,这表明未来的实现方案应在优先采用归因方法的同时,提供针对特定临床角色定制的多样化格式。

原作者: Brown, B., Oguss, M., Carey, K. A., Martin, J., Kotula, C. A., Nguyen, O. T., Akel, M., Wiegmann, D. A., Edelson, D. P., Mayampurath, A., Churpek, M. M., Craven, M.

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Brown, B., Oguss, M., Carey, K. A., Martin, J., Kotula, C. A., Nguyen, O. T., Akel, M., Wiegmann, D. A., Edelson, D. P., Mayampurath, A., Churpek, M. M., Craven, M.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你构建了一个超级聪明的机器人医生,它可以通过观察病人的数据来预测他们是否即将生病。但问题在于:这个机器人是一个“黑盒”。它会给出一个答案,但不会告诉你为什么。这就像一个神奇 8 号球,只会说“是的,危险!”,却拒绝解释它是通过哪颗水晶球看到了这一切。

为了解决这个问题,这篇论文中的研究人员决定测试三种不同的向现实生活中的医生(护士和医师)解释机器人思维的方式。他们想看看哪种解释风格能让医生更信任机器人、理解得更好,并真正改变他们对病人病情判断的看法。

三种“手电筒”风格

团队测试了三种不同的方式,来为机器人的决策照亮光芒:

  1. 归因手电筒(“计分卡”): 这种方法给每一项数据都打一个分。这就像老师在批改试卷,并高亮显示哪些答案是对是错,以及每个答案值多少分。它会说:“你的心率很高,这为风险评分增加了 4.5 分。”
  2. 反事实手电筒(“如果……会怎样”): 这个玩法是在玩一场“如果……会怎样”的游戏。它向医生展示如何改变病人的各项数值以获得不同的结果。这就像是一个电子游戏里的作弊码,它会说:“如果你降低心率并提高血压,机器人就会停止大喊‘危险!’”
  3. 基于规则的手电筒(“食谱”): 这种方法提供了一份简单的规则列表,就像一份烹饪食谱。它会说:“如果 乳酸值高 且 呼吸频率快,那么 机器人就会预测有危险。”

大揭秘:计分卡胜出

在向 39 名医生和护士展示了这三种风格后,结果非常明确。归因手电筒(计分卡) 是明显的赢家。

  • 信任度: 当医生看到计分卡时,他们比看到其他两种风格时更信任机器人的预测。
  • 理解度: 计分卡是最容易理解的。医生觉得他们真的“搞懂了”。
  • 影响力: 这是最重要的一部分。计分卡实际上改变了医生对重要性的看法。当他们看到计分卡时,他们更有可能说:“噢,我之前对导致风险的原因理解错了;机器人正指向另外一些东西。”

论文指出,虽然其他两种方法(“如果……会怎样”和“食谱”)很有帮助,但它们的力量不及计分卡。在自由文本评论中,“如果……会怎样”这种风格其实是最不受欢迎的,许多医生觉得它令人困惑或不太有用。

医生 vs. 护士:两种工作流的故事

这里有一个有趣的转折:两类医疗专业人员的反应不同。

  • 医师: 在看到解释之前,他们就已经对这些解释很感兴趣了。但在使用了计分卡之后,他们的兴趣增长了。这就像是他们心想:“我知道这很重要,但现在我看到了它如何帮助我做出重大决策。”
  • 护士: 他们从一开始就认为解释很重要,但看到解释并没有改变他们的想法。论文认为,这可能是因为护士通常遵循严格的、循序渐进的方案(比如清单),所以复杂的解释并不会像对于需要从零开始进行诊断的医生那样,改变他们的工作流程。

医生们想要什么

这项研究还询问了医生们希望在屏幕上看到什么。

  • 多多益善(但不要太多): 近一半的医生(46.2%)表示,他们希望同时看到三种类型的解释。他们不想只选其一;他们想把计分卡、“如果……会怎样”以及食谱全部放在一起,以获得全貌。
  • 简洁明快: 当涉及到细节时,医生们想要“短小精悍”的版本。大约 77% 的人希望计分卡只显示最重要的前几个特征,而不是列出一长串所有内容。同样,84% 的人希望看到一份简短的规则列表,而不是一篇长篇大论的食谱。

这篇论文并没有说的事情

了解这项研究并未证明什么非常重要。研究人员并没有说这些解释让机器人医生变得完美,或者保证在现实世界中能带来更好的患者预后。他们仅仅测量了医生在调查中所表达的说法想法。他们也没有在每一种可能的机器人医生或每一种类型的医院上测试这些方法。研究结果是基于一个特定的、使用时间序列数据(如病人随时间变化的生命体征)训练的机器人,以及来自两所大学的 39 名特定医生和护士。

底线结论

如果你正在为医院构建一个机器人医生,不要只给人类提供单一的解释。论文建议你应该优先考虑归因计分卡,因为它能建立最多的信任和理解。然而,由于许多医生想要看到全部内容,你可能应该展示计分卡加上其他风格,但要保持列表简短且易于阅读。同时记住,如果你是在和护士交流,解释可能不会像对医生那样改变他们的工作流程,因此请根据情况调整你的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →