← 最新论文
💻 computer science

Are Multimodal LLMs Ready for Clinical Dermatology? A Real-World Evaluation in Dermatology

本研究揭示,尽管多模态大语言模型在公开皮肤病学基准测试中展现出潜力,但其在真实临床环境中的诊断准确率显著下降,表明当前模型尚不足以可靠地用于床边部署。

原作者: Roy Jiang, Hyunjae Kim, Zhenyue Qin, Morten Lee, Margaret MacGibeny, Ailish Hanly, Angela Sadlowski, Shanin Chowdhury, Xuguang Ai, Jeffrey Gehlhausen, Qingyu Chen

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Roy Jiang, Hyunjae Kim, Zhenyue Qin, Morten Lee, Margaret MacGibeny, Ailish Hanly, Angela Sadlowski, Shanin Chowdhury, Xuguang Ai, Jeffrey Gehlhausen, Qingyu Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在招聘一名新助理,协助皮肤科医生(皮肤专科医生)从数千张患者照片和病历笔记中进行筛选。你想知道这位助理是否足够聪明,能够查看皮疹照片、阅读医生关于该皮疹的简要笔记,并说出:“这看起来像 X、Y 或 Z,我们需要立即接诊这位患者。”

这篇论文就像是一场严格的“求职面试”,旨在测试五种不同的人工智能助理(称为多模态大语言模型,或 MLLM)是否已准备好胜任这项现实世界的工作。

以下是研究人员发现的要点,使用了简单的类比:

1. “模拟考试”与“真实工作”

背景设定:
在正式聘用之前,这些 AI 助理使用公开数据集参加了“模拟考试”。这些数据集就像精心布置的摄影棚拍摄。照片质量极高,由专业医疗相机(皮肤镜)拍摄,仅显示皮肤上一个清晰的病灶,且没有任何背景杂物。在这种理想环境下,AI 助理的表现相当不错。表现最好的模型(GPT-4.1)答对了约 42% 的题目,开源模型则达到了 20% 至 26%。

现实检验:
随后,研究人员让它们接受“真实工作”测试。这涉及来自医院的 5,811 个实际患者病例。

  • 照片: 这些并非完美的影棚照片。它们是由普通医生或患者用手机拍摄的。光线不佳,构图杂乱,且往往存在多个皮疹或背景干扰(如病床或握着手机的手)。
  • 笔记: 转诊医生撰写的笔记往往简短、模糊,有时甚至对问题所在给出了错误的引导。

结果:
AI 助理的表现断崖式下跌

  • 当仅查看杂乱的现实世界照片时,表现最好的 AI 准确率从约 42% 跌至约 24%。
  • 开源模型的跌幅更为剧烈,从约 26% 跌至仅1.5% 至 13%
  • 类比: 这就像一名学生在印有清晰数字的数学考试中得了"A",但当被要求在餐巾纸上用潦草的手写体解答同样的问题时,却惨败收场。

2. “盲目信任笔记”的陷阱

研究人员测试了当 AI 同时获得医生书面笔记和照片时会发生什么。

  • 好消息: 当笔记具有帮助性时,AI 的表现有所提升。这就像给侦探提供了一条有用的线索。
  • 坏消息: AI 过于轻信。如果转诊医生在笔记中写道“我认为这是蜘蛛叮咬”,AI 往往会忽略图片,直接附和笔记内容,即使图片清晰地显示了其他情况。
  • 危险: 如果转诊医生判断错误(这在现实中很常见),AI 就会自信地重复错误的诊断。在某些情况下,添加具有误导性的笔记反而使 AI 的表现比仅查看照片时更差。其中一个模型(SkinGPT-4)在笔记具有误导性时,有 84% 的时间陷入了混乱。

3. “分诊”测试(谁需要立即帮助?)

由于 AI 难以准确命名具体疾病,研究人员提出了一个更简单的问题:“这位患者的病情是否严重且紧急?”(类似于分诊护士决定谁排在队伍最前面)。

  • 结果: AI 在这方面表现尚可,但不够出色。在提供笔记的情况下,它能识别出约 60% 的严重病例。
  • 隐患: 它漏掉了大量严重病例,且其识别能力完全取决于笔记的质量。如果笔记令人困惑,AI 就会漏掉紧急病例。

4. 它们在哪里失败了?(“眼睛”与“大脑”)

研究人员请人类皮肤科医生对 AI 的推理过程进行评分。他们发现了一个令人惊讶的事实:

  • AI 的“大脑”(推理)没问题。 AI 掌握医学事实,并能写出听起来很专业的句子。
  • AI 的“眼睛”(视觉)是问题所在。 AI 失败的原因在于它无法准确描述皮疹的具体视觉细节。它只会说一些笼统的话,比如“有一个红点”,而无法注意到定义某种疾病的特定形状或纹理。
  • 类比: 想象一名学生背诵了整本字典,能写出完美的文章,但当给他看一张猫的照片时,他却说不出猫有胡须或尖耳朵。他知道关于猫的词汇,却无法看见猫。

结论

该论文得出结论:这些 AI 模型尚未准备好在真实的皮肤科诊所中独立工作。

  • 基准测试具有误导性: 仅仅因为 AI 在干净、完美的数据集上表现良好,并不意味着它能应对医院中混乱的现实。
  • 瓶颈不在于“思考”: 问题不在于 AI 无法推理,而在于它无法在现实世界的照片中准确“看”清皮肤,且容易受到糟糕笔记的干扰。
  • 安全警告: 在 AI 能够更好地查看杂乱照片并忽略误导性笔记之前,不能信任它在没有人类医生监督的情况下做出决策。

简而言之:AI 是一名通过了笔试的聪明学生,但在实际驾驶考试中却不及格。在能够驾驶这辆车之前,它需要在现实世界的“路况”上接受更多训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →