✨ 要点🔬 技术摘要
想象一下,尝试教会计算机识别皮肤疾病。多年来,最优秀的 AI 系统都像是“秘密俱乐部”:它们是在只有少数大型医院才能接触到的海量私人患者照片集上训练出来的。由于这些系统的训练数据一直处于隐藏状态,其他人无法检查它们是否存在偏见、无法修复其错误,甚至无法在小型诊所的普通笔记本电脑上运行它们。这就像是一位才华横溢的医生拒绝分享其医学教科书,导致世界上大部分人都无法获得其专业知识。
要理解这篇论文中的突破,你需要了解两件事。首先,“基础模型”(foundation models)就像是超级聪明的学生,在接受特定任务测试之前,先从海量数据中学习通用模式。其次,“对比学习”(contrastive learning)是一种通过向 AI 展示属于同一类别的配对事物(例如一张皮疹的照片和“湿疹”这个词)来教学的方法,并告诉它将这些配对在脑海中拉近,同时将无关的事物推开。棘手之处在于,皮肤图像通常会同时带有许多不同的描述——诊断结果、身体部位、症状列表以及视觉概念。传统的 AI 试图将所有这些描述平均化为一个模糊的答案,从而丢失了使诊断准确的精细细节。
这篇论文介绍了 UniDerm ,这是一个全新的、完全开放的皮肤科 AI 系统,它挑战了“构建世界级医疗 AI 必须拥有秘密、私有数据”的观点。作者们(来自清华大学、百川智能及其他机构的团队)构建了一个完全基于公开可用 的图像和文本数据进行训练的模型。UniDerm 没有将皮肤病变的各种不同描述混合成一个模糊的整体,而是使用了一种被称为“监督去噪”(supervision-denoising)的巧妙技巧。你可以把它想象成一名侦探,他不仅仅是听取一群证人同时大声叫喊;相反,这位侦探会提出具体的问题(例如“这个皮疹看起来怎么样?”对比“它位于哪里?”),从而为每个特定任务获得清晰、锐利的答案。
结果令人瞩目。UniDerm 在跨越五大洲的 11 个不同基准测试中进行了测试,结果发现,尽管它仅使用公开数据进行训练,但其表现却能媲美甚至超越领先的“秘密俱乐部”模型。事实上,UniDerm 仅使用大约三分之一 的专家标签,就达到了与那些私有模型相当的高准确度。它检测皮肤癌的准确度评分(AUROC)达到了 0.946 ,高于 302 名人类专家组成的专家小组的一致结论。或许最重要的一点是,Uni-Derm 在深色肤色上表现良好(这是许多 AI 系统失效的领域),并且可以在标准计算机上运行,无需昂贵且强大的图形显卡。
该论文认为,这种方法“民主化”了医疗 AI。通过发布模型的代码、权重以及重建其训练数据的确切配方,作者们正在将钥匙交给社区。这意味着低资源地区的诊所可以自行下载、审计并改进该 AI,而不是被迫购买一种无法检查或修改的专有产品。作者们建议,这种方法可以成为在放射学或病理学等其他领域创建专家级 AI 的蓝图,证明了你不需要私密秘密也能创造公共利益。
技术摘要:UniDerm —— 一个开源皮肤科基础模型
问题陈述
皮肤疾病造成了巨大的全球疾病负担,然而,获得受过训练的皮肤科医生的机会却极其有限,尤其是在中低收入国家。虽然基础模型已展示出扩展专家级护理的潜力,但目前的先进系统(如 PanDerm)依赖于无法被大多数研究机构获取的私有临床队列。此外,这些系统通常仅发布模型权重,而不提供训练数据或训练方案,这阻碍了独立的复现、偏差审计以及社区驱动的优化。
利用公共皮肤科数据的一个具体技术挑战是“一图多文”的局限性。公共数据集通常将单张皮肤图像与多个异构文本描述(例如:诊断、身体部位、视觉概念、临床描述)配对。标准的对比学习(例如双塔 CLIP 架构)强制要求一个固定的图像嵌入同时与所有这些文本对齐。这种平均效应起到了低通滤波器的作用,丢弃了高频、特定任务的细节,并将不同的监督信号视为噪声,从而降低了模型区分细粒度特征的能力。
方法论
作者提出了 UniDerm ,这是一个完全基于公开可用图文数据训练的开源皮肤科基础模型。其核心创新是监督去噪对比学习(supervision-denoising contrastive learning) ,通过两种机制解决了“一图多文”问题:
指令调节架构(Instruction-Conditioned Architecture): 与双塔模型不同,UniDerm 使用统一的视觉-语言 Transformer。图像 (I I I ) 和自然语言系统指令 (S S S ) 被拼接成一个单一的标记流。这使得模型能够根据指令生成针对同一图像的不同任务特定嵌入(例如:“诊断此病灶”与“识别色素网格”)。
监督去噪目标: 训练目标是将指令调节后的图像嵌入 (E ( I , S ) E(I, S) E ( I , S ) ) 仅与回答该指令的特定目标文本 (T T T ) 进行匹配。这通过将多目标问题分解为单目标问题,恢复了原本会被平均化过程丢弃的细粒度监督信息。
训练数据与方案:
语料库: 模型在来自五个来源(Derm1M, ISIC2019, SCIN, PubMed Central Open Access, 和 BIOMEDICA)的 505,658 张唯一公开图像上进行训练,总计超过 570 万个“指令-目标”对。
合成: 通过多任务指令合成(诊断、ICD-11 编码、形态学描述、临床描述)和 ICD-11 本体增强(使用官方定义和硬负样本兄弟采样),将原始的“图像-文本”对扩展为特定任务的“指令-目标”对。
开放性: 模型权重、代码以及“数据方案”(即如何从公开来源重建语料库的指令)均根据 Apache-2.0 协议公开发布。未使用任何私有临床队列。
模型变体:
UniDerm: 一个拥有 20.7 亿参数的统一 Transformer。
UniDerm-VE-lite: 一个 0.1 亿参数的模型,通过对 UniDerm 的视觉编码器进行结构化剪枝并进行无标签蒸馏得到,旨在部署于仅支持 CPU 的硬件设备上。
核心贡献
全开放系统: UniDerm 是首个权重、代码和数据方案完全公开的皮肤科基础模型,实现了独立的复现与审计。
监督去噪对比学习: 一种新颖的训练范式,解决了由异构文本目标引入的噪声问题,使模型能够从公共数据中学习细粒度、任务特定的表示。
标签效率: 该模型使用比私有队列模型显著更少的专家标签,即可达到顶尖性能。
上下文感知推理: 通过将患者背景(年龄、部位、症状)直接融合进标记流,UniDerm 提高了诊断准确度,而双塔模型在加入上下文时性能往往会下降。
性能公平性: 模型在 Fitzpatrick 皮肤色调上表现出鲁棒性,特别是在许多现有系统表现不佳的深色皮肤(FST V–VI)上。
结果
UniDerm 在涵盖五大洲、八个国家的 11 个基准测试中进行了评估,包括皮肤镜摄影和临床摄影。
标签效率: 在少样本线性探测(10% 标签)中,UniDerm 的平均平衡准确率超过了私有队列模型 PanDerm 20.2 个百分点(相对增益 46.8%)。在 30% 标签时,UniDerm 达到了 PanDerm 全量标签(100%)的性能水平。
零样本性能: UniDerm 在所有七个零样本诊断基准测试中排名第一,超越了包括基于私有队列的 PanDermLIP 在内的所有公共数据模型。
读者研究:
在 Tschandl-948 子集(302 名读者小组)上,UniDerm 的零样本恶性检测(AUROC 0.917)与读者共识(AUROC 0.914)相匹配,而其少样本版本(AUROC 0.946)则显著超过了读者共识。
在多样化皮肤图像(DDI)基准测试中,UniDerm 在 FST V–VI(深色皮肤)亚组上的表现优于所有对比模型(AUROC 0.770 对比次优模型的 0.681),是唯一一个在深色皮肤上实现性能提升而非下降的模型。
效率: UniDerm-VE-lite(0.1B 参数)在所有基准测试中均优于 PanDerm(0.3B 参数),且在没有 GPU 的情况下,使用四个 CPU 线程运行速度快了 3.1 倍。
搜索能力: UniDerm 在“概念到图像”搜索和“跨模态证据”搜索方面处于领先地位,使临床医生能够基于临床特征或文本描述检索图像。
意义与主张
论文认为,UniDerm 证明了仅靠公共数据即可构建专家级医疗 AI ,挑战了“临床级性能必须依赖私有、专有队列”的假设。
民主化: 通过消除对私有数据和昂贵硬件的依赖(通过轻量化 VE-lite 变体),该模型使资源匮乏的社区能够构建、审计并拥有自己的诊断工具,而不是购买专有产品。
透明度与问责制: 全开放性允许社区进行独立的偏差审计和迭代优化,解决了私有队列系统存在的“黑盒”问题。
泛化性: 作者认为,监督去销毁范式不仅适用于皮肤科,还可以作为其他数据丰富但专家稀缺的医学领域(如放射学和病理学)的模板。
作者保持了审慎的态度,指出虽然模型达到了已发表的读者参考标准,但这些仅是回顾性比较。他们强调,在提出临床就绪性声明之前,需要进行前瞻性的多中心验证。此外,由于训练语料库受限于其组成部分中最严格的许可协议(CC BY-NC 4.0),作者发布的是“数据方案”而非聚合后的原始语料库,以符合数据许可规定。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。