想象一下你是一名正在试图破解谜题的侦探,但你寻找的不是脚印或指纹,而是涂抹在人体皮肤上的微小、色彩斑斓的地图。这就是皮肤科的世界,医生们在这里搜寻黑色素瘤——一种如果扩散可能会致命的危险皮肤癌。长期以来,破解这个谜题完全依赖于医生的眼睛和经验。但人类的眼睛会疲劳,不同的医生对同一个斑点的看法也可能不同。于是,新的侦探登场了:人工智能(AI)以及一种被称为“深度学习”的技术。把深度学习想象成一个研究了数百万张皮肤照片的超级聪明学生。它不是通过学习像“寻找一个黑点”这样的特定规则来被教导,而是通过层层递进的方式,像孩子通过观察许多不同的猫来学会识别猫一样,通过自身学习来识别模式。这篇论文就是这些 AI 侦探的一份大规模成绩单,旨在检查它们在发现坏人并捣乱之前,表现得究竟有多好。
这篇论文本身是一篇系统综述,就像一位图书管理员,收集了 2021 年至 2026 年间关于 AI 如何利用“卷积神经网络”(CNN)来寻找黑色素瘤的所有重要文献。CNN 只是专门为观察图像而设计的某种计算机大脑的华丽称呼。作者们并非凭空猜测;他们研究了 14 项特定的研究,以观察哪些计算机大脑效果最好、它们研究了哪些图片以及它们的准确率如何。他们发现,最优秀的 AI 模型在执行这项工作时正变得极其出色。事实上,一些数字侦探的准确率达到了 95.2%,并在一项名为 AUC(衡量 AI 区分无害痣与危险痣能力的指标)的测试中得分 95.75%。在受控测试中,这种技能水平足以媲美、甚至有时能超越经验丰富的人类医生。
然而,论文非常谨慎地指出,这个谜题尚未完全解开。它指出,虽然这些 AI 模型在“训练健身房”(使用像 HAM10000 这样特定的、干净的数据集)中表现优异,但它们尚未完全证明自己能够应对混乱的现实世界。最大的障碍之一是训练数据往往是不平衡的;想象一下一个教室,其中 67% 的学生是无害的痣,而只有 11% 是黑色素瘤。AI 变得太擅长识别那些无害的痣,以至于它有时会错过那些危险的痣,这是一个风险极高的错误。论文还指出,大多数此类模型仅在浅色皮肤的人群身上进行了测试,这意味着它们对于深色皮肤的人可能效果不佳。这是一个严重的差距,就像一个在某个社区很擅长破案,但在另一个社区却束手无策的侦探。
该综述还测试了不同类型的 AI 架构(即计算机大脑的“蓝图”)。他们发现,虽然像 NASNet Large 这样更大、更复杂的蓝图听起来很厉害,但它们并不总是获胜者。在一种情况下,一个较小的、较轻量级的模型 NASNet Mobile 实际上比它的巨型兄弟表现得更好,这可能是因为那个巨型模型被有限的数据量搞糊涂了。论文建议,“ResNeXt”蓝图目前是强有力的竞争者之一,它在速度和准确性之间提供了极佳的平衡。它还强调,将图像与其他信息(如患者年龄或斑点位置)相结合,能让 AI 获得微弱的优势,就像侦探在拿到照片证据的同时,又得到了一份证人陈述。
尽管拥有这些高分,作者们警告我们,高分并不意味着 AI 已经准备好进入医院。论文认为,我们需要警惕“过拟合”,即当一名学生完美地背下了练习题的答案,但由于实际考试中的问题略有不同,导致他在正式考试中失利。为了解决这个问题,论文提出了未来的方向,例如“联邦学习”,即各医院可以共同教导 AI 而无需分享私密的患者照片(从而保护每个人的秘密),以及“可解释性”,这意味着要让 AI 展示其推导过程,通过高亮显示究竟是皮肤的哪一部分让它感到紧张。论文总结道,虽然我们已经制造出了一些了不起的工具,但我们仍然需要更多样化的数据、更好的现实世界测试,以及更清晰的规则,以确保这些数字侦探是公平、安全且准备好帮助医生拯救生命的。