DALPHIN: Benchmarking Digital Pathology AI Copilots Against Pathologists on an Open Multicentric Dataset
本文介绍了 DALPHIN,这是首个面向数字病理人工智能协作者的多中心开放基准,该基准针对 130 种诊断评估了通用模型和病理专用模型在 31 位病理学家中的表现,并发现 PathChat+ 在六项任务中的四项达到了专家级水平。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一场规模宏大、 stakes 极高的烹饪比赛。一方是三位名厨(AI 模型),他们读遍了世界上所有的食谱;另一方则是由 31 位人类评委组成的评审团,从本地家庭厨师到享誉全球的米其林星级专家,无所不包。挑战是什么?他们都被给予一种单一而神秘的食材(一张组织显微图像),并被要求描述它是什么、是否“有害”(癌变),以及它可能对应哪道具体的菜肴。
这篇题为DALPHIN的论文,就是这场比赛的成绩单。这是首次有人组织了一场公平、公开的测试,以检验这些"AI 名厨”是否真能协助真正的医生(病理学家)诊断疾病,还是仅仅是一些花哨的猜测者。
以下是事件 breakdown,使用简单的类比:
1. 竞技场:“秘密食谱”大赛
通常,当你测试 AI 时,你会给它一份练习题,然后让它在学习答案后再参加正式考试。那是作弊。
DALPHIN 团队为答案建立了一个安全、上锁的保险库。他们创建了一个包含来自六个国家的 300 个真实医疗案例的数据集,涵盖 130 种不同类型的疾病(从常见的皮肤问题到罕见的肿瘤)。
- 转折:AI 模型必须回答关于这些图像的问题,但在完成之前,它们无法看到“正确答案”。答案被保存在数字保险库中,仅可通过一个自动评分的安全计算机系统访问。这确保了没有人能通过死记硬背考题来作弊。
2. 参赛选手
该论文测试了三位特定的“名厨”:
- GPT-5:通用型 AI(像一本超级聪明的百科全书,对万事万物都略知一二)。
- Gemini 2.5 Pro:另一款通用型 AI(同样非常聪明,但拥有不同的“大脑”)。
- PathChat+:专门针对医学教科书和病理图像训练的专家型 AI(像一位只烹饪意大利菜的厨师)。
3. 挑战(问题)
AI 和人类评委被要求完成四项主要任务,模拟医生观察玻片的过程:
- “这是什么?”测试:观察模糊的概览图和放大的细节图,你能判断出它是肺组织、皮肤还是肝脏吗?
- “它有害吗?”测试:这里是否有肿瘤?(是/否)。
- “它有多严重?”测试:如果有肿瘤,它是无害的(良性)、危险的(恶性),还是介于两者之间?
- “它确切是什么?”测试:给出具体的诊断名称,或回答关于该疾病的棘手多项选择题。
4. 结果:谁赢了?
专家 vs. 通才
专家型 AI(PathChat+)在“诊断”类别中是当之无愧的赢家。它的表现几乎与专家级人类医生相当。就像一位主厨,只需尝一口酱汁就能立刻说出:“那是经典的博洛尼亚肉酱。”
- 通才(GPT 和 Gemini) 在具体的医学名称上表现较为吃力。它们就像普通的厨师,能告诉你那是“汤”,却难以准确说出具体是哪道食谱。
“过度自信”与“缺乏自信”的厨师
论文发现 AI 存在一些有趣的性格特征:
- Gemini 是“警报狂”。它倾向于在没有肿瘤的地方看到肿瘤。就像一名保安,认为每个阴影都是小偷。它非常擅长捕捉真正的肿瘤,但也过于频繁地“狼来了”。
- GPT 是“怀疑论者”。它倾向于漏掉肿瘤,认为一切正常。就像一名保安,因为“可能只是风”而忽略可疑的噪音。它非常擅长确认事物是安全的,却漏掉了坏东西。
人类因素
人类评委分为三组:
- 专家:顶级专科医生。
- 半专家:了解该领域但并非顶尖 1% 的医生。
- 非专家:住院医师(受训者)或不专攻该特定身体部位的医生。
大惊喜:
在许多任务中,AI 模型(尤其是 PathChat+)的表现与非专家人类相当,有时甚至能与半专家媲美。然而,在最具挑战性的任务中(如诊断罕见癌症或复杂细节),专家人类仍然胜过所有人,包括 AI。
5. “上下文”陷阱
研究人员测试了两种提问方式:
- 独立式:一次问一个问题,像问答节目。
- 上下文式:连续提问,AI 会记住它在上一个问题中的回答。
他们发现,记住对话(上下文式)有助于 AI 保持一致性,但也存在缺点:如果 AI 在第一个问题中犯了错,它往往会在第二个问题中加倍坚持这个错误。就像一名侦探,如果第一个线索搞错了,就会基于这个错误构建整个理论。
6. 核心结论
这篇论文并没有说"AI 已准备好取代医生”。相反,它指出:
- AI 在特定医疗任务上变得非常出色,有时能达到受训住院医师或半专科医生的水平。
- 不同的 AI 拥有不同的性格。有些过于胆小(漏掉东西),有些过于偏执(看到不存在的东西)。
- 我们需要一种公平的测试方式。DALPHIN 基准就像是一个永久、安全的测试场,让我们能够追踪这些 AI 模型随时间的进步(或失败),而无需担心它们作弊。
简而言之,这些 AI 副驾驶就像非常聪明、充满干劲的实习生。它们很有帮助且经常正确,但仍需要经验丰富的专家(人类病理学家)进行复核,尤其是在病例罕见或棘手的情况下。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。