← 最新论文
💻 computer science

DALPHIN: Benchmarking Digital Pathology AI Copilots Against Pathologists on an Open Multicentric Dataset

本文介绍了 DALPHIN,这是首个面向数字病理人工智能协作者的多中心开放基准,该基准针对 130 种诊断评估了通用模型和病理专用模型在 31 位病理学家中的表现,并发现 PathChat+ 在六项任务中的四项达到了专家级水平。

原作者: Carlijn Lems, Sander Moonemans, Natálie Klubíčková, Biagio Brattoli, Taebum Lee, Seokhwi Kim, Veronica Vilaplana, Laura Pons, Sapir Hochman, Mauricio Eduardo Suárez-Franck, Pedro Luis Fernandez, Juliu
发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Carlijn Lems, Sander Moonemans, Natálie Klubíčková, Biagio Brattoli, Taebum Lee, Seokhwi Kim, Veronica Vilaplana, Laura Pons, Sapir Hochman, Mauricio Eduardo Suárez-Franck, Pedro Luis Fernandez, Julius Drachneris, Donatas Petroska, Renaldas Augulis, Arvydas Laurinavicius, Domingos Oliveira, Diana Montezuma, Anouk B. Bouwmeester, Dominique van Midden, Anne-Marie Vos, Shoko Vos, Jolique van Ipenburg, Maschenka Balkenhol, Koen Winkler, Iris Nagtegaal, Konnie Hebeda, Uta Flucke, Katrien Grünberg, Josef Skopal, Brinder S. Chohan, Jordi Temprana-Salvador, Enrico Munari, Luca Cima, Giulia Querzoli, Yosamin Gonzalez Belisario, Jaeike W. Faber, Geert J. L. H. van Leenders, Jan H. von der Thüsen, Lodewijk A. A. Brosens, Ronald R. de Krijger, Pieter Wesseling, Sandrine Florquin, Mateusz Maniewski, Adam Kowalewski, Robert Barna, Dina Tiniakos, Joan Lop Gros, Rogier Donders, Jake S. F. Maurits, Ming Yang Lu, Chengkuan Chen, Faisal Mahmood, Jeroen van der Laak, Nadieh Khalili, Frédérique Meeuwsen, Francesco Ciompi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一场规模宏大、 stakes 极高的烹饪比赛。一方是三位名厨(AI 模型),他们读遍了世界上所有的食谱;另一方则是由 31 位人类评委组成的评审团,从本地家庭厨师到享誉全球的米其林星级专家,无所不包。挑战是什么?他们都被给予一种单一而神秘的食材(一张组织显微图像),并被要求描述它是什么、是否“有害”(癌变),以及它可能对应哪道具体的菜肴。

这篇题为DALPHIN的论文,就是这场比赛的成绩单。这是首次有人组织了一场公平、公开的测试,以检验这些"AI 名厨”是否真能协助真正的医生(病理学家)诊断疾病,还是仅仅是一些花哨的猜测者。

以下是事件 breakdown,使用简单的类比:

1. 竞技场:“秘密食谱”大赛

通常,当你测试 AI 时,你会给它一份练习题,然后让它在学习答案后再参加正式考试。那是作弊。

DALPHIN 团队为答案建立了一个安全、上锁的保险库。他们创建了一个包含来自六个国家的 300 个真实医疗案例的数据集,涵盖 130 种不同类型的疾病(从常见的皮肤问题到罕见的肿瘤)。

  • 转折:AI 模型必须回答关于这些图像的问题,但在完成之前,它们无法看到“正确答案”。答案被保存在数字保险库中,仅可通过一个自动评分的安全计算机系统访问。这确保了没有人能通过死记硬背考题来作弊。

2. 参赛选手

该论文测试了三位特定的“名厨”:

  • GPT-5:通用型 AI(像一本超级聪明的百科全书,对万事万物都略知一二)。
  • Gemini 2.5 Pro:另一款通用型 AI(同样非常聪明,但拥有不同的“大脑”)。
  • PathChat+:专门针对医学教科书和病理图像训练的专家型 AI(像一位只烹饪意大利菜的厨师)。

3. 挑战(问题)

AI 和人类评委被要求完成四项主要任务,模拟医生观察玻片的过程:

  1. “这是什么?”测试:观察模糊的概览图和放大的细节图,你能判断出它是肺组织、皮肤还是肝脏吗?
  2. “它有害吗?”测试:这里是否有肿瘤?(是/否)。
  3. “它有多严重?”测试:如果有肿瘤,它是无害的(良性)、危险的(恶性),还是介于两者之间?
  4. “它确切是什么?”测试:给出具体的诊断名称,或回答关于该疾病的棘手多项选择题。

4. 结果:谁赢了?

专家 vs. 通才
专家型 AI(PathChat+)在“诊断”类别中是当之无愧的赢家。它的表现几乎与专家级人类医生相当。就像一位主厨,只需尝一口酱汁就能立刻说出:“那是经典的博洛尼亚肉酱。”

  • 通才(GPT 和 Gemini) 在具体的医学名称上表现较为吃力。它们就像普通的厨师,能告诉你那是“汤”,却难以准确说出具体是哪道食谱。

“过度自信”与“缺乏自信”的厨师
论文发现 AI 存在一些有趣的性格特征:

  • Gemini 是“警报狂”。它倾向于在没有肿瘤的地方看到肿瘤。就像一名保安,认为每个阴影都是小偷。它非常擅长捕捉真正的肿瘤,但也过于频繁地“狼来了”。
  • GPT 是“怀疑论者”。它倾向于漏掉肿瘤,认为一切正常。就像一名保安,因为“可能只是风”而忽略可疑的噪音。它非常擅长确认事物是安全的,却漏掉了坏东西。

人类因素
人类评委分为三组:

  • 专家:顶级专科医生。
  • 半专家:了解该领域但并非顶尖 1% 的医生。
  • 非专家:住院医师(受训者)或不专攻该特定身体部位的医生。

大惊喜
在许多任务中,AI 模型(尤其是 PathChat+)的表现与非专家人类相当,有时甚至能与半专家媲美。然而,在最具挑战性的任务中(如诊断罕见癌症或复杂细节),专家人类仍然胜过所有人,包括 AI。

5. “上下文”陷阱

研究人员测试了两种提问方式:

  • 独立式:一次问一个问题,像问答节目。
  • 上下文式:连续提问,AI 会记住它在上一个问题中的回答。

他们发现,记住对话(上下文式)有助于 AI 保持一致性,但也存在缺点:如果 AI 在第一个问题中犯了错,它往往会在第二个问题中加倍坚持这个错误。就像一名侦探,如果第一个线索搞错了,就会基于这个错误构建整个理论。

6. 核心结论

这篇论文并没有说"AI 已准备好取代医生”。相反,它指出:

  • AI 在特定医疗任务上变得非常出色,有时能达到受训住院医师或半专科医生的水平。
  • 不同的 AI 拥有不同的性格。有些过于胆小(漏掉东西),有些过于偏执(看到不存在的东西)。
  • 我们需要一种公平的测试方式。DALPHIN 基准就像是一个永久、安全的测试场,让我们能够追踪这些 AI 模型随时间的进步(或失败),而无需担心它们作弊。

简而言之,这些 AI 副驾驶就像非常聪明、充满干劲的实习生。它们很有帮助且经常正确,但仍需要经验丰富的专家(人类病理学家)进行复核,尤其是在病例罕见或棘手的情况下。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →