← 最新论文
🧬 biology

Expert Evaluation of Clinical AI Tools on Real Point-of-Care Clinical Queries

由 30 个专科领域的 149 名医生进行的盲测评估表明,一款专门的临床 AI 工具在处理真实世界的临床诊疗查询时,表现显著优于三款前沿通用型大语言模型,这凸显了使用专家评审和真实临床数据来评估医疗 AI 的至关重要性。

原作者: Jean Feng, Vishal Patel, Patrick Heagerty, Yifan Mai, Venkatesh Sivaraman, Patrick Vossler, Jialin Ouyang, Anupam B. Jena

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Jean Feng, Vishal Patel, Patrick Heagerty, Yifan Mai, Venkatesh Sivaraman, Patrick Vossler, Jialin Ouyang, Anupam B. Jena

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下你是一位正试图决定哪本食谱最适合你餐厅的厨师。你有两个选择:

  1. “通才型”书籍: 巨大的百科全书,它们对各种事物(烹饪、历史、科学,甚至如何修理汽车)都略知一二。
  2. “专才型”书籍: 一本专门针对你所从事的菜系编写的食谱,里面充满了只做这类特定食物的大师级厨师的技巧。

通常,当人们测试这些书籍时,他们会问类似“法国的首都是哪里?”或“如何煮鸡蛋?”这样的问题。这些都是简单的、虚构的问题。但在现实世界中,厨师不会问“如何煮鸡蛋?”而是会问:“我的汤太咸了,但我不能加水,因为汤底已经很完美了;我该怎么办?”

这篇论文是一场大规模的盲测,旨在看看哪种“食谱”(AI 工具)能真正帮助医生解决他们每天面临的真实且棘手的难题。

测试设置:一场盲测

研究人员收集了 620 个真实问题,这些是医生在治疗患者时向名为 OpenEvidence (OE) 的专业医疗 AI 工具提出的真实问题。这些不是虚构的考试题;而是医生当下真正需要知道的事情。

他们将这些问题输入到四个不同的 AI “厨师”中:

  • 三个通才: 最先进、功能最强大的“全能型”AI(GPT-5.5、Gemini 3.1 Pro 和 Claude Opus 4.8)。
  • 一个专才: OpenEvidence (OE),一个专为医生打造的工具。

随后,他们聘请了来自 36 个不同州的 149 名真实医生 来担任评委。为了确保公平,他们让评委与问题进行匹配。如果问题是关于心脏病的,则由心脏病专家进行评分;如果是关于皮肤问题的,则由皮肤科医生进行评分。医生并不知道哪个答案是由哪个 AI 编写的(这是“盲测”),就像烹赛事的评委在最后才知道厨师的名字一样。

结果:专才胜出

医生们从五个维度对答案进行了评分:

  1. 准确性 (Accuracy): 事实是否正确?
  2. 实用性 (Usefulness): 我真的能用它来帮助病人吗?
  3. 来源质量 (Source Quality): 它是否引用了优秀、可靠的书籍或期刊?
  4. 可验证性 (Verifiability): 我能否轻松核实其真实性?
  5. 完整性 (Completeness): 它是否回答了整个问题?

结果: 专用工具(OpenEvidence)在每一个类别中都胜出了。它大幅超越了那些通才巨头。

  • 在“准确性”类别中,专才被选中的频率比通才高出约 25% 到 39%
  • 在“来源质量”方面,专才的领先优势接近 40%

通才 AI(那些“全能型”模型)表现并不差,但它们在这些特定任务面前始终处于劣势,被专门为该工作打造的工具所超越。

“机器人评委”实验

研究人员还尝试了一个有趣的做法:让他们让 AI 模型互相评价彼此的答案(即“机器人评委”)。

  • 问题: 机器人评委往往过度自信且带有偏见。例如,GPT 模型倾向于给自己打高分,即使人类医生认为它是错误的。
  • 教训: 虽然机器人评委在“谁是整体最佳”这一点上与人类达成了一致,但在细节上却与人类存在分歧。你不能仅仅让一个 AI 去给另一个 AI 打分,而不经过真实人类专家的检验。

为什么这很重要(根据论文观点)

这篇论文提出了两个主要观点:

  1. 真实的测试需要真实的问题: 如果你只在虚构的考试题目上测试 AI,你并不知道它在现实世界中的表现如何。你需要用医生实际提出的那些复杂且具体的问题来测试它。
  2. 专业化取胜: 仅仅因为一个通用 AI 很聪明,并不意味着它是处理特定任务的最佳工具。专才工具的胜出并不意味着通才模型没用;它意味着针对特定领域(如医学)对 AI 进行定制化,会使其在该特定工作上表现得更好。

论文并未提及的内容

  • 没有说这些工具应该取代医生。
  • 没有说通才 AI 在所有方面都很“差”;它们只是在处理这些特定的医疗问题时不如专才出色。
  • 没有声称这是对 AI 的最终定论,因为这些模型更新迭代非常迅速。

简而言之: 当你需要一位医生来帮助解决特定的医疗问题时,一个专门为医生打造的工具比一个试图做所有事情的通用“聪明型”AI 效果更好。而且,要找出哪种工具最好,你必须用真实的医生和真实的问题去测试,而不是通过虚假的考试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →