← 最新论文
🤖 AI

Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare

本文认为,当前的医疗人工智能基准测试存在不足,因为它们侧重于狭隘的知识测试而非现实世界的可靠性与安全性,因此亟需一个原则性框架,以准确评估模型在复杂临床工作流中的表现。

原作者: Prasanna Desikan, Harshit Rajgarhia, Shivali Dalmia, Ananya Mantravadi

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Prasanna Desikan, Harshit Rajgarhia, Shivali Dalmia, Ananya Mantravadi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在为医院招聘一名新医生。在允许他们治疗患者之前,你给他们进行了一场书面考试。他们表现出色,在每一个关于医学理论的问题上都得了满分。你感到信心十足,于是录用了他们。然而,在他们第一天上班时,他们却难以整理患者的病历,当化验结果缺失时感到困惑,或者在与护士协调时犯了错。

这正是本文所描述的医疗人工智能(AI)面临的问题。

目前,我们测试医疗 AI 的方式与测试那位新医生如出一辙:通过书面考试。这些测试衡量的是 AI“知道”什么(就像为执照考试死记硬背事实),但它们无法衡量 AI 在医院混乱的现实中实际上能“做”什么。

以下是本文提出的内容的简要分解,使用了日常类比:

1. 问题所在:“驾驶考试”与“真实交通”

作者指出,当前的基准测试就像在空旷、阳光明媚的赛道上进行驾驶考试。AI 驾驶得完美无缺,精准地通过每一个标记。但真实的医疗环境就像在交通高峰期的暴雨中驾驶

  • 差距:AI 模型在其“赛道测试”(医学考试)中获得完美分数,但当它们尝试处理真实任务(如撰写患者病历、协助医生做出决策或管理医院工作流程)时,其性能会显著下降。
  • 危险:高分给我们一种虚假的安全感。我们以为 AI 已经准备就绪,但它可能在最关键的时刻失败。

2. 解决方案:新的“成熟度阶梯”

本文建议我们停止使用一刀切的测试。相反,我们应该根据 AI 承担责任的程度来衡量它,使用一个三步阶梯(称为成熟度分类法):

  • 第 1 级(书记员):AI 只是倾听并记录内容。
    • 类比:法庭记录员或做笔记的秘书。
    • 任务:总结医生的问诊或记录患者信息。
  • 第 2 级(侦探):AI 观察线索并推断其含义。
    • 类比:侦探勘察犯罪现场,或技师聆听发动机声音。
    • 任务:阅读 X 光片、聆听心音或在数据中发现模式。
  • 第 3 级(飞行员):AI 采取行动并做出决策。
    • 类比:飞行员驾驶飞机,或指挥家领导乐团。
    • 任务:决定治疗方案、开具检查单或协调护理。

巨大的意外:研究发现,AI 在第 1 级(记录)表现优异,但随着它攀登到第 3 级(飞行员),表现却急剧下降。这很危险,因为级别越高,对患者构成的风险就越大。我们需要针对它们被期望处理的级别进行专门测试。

3. 当前测试中缺失的要素

作者分析了 53 项现有测试,发现它们缺失了三个关键要素:

  • 鲁棒性(“如果……会怎样”测试):当前测试没有询问:“如果数据混乱或缺失会发生什么?”现实生活是混乱的;AI 需要在不恐慌或不胡乱编造的情况下处理缺失信息。
  • 不确定性(“我不知道”测试):当前测试会惩罚 AI 说“我不知道”。但在医学领域,承认不确定性比错误猜测更好。优秀的基准测试应奖励 AI 知晓其局限性。
  • 作弊(“无死记硬背”测试):有时 AI 获得高分是因为它在训练期间死记硬背了测试题,而不是因为它掌握了材料。本文称此为“数据污染”。我们需要确保 AI 真正在进行推理,而不仅仅是复述的测试。

4. 新蓝图:“基准工程”

本文提出了一种构建这些测试的新方法,称为基准工程。将其想象为为 AI 建造一个定制的障碍赛道,而不仅仅是给它一份多项选择题测验。

  • 需要真正的医生:你不能独自构建这些测试。你需要真正的医生(领域专家)来帮助设计问题并评分,确保测试符合医生实际的思维方式。
  • 处理分歧:有时即使是真正的医生在诊断上也会存在分歧。本文解释了如何在测试中处理这种情况,而不将其视为错误。
  • 两个真实案例:作者展示了他们构建的两个测试:
    1. 音频侦探:测试 AI 能否理解医学声音(如心跳)并进行解释,即使音频存在噪音。
    2. 行动代理(ART):测试 AI 是否能在医院计算机系统中实际“执行”操作(如开具化验单),而不会因数据缺失而感到困惑。

5. 你能从中获得什么

本文本质上是一份教程或指南。它教导研究人员和开发人员如何:

  • 停止依赖虚假的完美分数。
  • 构建模仿真实医院混乱状态的测试。
  • 检查 AI 是否真正准备好部署,还是仅仅擅长参加考试。

简而言之:本文认为,为了在医疗领域信任 AI,我们需要停止像对待参加期末考试的学生那样测试它,而开始像对待在风暴中飞行的飞行员那样测试它。在我们让 AI 进入医院之前,我们需要观察它如何应对意外、缺失的数据以及高风险的决策。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →