HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents
本文介绍了 HealthAgentBench,这是一个包含 54 个涵盖不同临床工作流和模态的现实多步医疗任务的全面基准测试套件,该套件揭示了即使是最先进的前沿 AI 智能体目前在复杂的端到端医疗环境中也难以实现高成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一群非常聪明但缺乏经验的实习生如何在真实的医院里工作。在过去,你可能会用选择题来测试他们:“这是一个病人的案例;请问诊断是什么?”
但真实的医疗工作并不是一场问答测验。它是一个混乱、杂乱且多步骤的过程,医生必须从成千上万页的记录中挖掘信息,查看巨大的高分辨率 X 光扫描图像,检查数据错误,并判断一名患者是否符合特定研究项目的标准。
HealthAgentBench 是一个全新的、超现实的“训练场”,旨在测试 AI 智能体(能够思考并行动的计算机程序)处理这些现实世界医院任务的能力,而不是仅仅给它们出一道测验题。
以下是该论文内容的拆解,使用了简单的类比:
1. 问题所在:旧的测试太简单了
把之前的 AI 测试想象成封闭赛道上的驾驶员教育考试。汽车(AI)只需要走直线或转弯。它是安全、可预测且静态的。
- 现实情况: 真实的医疗环境就像是在充满施工、行人且没有 GPS 的风暴城市中驾驶。AI 必须打开文件、放大图像、查询数据库,并修正自己的错误。
- 差距: 旧的测试已经“饱和”了,这意味着 AI 已经掌握了它们。它们已经无法区分一个优秀的 AI 和一个卓越的 AI 了。我们需要一个更难的测试。
2. 解决方案:“医院模拟器”
研究人员构建了 HealthAgentBench,它就像是为 AI 智能体准备的医院视频游戏模拟器。
- 设置: 他们不是给 AI 一个类似“修复这份报告”的提示词,而是给它一个计算机终端(命令行)和一个包含杂乱、真实患者数据的文件夹。
- 任务: AI 必须自己弄清楚如何解决问题。它必须决定:“我需要放大这张 X 光片吗?我需要下载特定的工具吗?我需要阅读三年前的病人病史吗?”
- 任务类型: 共有 54 个不同的任务,分布在 7 个类别中。
- 侦探: 在巨大的患者数据电子表格中寻找错误(数据质量审计)。
- 放射科医生: 查看 3D CT 扫描或巨大的病理切片(就像一张城市的数字地图),并找到微小的肿瘤。
- 研究员: 阅读患者的笔记,并找出他们可能符合条件的 50 项不同的医学研究项目(临床试验匹配)。
- 翻译官: 将杂乱的医院记录转换为干净、标准化的格式(EHR 格式转换)。
3. 游戏规则
为了确保 AI 不会作弊,研究人员制定了严格的规则:
- 禁止作弊: AI 不允许在互联网上查找答案。 “答案解析”被锁在一个只有评判者(验证器)才能看到的保险箱里。
- 不手把手教导: 指示非常简略。AI 必须自己摸索策略。
- 通过/失败制: 这不是关于拿到 90% 的分数,而是关于能否正确完成整个工作。如果你在电子表格中漏掉了一个微小的错误,那么整个任务就算失败。
4. 结果:AI 陷入苦战
研究人员在模拟器中测试了全球前 10 名最先进的 AI 模型(包括来自 OpenAI 和 Anthropic 的最新版本)。
- 得分: 即使是最“聪明”的 AI(Codex GPT-5.5)也只通过了 42% 的任务。
- 类比: 想象一群顶尖医学生正在参加期末考试。最好的学生也只答对了 42% 的题目。这表明测试非常困难,AI 还有很长的路要走。
- 弱点:
- “大海捞针”问题: 当 AI 需要在巨大的数据库(如 80 亿行数据)中搜索几个错误时,它会迷失方向。这就像是在没有搜索引擎的情况下,试图在一千本书的图书馆里寻找一个特定的拼写错误。
- “视觉”问题: 查看医学图像(X 光、CT 扫描、病理切片)是最难的部分。AI 经常会错过微小的细节,或者产生幻觉(看到不存在的东西)。这就像是戴着厚厚的雾状眼镜去寻找墙上的一道细微裂缝。
- “复杂推理”问题: 当一个任务需要结合许多小步骤时(例如“找到错误,然后修复代码,然后重新运行测试”),AI 经常会感到困惑。
5. 胜者与败者
- 表现最佳者: Codex GPT-5.5 模型表现最为成功,也是最“具有成本效益”的(与其他模型相比,它运行所需的资金或时间更少)。
- 令人惊讶的差距: 来自 OpenAI(GPT-5 系列)的模型在处理医学图像方面通常比来自 Anthropic(Claude Code)的模型表现更好,尽管 Anthropic 的模型有时尝试得更努力(采取了更多步骤,花费了更多成本)。
- 好消息: AI 实际上非常擅长构建数据流水线(例如将杂乱的电子表格整理成干净的数据库)。它们几乎可以完美地完成这项工作。这表明 AI 正在变得擅长做“数据清洁工”的工作,但在做“医生”的工作(诊断和复杂的图像分析)方面仍有困难。
6. 结论
HealthAgentBench 是一次现实的检验。它表明,虽然 AI 正在变得越来越聪明,但它尚未准备好成为一名完全自主的医生或医院管理人员。
- 论文声称,目前的 AI 在复杂的现实场景中仍然极易出错。
- 它为研究人员提供了一个衡量进步的新、更难的标准。
- 它强调,要让 AI 准备好进入真实医疗领域,我们需要提高其观察医学图像以及在庞大数据量中导航而不迷失方向的能力。
简而言之:AI 是一个非常聪明的实习生,擅长整理文件,但在看 X 光片并做出最终决策时,仍然需要人类监督员。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。