← 最新论文
💬 NLP

HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats

本文介绍了 HealthBench Professional,这是一个严格的开放基准,包含由医师撰写的对话和经专家裁决的评分标准,用于评估和追踪大语言模型在真实临床任务上的进展,结果表明专用 GPT-5.4 模型在性能上超越了基础模型和人类医师。

原作者: Rebecca Soskin Hicks, Mikhail Trofimov, Dominick Lim, Rahul K. Arora, Foivos Tsimpourlas, Preston Bowman, Michael Sharman, Chi Tong, Kavin Karthik, Arnav Dugar, Akshay Jagadeesh, Khaled Saab, Johannes
发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Rebecca Soskin Hicks, Mikhail Trofimov, Dominick Lim, Rahul K. Arora, Foivos Tsimpourlas, Preston Bowman, Michael Sharman, Chi Tong, Kavin Karthik, Arnav Dugar, Akshay Jagadeesh, Khaled Saab, Johannes Heidecke, Ashley Alexander, Nate Gross, Karan Singhal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教导一位非常聪明、但有时过于自信的机器人助手如何协助医生。你想知道这个机器人是否真的能帮医生挽救生命、撰写病历或查找最新的医学研究,还是说它只是听起来不错,却在细节上出错。

本文介绍了HealthBench Professional,这本质上是一个专为医生设计的、面向真实世界的 AI 助手“驾照考试”。

以下是该论文的解释,将其拆解为简单概念:

1. 问题:旧测试太简单(或虚假)

把之前的 AI 测试想象成答案显而易见的多项选择题,或者是剧本式的角色扮演,其中机器人确切知道“患者”会说什么。

  • 问题所在:真实的医生不会用多项选择题来交流。他们进行的是杂乱无章的多轮对话。他们需要帮助处理疑难病例,需要快速撰写病历,并需要查找特定的研究论文。
  • 结果:旧测试就像给机器人一个“如何在停车场驾驶”的测试,然后却把它放到真实的高速公路上。机器人通过了停车场测试,却在高速公路上撞车了。此外,最聪明的机器人已经背下了旧测试的答案,因此这些测试已经“饱和”(无法用于衡量进步)。

2. 解决方案:真实世界模拟

作者利用525 场真实对话构建了新测试,这些对话是实际医生与名为"ChatGPT for Clinicians"的 AI 工具之间的交流。

  • “善意”驾驶员:一些医生在日常工作中正常使用了该 AI(就像司机通勤上班)。这代表了日常任务。
  • “红队”驾驶员:其他医生被聘请来尝试攻破该 AI。他们试图欺骗它、迷惑它,或提出危险问题,以观察它是否会失败。这就像驾驶教练故意在道路上设置障碍,以观察机器人能否应对危机。

3. 评分系统:“人类裁判”

在许多 AI 测试中,计算机给计算机打分。而在本文中,真实医生为 AI 打分

  • 流程
    1. 一位医生创建对话并撰写“评分标准”(即完美答案的检查清单)。
    2. 其他医生审查该清单,确保其公平且准确。
    3. 最后一组医生充当“裁判”,以解决任何争议。
  • 类比:想象一场体育比赛,裁判都是前职业选手。他们不仅看比分,还看动作是如何完成的。他们会检查安全性、准确性和清晰度。

4. 三大核心演练

该测试聚焦于医生实际使用 AI 的三件事:

  1. 护理咨询:“我有一个患者出现这些奇怪症状。可能是什么病,该如何治疗?”(推理能力)。
  2. 写作与记录:“这是患者就诊的杂乱转录稿;请将其整理成清晰的医疗病历。”(写作能力)。
  3. 医学研究:“帮我查找关于这种特定药物相互作用的最新研究。”(搜索能力)。

5. “长度惩罚”规则

作者发现了一个技巧:如果 AI 只是说很多话,它可能会因为有更多机会说出正确内容而意外获得更高分数。

  • 修正:他们引入了“长度惩罚”。这就像一场写作比赛,如果你用 50 页的论文来回答一个简单问题,你会因啰嗦而扣分。他们调整了分数,使得简洁、高质量的答案受到奖励,而不仅仅是冗长的胡言乱语。

6. 结果:谁赢了?

该论文比较了不同的 AI 模型,甚至包括真实的人类医生。

  • 人类基准:他们聘请专家医生回答相同的问题,给予他们无限时间和互联网访问权限。这是“黄金标准”。
  • 获胜者:表现最好的系统是嵌入在"ChatGPT for Clinicians"工具中的 GPT-5.4
    • 它得分为 59.0
    • 人类医生得分为 43.7
    • 标准版 GPT-5.4(没有特殊医生工具)得分为 48.1
  • 结论:该专用 AI 工具不仅击败了其他 AI 模型,而且在这个特定的测试环境中,实际上超越了人类医生。论文指出,这可能是因为该 AI 能即时访问所有医疗指南,并且处理信息的速度比人类在测试环境中阅读和综合信息要快。

7. 为何这很重要

作者表示,该测试旨在具有挑战性。他们特意挑选了最难的问题(即“红队”问题),以确保该测试不会对未来更聪明的机器人变得“太容易”。

  • 目标:为医疗界提供一个可靠的标尺,用于衡量 AI 是否真的在更好地帮助医生,而不仅仅是更擅长通过虚假考试。

简而言之:该论文构建了一个由专家医生评分的、具有挑战性的真实世界 AI“驾驶考试”,并发现目前在这个特定模拟中,专用 AI 工具的驾驶表现优于人类驾驶员。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →