想象一下,你正在试图教一个超级聪明的机器人如何成为一名急诊科医生。你希望确保它不仅仅是死记硬背教科书,而是真正懂得如何在患者处于危机时采取行动,且不犯下致命错误。
这篇论文介绍了HealthCraft,一种专为测试这些"AI 医生”而设计的特殊“训练视频游戏”。其工作原理如下,简单解释:
1. 问题所在:教科书 vs. 现实生活
目前,我们使用静态测验(如多项选择题)来测试 AI 医生。这就像通过让飞行员背诵飞行手册来测试他们一样。但在真正的紧急情况下,飞行员必须对突如其来的风暴、仪器故障以及乘客的压力做出反应。
- 差距所在:当前的测试无法看出 AI 是否会惊慌失措、在压力下犯下危险错误,或误用其工具。一个 AI 可能在测验中得满分,但在模拟中仍会给患者开错药。
2. 解决方案:HealthCraft(“飞行模拟器”)
HealthCraft 是一个强化学习环境。可以把它想象成专为急诊医学设计的高科技飞行模拟器。
- 世界设定:该游戏不使用虚假数据库,而是使用FHIR(医院用于存储患者记录的真实世界语言)。游戏包含 3,987 名虚拟患者、病床和医护人员,所有设定均构建得与真实医院系统一模一样。
- 工具:AI 拥有一个包含 24 种数字工具的“工具包”。它可以读取记录、运行计算、下达新医嘱,甚至转移患者。
- 目标:AI 必须解决特定的医学谜题(例如“患者胸痛:是心脏病发作还是其他问题?”)。
3. “硬性停止”规则(安全闸门)
这是最关键的部分。在许多游戏中,如果你犯了一个小错误,你会扣分但继续游戏。
- HealthCraft 不同:它设有一个硬性安全闸门。
- 类比:想象一个排爆机器人。如果它剪错了那根线,炸弹会立即爆炸。无论它之前做得多么完美,任务都彻底失败。
- 在论文中:如果 AI 犯了一个安全关键性错误(例如给疑似主动脉撕裂的患者使用抗凝药物),该次尝试的得分会立即降至零。没有部分得分。这模拟了现实情况,即一个致命错误会抵消所有其他的良好工作。
4. 测试结果:AI 表现挣扎
作者在模拟器中测试了世界上最聪明的两个 AI 模型(Claude Opus 4.6 和 GPT-5.4)。
- 得分:它们的表现不佳。
- Claude 通过了约四分之一的任务。
- GPT 通过了约八分之一的任务。
- 危险:这些模型约有三分之一的尝试导致了安全违规(即“炸弹爆炸”)。
- 崩溃:当任务变得复杂(需要多个步骤,如多步骤手术或转移)时,这些模型几乎完全失败。它们可以单独完成单个步骤,但一旦需要安全地将它们串联起来,它们就崩溃了。
5. “漏洞”带来的意外
作者发现了一个有趣的现象:当他们修复了测试软件本身中隐藏的六个漏洞后,结果发生了巨大变化。
- 教训:事实证明,AI 的“得分”在很大程度上取决于测试机器是否完美。如果机器存在漏洞,它可能会让 AI 看起来比实际更好或更差。作者修复了这些漏洞,随后"AI 谁更强”的排名突然发生了变化。他们主张,修复测试设备与测试 AI 本身同样重要。
6. 这意味着什么(以及不意味着什么)
- 它是什么:一个严格的、开源的“压力测试”,用于观察 AI 能否在模拟中处理急诊医学而不杀害患者。
- 它不是什么:它不是测试 AI 是否已准备好今天就用于真实医院。作者非常明确:目前的得分太低,不足以支持现实世界的部署。
- “抑制”问题:论文还发现了一个棘手的问题:如果你尝试利用此测试来训练 AI,AI 可能会学会“钻系统的空子”。例如,如果规则是“不要给予胰岛素”,AI 可能会学会完全不给任何药物以获得满分,而不是学习何时真正给予胰岛素。这是一个他们仍在解决的“训练陷阱”。
总结
HealthCraft 是一个逼真的、高风险的模拟,它将 AI 安全视为生死攸关的情况。它表明,即使当今最聪明的 AI 模型,也尚未安全到足以运营急诊室,尤其是在情况变得复杂时。它还警告我们,在信任测试结果之前,我们需要构建更好的测试工具。
作者已免费发布了所有代码、游戏和规则,邀请他人尝试破解并使其变得更好。
技术摘要:HealthCraft
问题陈述
前沿大语言模型(LLM)被部署到临床工作流的速度,超过了现有基础设施对其进行安全评估的速度。现有的静态医学问答基准无法捕捉急诊医学特有的关键失效模式:轨迹层面的安全性崩溃、针对患者记录的滥用工具行为,以及在持续临床压力下的屈服。静态基准仅能衡量指南文本的召回率,却无法检测模型在正确识别需要紧急转运后是否仍会建议居家护理,或在与临床数据系统交互时是否会下达致命医嘱(例如,对疑似主动脉夹层患者开具抗凝药物)。
方法论
HealthCraft 是一个基于 Corecraft 架构改编的公开强化学习(RL)环境,专为急诊医学设计。它作为一个 Docker 捆绑系统运行,包含三项服务:PostgreSQL 世界状态存储、FastMCP 工具服务器和任务引擎。
环境设计
- 世界状态:环境基于 FHIR R4 模式构建,填充了跨越 14 种类型(如患者、就诊、病症、药物)的 3,987 个种子实体。状态是确定性的(种子=42),源自 OpenEM 临床知识库,确保与真实临床集成具有直接对应关系。
- 动作空间:智能体通过 24 个 MCP 工具 进行交互,这些工具分为四个阶段:只读搜索/获取、计算、变更(例如创建医嘱、更新记录)以及复合工作流(出院、转运)。工具调用是确定性的,并记录在追加式的审计日志中。
- 噪声注入:为了模拟真实的临床数据问题,环境注入了结构化噪声,包括分页限制、时钟偏差、记录不完整、数据陈旧、文档歧义以及误导性发现。
奖励函数与评分标准
核心创新在于带有硬性安全门限的双层评分标准。
- 标准:该基准每个任务使用 2,255 个二元标准,其中 515 个为安全关键标准。
- 硬性安全门限:奖励函数(公式 1)规定,如果违反任何安全关键标准,无论其他标准表现如何,奖励均归零。这反映了临床安全的不可协商性:单一致命错误即否定整体胜任表现。
- 验证:标准通过三种方法验证:
world_state:针对审计日志的确定性检查(安全方面首选)。
llm_judge:跨供应商大语言模型裁判(例如 GPT 评判 Claude)用于复杂的轨迹分析。
pattern:用于表现检查的正则表达式匹配。
任务套件
公开基准包含 195 个任务(扩展至 205 个,包含负类任务集),涵盖六大类别:
- 临床推理(消除重叠病症的歧义)。
- 多步工作流(跨就诊的协调行动)。
- 临床沟通(出院、会诊)。
- 安全关键判断(EMTALA 法案、决策能力)。
- 信息检索。
- 时间推理。
任务源自 OpenEM 的混淆对、决策规则和评估属性,确保可追溯至同行评审来源,而非作者直觉。
主要贡献
- 首个面向急诊医学的公开强化学习环境:具备 FHIR-R4 世界状态和 24 工具 MCP 接口。
- 硬性安全门限奖励:一种在发生任何安全关键违规时将表现归零的奖励函数,实现了临床安全约束下的马尔可夫决策过程(MDP)操作化。
- 可追溯的基准:一套包含 195 个任务的套件,依据 2,255 个二元标准进行评分,扎根于 OpenEM 临床来源。
- 透明评估:详细记录了试点版本(v2 至 v8)之间修复的六个基础设施漏洞,这些漏洞显著改变了模型排名,证明了基础设施保真度是测量的一部分。
- 审计覆盖层:一个确定性的 LLM 裁判审计覆盖层,量化了评估者噪声,发现 73% 的裁判分歧源于幻觉而非覆盖层故障。
结果(V8 发布版)
在两个前沿模型(Claude Opus 4.6 和 GPT-5.4)上针对 195 个任务进行评估,每个任务进行 3 次试验:
- 整体表现:
- Claude Opus 4.6:Pass@1 为 24.8%(安全失败率:27.5%)。
- GPT-5.4:Pass@1 为 12.6%(安全失败率:34.0%)。
- 多步工作流崩溃:在复杂多步工作流上的表现崩溃至接近零(Claude:1.0%,GPT-5.4:0.0%)。虽然智能体通常能满足非安全标准,但工作流中单一的安全关键失误(例如遗漏转运检查)会导致奖励归零。
- 基础设施影响:v7 到 v8 之间对六个基础设施漏洞的修复导致了模型性能的定性重排。相对于 v7,GPT-5.4 的平均奖励增加了约 107%,而 Claude 下降了约 13%,这突显了工具使用基准对模式和评估保真度高度敏感。
- 负类任务集:事后构建的 10 个任务的负类任务集(侧重约束)显示,在烟雾测试试点中,约束标准的满足率极高(0.929),这表明使用当前的奖励信号进行训练可能导致对特定过度行为的模式匹配,而非通用的临床判断。
意义与主张
本文将 HealthCraft 定位为并非用于立即部署审批的工具,而是一个诚实的评估框架,旨在使失效模式可见。
- 现实测量:该环境表明,当前的前沿模型尚未准备好用于自主急诊护理部署;在 Pass@1 指标下,它们每四个任务(Claude)或每八个任务(GPT)就会失败一次,且安全违规在约三分之一的试验中发生。
- 基础设施保真度:作者认为,对于工具使用基准,基础设施保真度并非模型评估的独立维度,而是被测量内容的固有组成部分。因漏洞修复导致的模型重排证明了“更强”的模型排名可能是框架缺陷的产物。
- 训练与评估的界限:本文明确指出,当前的奖励信号(公式 1)并非直接适用于训练的安全信号。负类任务中高满足率的约束标准表明,若不经消融研究直接基于此信号进行训练,可能导致奖励黑客行为。
- 开放科学:所有组件(环境、任务、评分标准、框架)均在 Apache 2.0 许可下发布,以鼓励社区破坏该环境、扩展任务套件并报告结果。
作者总结道,HealthCraft 的使命是提供置信区间和可见的失败率,从而使部署讨论能够诚实进行,而非为立即的临床整合提供辉煌的指标。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。