A global log for medical AI
本文介绍了 MedLog,这是一种标准化的事件级日志协议,旨在记录全球不同部署环境下医疗人工智能系统的交互、输入、输出和结果,从而在通过基于风险的采样和高效的数据管理来适应低资源环境的同时,实现持续的监测、审计和性能改进。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在驾驶一辆全新的自动驾驶汽车。你了解这辆车的构造、它使用的燃料类型,以及它在测试场上的表现。但一旦你把它开上真实的公路,面对雨天、交通拥堵和施工路段时,你是否确切知道它是如何反应的?你是否知道当它看到某种特定类型的坑洼时是否会感到困惑?你是否知道当汽车犹豫不决时,驾驶员是否突然夺回了方向盘?
目前,当医院开始使用人工智能(AI)来辅助医生时,它们就像是在没有“黑匣子”飞行记录仪的情况下在公路上行驶的自动驾驶汽车。人们知道 AI 的存在,但没有一种标准化的方式来记录每一次 AI 进行预测、它看到了什么数据、它说了什么以及随后发生了什么。
这篇论文介绍了 MedLog,它本质上是医疗 AI 的通用“飞行记录仪”或“日志本”。
问题所在:处于“沉默”状态的 AI
目前,当医院使用 AI 工具时,它往往不会留下任何工作痕迹。
- 类比: 想象一位正在烹饪复杂菜肴的厨师。如果他们没有记录下具体使用了哪些食材、加了多少盐,或者顾客是否退回了菜肴,他们就永远无法从错误中学习或改进食谱。
- 现实情况: 由于缺乏这些记录,医院无法判断 AI 是否运行良好,或者它是否仅在某些特定情况下(如暴风雨期间)出错,亦或是它对不同患者群体存在不公平对待。
解决方案:MedLog
作者创建了一个名为 MedLog 的标准协议。它就像是一份结构化的表格,每当 AI 与人类、另一台计算机或某个工作流进行交互时,该表格就会被填写。
每当 AI 进行“思考”或采取行动时,Medлог 都会记录九个特定的事项:
- 页眉(Header): 谁、何时、何地发生了这件事?
- 模型(Model): 这是哪个版本的 AI?(类似于记录汽车的软件版本)。
- 用户(User): 谁向 AI 请求了帮助?(医生、护士还是另一个计算机程序)。
- 目标(Target): 这与谁有关?(特定的患者或特定的保险理赔)。
- 输入(Inputs): AI 看到了哪些信息?(化验结果、笔记、图像)。
- 内部中间产物(Internal Artifacts): AI 的“思考过程”或中间步骤(例如其置信度或推理过程)。
- 输出(Outputs): AI 实际说了什么或建议了什么?
- 结果(Outcomes): 接下来发生了什么?(医生是否遵循了建议?患者是否康复了?)。
- 反馈(Feedback): 人类用户是说“做得好”还是“那不对”?
现实世界测试:让 MedLog 投入实战
团队不仅编写了规则,还在全球四家非常不同的医院进行了 MedLog 的测试,以观察它能揭示什么。
1. 瑞士的 ICU(“虚假安全感”陷阱)
- 设置: 一个名为“BEACON”的 AI 监测重症监护室(ICU)中的患者,以预测他们是否会发生休克。
- 发现: 该 AI 在预测休克方面表现出色,但它有一个隐藏的缺陷。如果一名患者有一段时间没有进行血液检查,AI 就会假设一切正常并降低警报。实际上,患者只是因为数据“陈旧”而显得看起来正常,而非真的健康。
- MedLog 的作用: 如果没有 MedLog,医生只会看到“低风险”并感到安全。MedLog 记录了血液检查的时间点,揭示了 AI 被缺失的数据误导了。医院通过要求 AI 在患者到达后的第一个小时内保持静默,解决了这个问题。
2. 越南的破伤风监测(“夜班”偏差)
- 设置: 一种可穿戴设备监测破伤风患者,以预测病情是否恶化。
- 发现: AI 在夜间的信心和准确度比白天高得多。
- MedLog 的作用: MedLog 显示,在白天,护士们在移动患者、给药和检查生命体征,这些行为产生了“噪音”,使 AI 感到困惑。而在夜间,患者处于静止状态,使 AI 的工作变得更容易。这告诉团队,AI 的置信度取决于它被使用的时间。
3. 加利福尼亚州的败血症报告(“困惑的机器人”)
- 设置: 一个大型语言模型(类似于智能聊天机器人)被用于填写关于败血症(一种严重的感染)的复杂政府表格。
- 发现: 当 AI 阅读简单事实(如“患者是否怀孕?”)时,表现得非常一致。但当它必须阅读混乱的医生笔记来判断患者是否患有严重感染时,对于同一个问题,它有时会给出不同的答案。
- MedLog 的作用: 通过记录 AI 的每一次尝试,团队可以准确看到 AI 在哪里产生困惑,以及它在多大程度上产生自我矛盾,从而帮助他们了解在哪些地方可以信任机器人,以及在哪些地方需要进行双重检查。
4. 纽约的预约调度(“天气效应”)
- 设置: AI 预测患者是否会按时参加医生预约。
- 发现: AI 是针对正常天气进行校准的。但当强风暴来袭时,AI 失效了。它未能预测出人们会因为天气原因留在家里。
- MedLog 的作用: MedLog 将 AI 的预测与天气数据联系起来。它显示在风暴期间,AI 的准确性显著下降。这证明了 AI 需要重新训练,以理解“恶劣天气”会改变人类行为。
为什么这很重要
论文认为,MedLog 是连接“构建”AI 与“安全使用”AI 之间的缺失环节。
- 它不仅仅是一个日志: 它是一种捕捉仅在现实世界中才会发生的错误的方法。
- 它具有灵活性: 它可以用于拥有昂贵计算机的高科技医院,也可以用于仅有平板电脑和间歇性网络连接的资源匮乏地区。
- 它保护患者: 通过记录一切,我们可以发现偏差(例如 AI 对女性或老年人的表现较差),及早发现故障,并确保 AI 确实是在提供帮助,而不仅仅是在猜测。
简而言之,MedLog 将医疗 AI 的“黑盒”转变为一个透明、可观察的过程,让医生和医院能够从每一次交互中学习,并保障患者的安全。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。