← 最新论文
💻 computer science

CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR

本文介绍了 CliniCARE-Bench,这是一个利用真实世界 MIMIC-IV 数据的新型基准测试,旨在评估临床 AI 智能体在对纵向电子健康记录进行开展具有辩护性、基于证据的调查方面的能力,并揭示了标准准确率指标往往会高估其相对于更严格的无缺陷评估的表现。

原作者: Veronica Chatrath, Bryan Zhu, George Pu, Jingxuan Fan, Apaar Shanker, Varun Ursekar, Anahita Sharma, Jason Qin, Keqi Han, Soham Dinesh Tiwari, Soham Dan, Vijay Kalmath, Yuan Li, Daniel Yue Zhang, Chen
发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Veronica Chatrath, Bryan Zhu, George Pu, Jingxuan Fan, Apaar Shanker, Varun Ursekar, Anahita Sharma, Jason Qin, Keqi Han, Soham Dinesh Tiwari, Soham Dan, Vijay Kalmath, Yuan Li, Daniel Yue Zhang, Chenguang Wang, Zainab Doctor, Zhijun Yin, Nigam H. Shah, Yuan Xue

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机就像是那些读遍了图书馆里所有医学教科书、才华横溢却又过度热情的实习生。它们可以轻松通过任何关于疾病、药物和症状的知识问答,因为它们完美地背下了所有的事实。但在真实的医院环境中,仅仅成为一名知识问答冠军是不够的。真正的医生不仅仅是在猜测;他们更像是一名侦探。他们必须在混乱的、长达数年的病历中搜寻线索,从手写笔记和电子图表中寻找关键信息,核对医院的规章制度,并判断自己是否掌握了足够的证据来破案。有时,医生能做的最好的事情就是承认:“我目前还没有足够的信息,”而不是盲目猜测并可能伤害到患者。科学家们面临的一个大问题是:这些超级聪明的计算机程序真的能进行这种侦探工作吗?还是它们仅仅擅长背诵答案?

这篇论文介绍了一个全新的、难度极高的测试,名为 CliniCARE-Bench,旨在查明真相。研究人员并没有向计算机提问诸如“什么是发烧?”之类的简单问题,而是给了 16 个不同的计算机系统一个任务:扮演一名医疗审计员。他们让计算机调查 750 个真实的病例(基于真实的匿名医院记录),以回答特定的问题,例如:“该患者在 CT 扫描后是否出现了肾脏感染?”或者“是否给予了正确的治疗?”计算机必须搜寻证据、核对规则,然后给出四种答案之一:“是”、“否”、“我们没有足够的数据”或“医疗情况过于复杂,无法判断”。研究人员不仅检查最终答案是否正确,还观察了计算机是如何得出结论的。他们想看看计算机是否遵循了规则、是否引用了来源,以及是否知道何时应该停下来并说:“我无法解决这个问题。”

结果令人有些震惊。虽然计算机在得出正确最终答案方面表现得相当不错(准确率在 65% 到 76% 之间),但论文指出,这个数字具有误导性。这就像一个学生在数学考试中得到了正确答案,但使用的是错误的公式来推导过程。当研究人员进行深入观察时,他们发现许多计算机都在采取“违规捷径”。它们可能会通过忽略缺失的证据或违反不应违反的规则来猜中正确答案。当研究人员仅计算那些既正确又遵循了所有规则的答案时,得分显著下降了——大约下降了 5% 到 15%——而且表现最好的计算机排名也发生了彻底的变化。

论文还发现,这些“计算机侦探”非常不擅长判断何时该停止。它们表现出“过度自信”。即使患者的档案中缺少关键信息,导致无法破解案件,计算机通常仍会坚持给出“是”或“否”的答案。即使在应该选择“我不知道”的情况下,它们也很少选择该选项。研究人员认为,这是一个重大的安全问题。如果计算机想要协助医生,它需要能像清晰地说出“答案是肯定的”一样,也能清晰地说出“我需要更多信息”。

简而言之,这篇论文表明,虽然这些人工智能系统在医学常识方面正变得越来越强,但它们尚未准备好作为独立的医疗审计员被信任。它们有时能得到正确答案,但往往是通过偏离要求的流程或忽略证据不完整的事实来达到目的。研究人员总结道,为了让这些系统在真实的医院中变得安全且有用,我们不能仅仅看最终的分数,而必须开始对整个调查过程进行评分——确保它们确实完成了调查工作、遵循了规则,并且知道何时寻求帮助。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →