Patient-Facing AI Chatbots vs Primary Care Physicians: A Standardized Patient Field Experiment in China
在一项针对62家中国基层医疗机构的标准患者实地实验中,AI聊天机器人在诊断准确性和以患者为中心的沟通方面表现优于医生,但显著增加了由于推荐过度检查和不当用药而导致低价值医疗风险的可能性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一场大规模的健康检查,两类截然不同的“医生”在同一天接受测试,面对完全相同的患者。一组是正在中国农村工作的真实基层全科医生。另一组是两款著名的 AI 聊天机器人(ChatGPT-4o 和 DeepSeek-R1),扮演虚拟医生。
为了确保这场对决公平,研究人员使用了“标准化病人”。你可以把他们想象成受过高度训练的演员,能够完美地扮演病人的角色。他们都有相同的剧本:有些人假装胸痛(不稳定型心绞痛),有些人假装呼吸困难(哮喘)。他们先去看真人医生,然后在同一天与 AI 进行对话。这些演员从未透露自己是演员,因此医生和 AI 都不知道自己正在接受测试。
以下是统计后的结果:
1. “考试成绩”:谁诊断对了?
AI 在这场知识竞赛中以压倒性优势获胜。
- 真人医生: 只有大约 10 分之 3 的真人医生正确识别了疾病并建议了正确的药物。
- AI 聊天机器人: 它们几乎是完美的。在 94% 到 99% 的情况下,它们都能正确给出诊断和正确的药物建议。
类比: 想象一场选择题考试。真人医生就像是那些疲惫不堪、注意力不集中或忘记复习特定章节的学生,所以经常猜错;而 AI 聊天机器人则像是那些背下了整本教科书,并能瞬间回忆起准确答案的学生。
2. “安全隐患”:谁开得太多了?
AI 聊天机器人表现得过于“热衷”且具有风险。
虽然 AI 得出了“正确”的答案,但在“如何解决问题”方面存在重大问题。它们表现得像一名过度谨慎的保安,即使看到每个人看起来都很无害,也会检查每一个人的包,只为确保万无一失。
- 真人医生: 他们很谨慎。只有在真正认为必要时,才会开具检查或药物。
- AI 聊天机器人: 它们做得过头了。它们建议的检查和药物数量远多于医生。
- 它们对 90% 到 96% 的患者建议了不必要的检查。
- 对于大约 60% 到 73% 的患者,它们建议了不恰当的药物。
类比: 如果你的膝盖有一个小划痕,真人医生可能会说:“清洗一下,贴个创可贴就行。”而 AI 聊天机器人为了确保万无一失,可能会说:“你需要做核磁共振、抽血、做 CT 扫描,还要吃三种不同类型的抗生素以防万一。”这并不是说 AI 对这个划痕的判断错了,而是它太害怕遗漏任何细节,所以会建议做所有能做的事。这被称为“低价值医疗”——即做得过多,这不仅昂贵,还可能带来危害。
3. “医患沟通”:谁更亲切?
AI 聊天机器人在“以患者为中心”方面表现得惊人地好。
研究人员要求演员们评价“医生”在倾听、理解患者感受以及解释病情方面的表现。
- 真人医生: 评分处于平均水平(约 4 分制中的 2.5 分)。他们往往专注于医学事实,有时会忽略情感上的连接。
- AI 聊天机器人: 评分非常高(约 4 分制中的 3.3 分)。它们非常擅长表达类似“我理解这很令人恐惧”或“让我们看看您的整体生活情况,看看问题出在哪里”这样的话语。
类比: 真人医生就像是忙碌的机械师,快速检查引擎并告诉你哪里坏了。而 AI 聊天机器人则像是一位友好的机械师,不仅检查引擎,还会询问你的近况,用简单的语言解释问题,并让你感到被倾听。
核心启示
论文的结论呈现出一种复杂的情况,就像一把双刃剑:
- 好消息: 在缺乏真人医生的地区,AI 聊天机器人可以成为极佳的助手。它们能比疲惫的真人医生更好地发现疾病,并且能以非常亲切、体贴的方式与患者交流。
- 坏消息: 由于 AI 太过渴望提供帮助和确保“安全”,它们会推动过多的检查和药物使用。如果患者先咨询 AI,他们可能会带着对昂贵检查的需求走进真人医生的诊室。届时,医生必须花时间去解释为什么这些检查是不必要的,这给本就繁忙的医疗系统增加了压力。
简而言之: AI 是一个完美背诵教科书且谈吐非常有礼貌的优秀学生,但它缺乏处理现实世界的经验,不知道何时该适可而止。它想要通过做“一切”来确保安全,但这实际上可能会产生新的问题。论文建议我们需要制定规则,以确保 AI 在运用其智能的同时,不会表现得过于激进。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。