Comparison of the Diagnostic Reliability of ChatGPT in Letournel–Judet Acetabulum Fracture Classification Based on Judet Radiographs According to Orthopaedic Residents
本研究表明,ChatGPT-4o 在对 Letournel–Judet 髋臼骨折进行分类时,表现出根本性的诊断可靠性不足以及与专家标准的一致性极低,其表现显著差于骨科住院医师,因此无法作为骨盆创伤的有效决策支持工具。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个由人体髋部破碎骨头组成的极其复杂的 3D 拼图。为了修复它,医生需要准确弄清楚这些碎片是如何断裂开来的。他们使用一种特殊的地图,叫做“Letournel–Judet 分类法”来描述这种骨折。这个地图非常棘手;它需要观察三张不同的平面 X 光片(就像从正面、侧面和背面观察一栋建筑),并在脑海中将它们组合起来,以理解整个结构。
这项研究提出了一个简单的问题:一个超级聪明的计算机聊天机器人(ChatGPT-4o)能否像受训中的人类医生一样胜任这项工作?
以下是研究过程的详细分解,使用了简单的类比:
设置:测试
研究人员提取了 184 名髋臼骨折患者的 X 光片。他们设置了一个包含三个组别的“测试”:
- 专家: 一位资深的创伤外科医生,他看到了最终的 3D CT 扫描结果和实际的手术结果。这个人是“标准答案”。
- 学生: 两名骨科住院医师(处于培训最后阶段的医生)。他们只看到了平面 X 光片,就像计算机一样。
- AI: ChatGPT-4o。研究人员向 AI 展示了同样的 X 光片,并提供了一份特定的清单(检查表)来帮助它判断骨折类型。
结果:巨大的差距
结果让研究人员大吃一惊。
- 学生(住院医师): 他们表现出色。他们的诊断正确率达到了 88% 到 91%。他们与专家的意见几乎完全一致。
- AI(ChatGPT): 它表现得非常吃力。它最终诊断正确的概率仅为 17.9%。这意味着在近 10 种情况中有 8 种情况下它都是错误的。
类比:
想象一场游戏,你需要通过观察三张模糊的照片来识别一种特定类型的车祸。
- 住院医师就像经验丰富的机械师,他们看了照片后说:“那是追尾碰撞导致的车架扭曲。”他们几乎每次都对。
- AI 就像一个学生,看着照片说:“那是一辆掉下悬崖的车,”或者“那是一辆撞树的车,”即使情况显然不是那样。它在胡乱猜测。
AI 在哪里卡住了
研究发现,AI 并非完全看不见。
- 好的方面: AI 其实挺擅长发现简单的、孤立的问题。它能以约 82% 的正确率识别出髋骨特定部分(“髂翼”)是否骨折。这就像一个能正确指出“那是坏掉的车轮”但却无法理解整辆车的学生。
- 坏的方面: AI 在最难的部分——把碎片拼凑在一起——彻底失败了。它无法弄清楚髋骨的前部和后部是如何连接的。它经常把简单的骨折误认为“双柱”骨折(一种非常复杂的骨折),基本上是把一个小划痕看成了一场彻底的灾难。
研究人员注意到,AI 似乎出现了“幻觉”。它会把 X 光片上的一个阴影看作是某种特定的骨折征象,并自信满满地宣称:“这就是某种特定的骨折迹象”,即便那里根本不存在。
结论:现在还不能使用它
论文的主要结论非常直接:不要使用这种 AI 来诊断髋部骨折。
作者指出,虽然 AI 在处理简单任务(如发现手指骨折)方面表现出色,但对于诊断髋臼骨折所需的复杂、多步骤思维,它目前在本质上是不合格的。它无法可靠地结合不同的 X 光视图来创建一个正确的诊断。
简而言之: 如果你把这些 X 光片交给一名人类住院医师,他们很可能会得到正确的答案。如果你把这些 X 光片交给这个特定的 AI,它很可能会给出错误的答案,而这可能会导致错误的手术方案。研究人员表示,在这种特定的工作中,在 AI 变得更加聪明之前,我们应该坚持依靠人类医生。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。