Can Large Language Models Assist Surgeons in Managing Implant-Related Complications? A Guideline-Informed Comparative Evaluation
本研究评估了四种大语言模型在基于指南的植入物并发症场景下的表现,发现尽管它们在性能和安全性方面存在差异——特别是在复杂病例中 Gemini 3.1 的表现优于 DeepSeek V3.2——但它们目前尚无法取代专家的临床判断。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位试图烹饪完美佳肴的厨师,但你的手中没有食谱,而是一个超级聪明的机器人,它读遍了世界上所有的食谱、美食博客和餐厅评论。这个被称为“大语言模型”(LLM)的机器人可以与你聊天、回答问题,甚至能建议复杂的菜肴。在医学领域,这些人工智能机器人正成为医生的热门助手,为从普通感冒到复杂手术的一切问题提供快速建议。但问题在于:仅仅因为一个机器人说话自信,并不意味着它知道真相。有时,这些人工智能系统会编造内容,科学家称之为“幻觉”现象,或者给出听起来不错但实际上可能会伤害患者的建议。这在牙科领域尤其令人担忧,因为植入牙种植体就像是在一个人的颌骨中建造一个微小的、永久性的地基。如果地基错了,或者发生了像神经损伤或严重出血这样的并发症,后果将是痛苦且永久性的。因此,大问题不仅仅是“人工智能能否说话?”,而是“当情况出错时,人工智能能否被信任去拯救局面?”
这项研究决定对四种最著名的AI机器人进行测试:Gemini 3.1、ChatGPT 5.4、Claude 4.6 和 DeepSeek V3.2。研究人员并没有问它们像“什么是牙种植体?”这样简单的问题,而是创建了24个关于牙种植体出现问题的棘手、虚构的故事(称为临床病例)。这些故事涵盖了从“中等”程度的麻烦(如轻微感染)到“专家级”的灾难(如神经被压迫或窦膜撕裂)。这些AI机器人必须扮演经验丰富的外科医生,根据真实的医疗指南进行诊断并提出治疗方案。然后,两位不知道哪个AI写了哪个答案的真实牙科专家,按照1到5分的标准为机器人评分。他们考察了诊断的准确性、建议的安全性以及方案是否合理。他们还玩起了“找危险”的游戏,检查AI是否给出了任何可能严重伤害患者的建议,或者是否编造了虚假的医学事实。
结果有点像一场选手耐力水平各异的比赛。研究发现,这些机器人的表现并不完全相同。Gemini 3.1 是明显的赢家,在准确性、安全性和清晰度方面始终获得最高分。它就像那个真正研读过教科书并确切知道该怎么做的学生。在光谱的另一端,DeepSeek V3.2 表现最差。它的整体得分较低,更令人担忧的是,它是最容易产生“幻觉”或给出危险建议的模型。事实上,DeepSeek 在近三分之一的回答中(29.2%)编造了虚假的医学事实或指南,并在约17%的情况下建议了有害的治疗方法。另外两个机器人 ChatGPT 5.4 和 Claude 4.6 则处于中间水平,表现尚可,但不如获胜者那样稳定。
研究人员还发现,问题的难度非常重要。当场景简单或属于“中等”难度时,所有机器人的表现大致相同,就像一群朋友都懂得如何系鞋带一样。但当问题变得“困难”并需要复杂思考时,机器人之间的差距显著扩大。Gemini 3.1 保持了强大与聪明,而 DeepSeek V3.2 开始踉跄。有趣的是,即使在最难的“专家级”场景中,差异在统计学上也不算巨大,这可能是因为问题太难了,以至于没有任何一个模型能脱颖而出,或者是因为这类特定难题的数量不足以证明差异。
这篇论文最重要的启示是对“人工智能可以取代人类外科医生”这一观点的有力否定。研究表明,虽然这些工具可能在查证事实或学习方面有所帮助,但它们尚未准备好独立做出关乎生死的决策。“安全负担”太重了,尤其是对于较弱的模型而言。作者得出结论:在牙种植体这个高风险领域,人工智能可以是一个有用的助手,比如副驾驶,但它永远不能成为机长。人类专家必须坐在驾驶位上,检查一切,因为在涉及患者安全时,一个会胡编乱造的自信机器人是没人能承受得起的风险。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。