← 最新论文
📄 medicine

Performance, safety, and repeated-query stability of large language models versus early-career urologists in urological oncology: a source-masked vignette benchmark

这项研究表明,尽管在泌尿肿瘤学领域的整体准确性、安全性及响应稳定性方面,职业生涯早期的泌尿外科医生显著优于面向消费者的生成式大语言模型,但这些模型频繁出现的安全性关键错误和不一致的输出,强调了临床医生进行监督而非自主部署的必要性。

原作者: Ahmet Tüfekçi, Eyüp Kaplan, Özlem Başgut, Görkem Durna, Süleyman Sağır, Mehmet Sakıp Erturhan

发布于 2026-09-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmet Tüfekçi, Eyüp Kaplan, Özlem Başgut, Görkem Durna, Süleyman Sağır, Mehmet Sakıp Erturhan

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代医学快速演变的格局中,人工智能已开始提供一种新型的辅助手段,它能够阅读庞大的医学文献库,并在数秒内回答复杂的问题。这些被称为大语言模型的系统通过预测紧随提示词之后的可能性最高的词汇来运作,从而使其能够针对临床场景生成连贯且往往具有说服力的回答。对于医生而言,这项技术有望成为整理信息、核查指南和支持决策的强大工具。然而,医学领域建立在精准与安全的基础之上,一个判断上的失误就可能导致改变人生的后果。医学界面临的关键问题不仅在于这些机器是否能听起来博学多才,而在于当患者健康受到威胁时,它们是否可以被信任去做出安全、一致且完整的决策。

为了回答这个问题,土耳其的一个研究小组设计了一项严格的测试,旨在观察三种流行的面向消费者的人工智能系统在处理泌尿肿瘤学(涉及泌尿系统癌症)这一高风险领域时的表现。他们创建了一百个详细的合成患者案例,涵盖了五种不同类型的癌症以及从初步诊断到长期随访的各个护理阶段。这些案例被呈现给这三个人工智能模型,以及两名刚刚完成专业培训的初级泌尿科医生。医生和机器接收到的指令完全相同,且均不允许查找答案或使用外部资源。随后,两名独立的专家在不知道答案来自人类还是机器的情况下,根据欧洲泌尿学协会建立的一套严格指南对每一个回答进行了评分。评分考察了四个方面:建议是否符合当前的医学指南、对患者是否安全、是否涵盖了所有必要步骤,以及疾病阶段是否识别正确。

结果显示,人类医生与人工智能系统之间的表现存在明显差距。两名初级泌尿科医生取得了很高的成功率,在百分之八十五和百分之八十九的案例中提供了安全且完整的答案。相比之下,人工智能模型仅在百分之六十到七十的案例中取得成功。虽然机器经常产生表面上看起来正确的答案,但它们经常遗漏关键细节,或未能包含人类医生所捕捉到的特定安全警告。最令人担忧的发现与患者安全有关。人工智能系统的回答中,大约有四分之一包含可能导致严重伤害的错误,例如推荐了对患者危险的治疗方案,或遗漏了关键的警示信号。相比之下,人类医生在仅有的百分之一或百分之二的案例中才会犯此类关乎安全的错误。

除了答案的准确性外,研究还检查了人工智能系统在被多次询问同一问题时的可靠性。在现实世界中,医生在每次复查病例时都会针对同一位患者给出相同的建议。研究人员发现,人工智能模型的表现出奇地不一致。当连续三次询问同一个患者案例时,系统给出完全相同的成功或失败分类的次数不足一半。更令人不安的是,系统有时在第一次尝试时给出安全的答案,第二次给出不安全的答案,第三次又给出了安全的答案。这种缺乏稳定性的现象意味着这些工具的输出可能会发生不可预测的变化,使得很难依靠它们来提供一致的医疗建议。

研究人员得出结论,虽然这些人工智能系统可以生成有用的信息,但它们尚未准备好在临床环境中独立运作。研究表明,这些工具目前最好的用途是作为受监督的助手,即由人类医生在将每项建议应用于患者之前进行审核。机器可以帮助整理信息或提供选项,但最终决定必须掌握在人类手中,以确保安全性和一致性。在这些系统能够达到人类专家的可靠性和安全性记录之前,它们在癌症护理中的角色应当是辅助性的,而非自主性的,应作为“第二双眼睛”而非主要的决策者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →