← 最新论文
📄 medicine

Large Language Models for Carotid-Cavernous Fistula Patient Education: A Multidimensional Comparative Study

本研究评估并比较了由 ChatGPT、DeepSeek 和豆包生成的颈内动脉海绵窦瘘患者教育内容的质量、可靠性和可读性,发现虽然这些模型提供了有用的信息,但在内容完整性和语言复杂性方面存在显著局限性,因此需要专业的监督和进一步的优化。

原作者: Xiangyang Zhang, Guohui Xiao, Xuemin Tian

发布于 2026-09-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiangyang Zhang, Guohui Xiao, Xuemin Tian

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下一种罕见但严重的疾病,即高压动脉意外地直接连接到了眼球后方的低压静脉。这种被称为颈动脉-海绵窦瘘(carotid-cavernous fistula)的异常通路,会导致眼睛凸出、发红并失去视力,因为血液回流到了眼眶内脆弱的组织中。对于面临这一诊断的患者来说,未来的道路往往被复杂的医学术语和网络上大量零散的信息所笼罩。他们需要清晰、可靠的答案,解释为什么会发生这种情况、如何治疗以及会有什么预期,但在互联网的噪音中寻找准确的指导并非易事。近年来,人们开始转向先进的计算机程序,这些程序可以进行对话并生成文本,希望这些工具能提供他们所寻求的清晰度。然而,目前尚不清楚这些人工智能系统是否能够很好地解释如此专业的医学状况,以至于能够获得患者的信任,或被医生用于辅助教学。

一支研究小组决定通过向三个不同的聊天机器人提出二十个患者可能会问的常见问题,来测试这个问题的答案。这些问题涵盖了从疾病的病因、需要注意的症状,到诊断细节、治疗方案以及护理后的日常生活等方方面面。研究人员将这些相同的问题输入到三个流行的语言模型中,其中包括两个广为人知的国际系统和一个由中国开发的系统,并确保每个机器人都在没有额外帮助或浏览互联网的情况下进行回答。随后,他们收集了所有六十份回复,并让医学专家进行盲审,这意味着评分的医生并不知道是哪个计算机程序编写了答案。专家们根据信息的完整性和准确性、易读性以及建议对患者是否具有实用性对答案进行了评估。

研究发现,虽然这三个计算机程序都能生成连贯且通常相关的信息,但它们在执行任务时的表现并不均衡。其中一个国际模型提供的答案质量始终更高,比其他模型更可靠且结构更好。然而,即使是表现最好的回复也存在显著缺陷。最常见的问题并非计算机编造事实,而是它们遗漏了关键细节。在许多情况下,答案未能解释该病症的不同类型,没有清晰区分轻微症状与需要紧急处理的症状,或者提供了不适用于每位患者情况的过于笼统的建议。研究人员指出,缺失关键信息的情况大约发生在八分之一的回复中,这种差距可能会让患者对自己面临的风险或下一步该采取什么行动感到困惑。

另一个重大发现涉及文本的阅读难度。医学信息本身已经很复杂,但研究人员发现,这些计算机程序使用的语言往往过于深奥。这些回复通常要求的阅读水平相当于大学生水平,使用了长句和技术词汇,可能会让一个因新诊断而感到焦虑的人感到不知所措。其中一个模型生成的回复比其他模型难读得多,而即使是表现最好的模型,其使用的语言仍然比医疗专家通常推荐的患者教育语言更为复杂。这表明,虽然计算机可以获取医学事实,但它们在将这些事实转化为普通患者易于理解的简单日常语言方面仍存在困难。

尽管存在这些局限性,研究结论认为这些工具并非毫无用处;相反,它们应该被视为助手而非人类医生的替代品。人工智能系统展示了它们可以为理解该疾病提供一个坚实的起点,但不能信任它们给出最终的诊断或治疗方案。研究人员强调,对于像这样一种血流和眼压细节至关重要的专业疾病,计算机生成的信息必须经过医疗专业人员的检查和完善。最好的路径是将这些工具作为人类医疗的补充,以确保患者获得的信息不仅准确,而且完整、清晰,并符合他们的特定需求。在技术在简化复杂概念而不丢失重要细节的能力得到提升之前,人类医生仍然是引导患者应对这一病程过程中的核心向导。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →