← 最新论文
📄 medicine

GPT-4o and DeepSeek-V3 responses to common migraine questions: a cross-sectional comparative study of accuracy, completeness, empathy, readability and safety

这项横断面比较研究发现,尽管 GPT-4o 和 DeepSeek-V3 在偏头痛方面均提供了总体准确且安全的信息,但 DeepSeek-V3 在完整性和可读性方面的得分显著更高,不过在共情能力或安全性方面,两者均未表现出统一的优越性。

原作者: Ahmet Burak Elbeyli, Hasan Hüseyin Kır

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmet Burak Elbeyli, Hasan Hüseyin Kır

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

数以百万计的人正深受偏头痛的困扰,这是一种远不止于普通头痛的疾病,它会造成显著的残疾并扰乱日常生活。由于偏头痛的症状有时看起来与中风或其他严重的脑部疾病相似,患者经常转向互联网寻找答案。近年来,一种被称为大语言模型的新型计算机程序已成为获取此类信息的流行来源。这些系统可以阅读海量文本,并针对几乎任何问题生成类人化的回答,从而对诊断、诱因和治疗提供即时的解释。然而,由于这些程序并非医生,人们非常担心它们可能会提供不完整的建议、遗漏危险的预警信号,或者在患者实际需要紧急医疗护理时提供安慰。

为了了解这些数字工具在高度敏感的医疗环境中的表现如何,研究人员对两种最先进的可用系统进行了直接对比:GPT-4o 和 DeepSeek-V3。该研究专门针对人们常问的关于偏头痛的问题。研究人员从现实世界来源中收集了一百个不同的问题,包括在线搜索趋势以及患者分享经验的公共论坛上的讨论。这些问题涵盖了广泛的主题,从预警症状的性质到生活方式诱因,再到药物安全性及长期预后。为了确保评估公平且无偏见,两名神经科医生在不知道哪个计算机程序生成答案的情况下,对每个模型生成的回答进行了评审。他们根据医学事实的准确性、信息的完整性、语气是否具有同理心和支持性,以及最重要的——所给建议对患者而言是否安全,对回答进行了评分。

结果显示,这两个计算机程序通常都能提供准确且安全的信息,并在提到严重预警信号时,成功识别出寻求专业医疗帮助的需求。然而,其中一个系统,即 DeepSeek-V3,在特定领域始终优于另一个系统。它提供了更完整的回答,确保患者不仅能获得基本事实,还能获得关于替代方案和不确定性的必要背景信息。此外,DeepSeek-V3 生成的文本显著更易于阅读和理解,使用了更简单的句子结构和更清晰的语言。虽然两个模型在语气的同理心方面表现相似,且两者都足够安全,可以被视为有用的工具,但在完整性和可读性方面的差异是明显且具有统计学意义的。

在一项涉及二十五个描述危险“红旗”症状(如突然发生的史上最剧烈头痛或新的神经系统问题)的问题的特定测试中,两个模型都表现良好,正确识别了对紧急护理的需求。然而,即使在这些关键场景中,生成更清晰、更具可读性文本的系统依然保持着优势。研究人员得出结论,虽然这些人工智能工具正成为患者教育的强大盟友,但它们绝不能取代医生的评估。相反,它们最适合用于帮助人们理解一般概念并识别何时需要寻求专业帮助,前提是其回答需经过仔细审查。这项研究强调,随着这些技术的发展,它们简化并完整地传达复杂医学理念的能力,与它们呈现事实的准确性同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →