← 最新论文
📄 medicine

Performance of Large Language Models in Providing Patient-Oriented Information on Gingival Recession: A Comparative Study

这项比较研究发现,尽管 ChatGPT 的响应速度更快且更为简洁,但在提供关于牙龈退缩的面向患者的信息方面,ChatGPT、Google Gemini 和 Claude 的准确性和全面性相似,但专家评估人员更青睐 Gemini 和 Claude。

原作者: Sultan Albeshri

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Sultan Albeshri

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

患者越来越多地转向人工智能来了解自己的健康状况,向聊天机器人咨询从普通感冒到复杂牙科疾病的一切建议。这些被称为大语言模型的工具旨在进行自然语言对话,提供直接的答案,而非仅仅是一系列搜索链接。其中一种情况是牙龈退缩,即包围牙齿的牙龈组织向后退缩,导致牙根暴露。这种暴露可能导致敏感、龋齿和美观问题,促使许多人在就诊牙医之前先在网上寻求信息。虽然这些数字助手承诺填补患者与医学知识之间的鸿沟,但对于它们是否能提供可靠、完整且安全的信息,尤其是在对精准度要求极高的特定牙科问题方面,仍存在疑问。

最近的一项研究旨在测试三种领先的人工智能系统在处理有关牙龈退缩的问题时的表现如何。研究人员重点关注了 ChatGPT、Google Gemini 和 Claude,向每一个系统提出了相同的二十个典型患者可能会问的问题。这些询问涵盖了该病症的成因、治疗方案、风险以及术后预期。为了确保评价过程公平,五位经认证的牙周健康专家在不知道哪个程序生成回答的情况下,对每一条回复进行了评审。专家们根据信息的准确性、完整性以及各模型在整体质量方面的排名进行评估。他们还测量了每个系统生成答案所需的时间,并统计了字数。

结果显示,在核心事实方面,这三种人工智能模型的表现都非常出色。ChatGPT、Gemini 或 Claude 提供的信息的准确性或完整性之间没有显著差异。每个系统都能生成专家认为在临床上可以接受的回答,大多数回答在正确性方面都获得了高分。然而,这些模型在交付信息的方式上存在明显差异。ChatGPT 的速度最快,平均仅用不到六秒钟就能生成答案,而 Claude 则需要近十五秒。ChatGPT 生成的回答也最为简洁,平均每条约 232 个单词。相比之下,Gemini 生成的回答最长,平均为 438 个单词,而 Claude 则介于两者之间。

尽管事实质量相似,但人类专家对信息的呈现方式有着明显的偏好。当被要求按从优到劣进行排序时,Gemini 和 Claude 被选为最佳回答的频率高于 ChatGPT。专家在 38% 的案例中选择 Gemini 和 Claude 作为最佳答案,而 ChatGPT 仅在 24% 的评估中被排在首位。这表明,虽然 ChatGPT 更快且更简练,但另外两个模型提供的解释风格被专家认为更详尽或组织得更好。研究还发现,在回答术后护理和随访指导方面,这三个模型表现得尤为出色,这可能是因为这些主题依赖于标准化的指南。而在讨论具体的诊断或治疗适应症时,它们的表现则稍显不一致,因为这需要更具个性化的判断。

最终,研究结论认为,这些人工智能工具正变得足够可靠,可以作为患者教育的有益补充。它们能够提供符合专业标准的、关于牙龈退缩的准确且详细的信息。然而,研究人员强调,这些工具应当是辅助而非取代与牙科专业人士的咨询。最好的方法似乎是利用这些快速且博学的系统来获得对某种病症的初步了解,同时依靠人类专家在个人特定健康需求的背景下对这些信息进行解读。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →