← 最新论文
📄 medicine

Assessing the Quality, Safety, and Readability of Large Language Model Responses from ChatGPT and Gemini for Knee Osteoarthritis Patient Education

在一项针对膝关节骨关节炎患者教育内容的比较评估中,ChatGPT 在临床医生评分的准确性和完整性方面表现优于 Gemini,尽管两款模型的生成内容在可读性水平上均超过了推荐标准,且在临床应用前均需经过专业审核。

原作者: habibullah, mubasheera

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: habibullah, mubasheera

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的膝盖疼痛,你想知道如何解决它。你没有打电话给医生,而是询问了两个不同的超级聪明的机器人图书管理员:ChatGPTGemini。你向它们提出了 36 个关于膝盖疼痛的不同问题,范围从“哪些运动有帮助?”到“我可以服用这种特定的尤那尼(Unani)药物吗?”

这项研究就像是一份对比这两个机器人图书管理员回答得有多好的成绩单。以下是研究人员发现的结果,用简单的语言进行了解释:

设置:盲测

研究人员不仅仅是询问了机器人,还请了五位经验丰富的膝盖专家(拥有超过 10 年执业经验)来为答案评分。这些医生并不知道哪个答案是由哪个机器人写的——他们对品牌进行了“盲测”。他们根据五个维度对答案进行评分:

  1. 准确性 (Accuracy): 事实是否正确?
  2. 完整性 (Completeness): 他们是讲述了整个故事,还是只讲了部分内容?
  3. 清晰度 (Clarity): 是否易于理解?
  4. 安全性 (Safety): 他们给出的建议是否可能会伤害到你?
  5. 可信度 (Trustworthiness): 他们听起来是否可靠?

他们还检查了阅读难度等级,就像检查一本书是写给 6 年级学生还是大学教授看的一样。

结果:谁赢了?

1. “事实核查”得分(准确性与完整性)

  • 获胜者:ChatGPT
  • 类比: 想象一下你在烤蛋糕。如果你索要一份食谱,Gemini 给你的食谱基本正确,但漏掉了一些关键原料(比如忘了提到你需要鸡蛋)。ChatGPT 给你的食 рецепt 不仅正确,而且包含了所有的步骤和警告。
  • 数据: 医生们给 ChatGPT 的准确性和完整性评分更高。这种差异非常显著,并非仅仅是运气使然。

2. “安全与信任”得分

  • 结果:平局。
  • 类比: 两个机器人同样谨慎,不会告诉你去做一些危险的事情(比如在没咨询医生的情况下停止服药)。两者在安全性或可信度方面并没有显著的优劣之分。

3. “阅读水平”得分

  • 获胜者:Gemini(以微弱优势)。
  • 类比: 把阅读水平想象成围栏的高度。两个机器人建造的围栏都太高了,普通人很难轻松跳过去。不过,Gemini 的围栏稍微低一点(更容易跳过去)比 ChatGPT 的围。
  • 注意点: 尽管 Gemini 的内容“更简单”,但两个机器人的写作水平对于大多数患者来说都太难了。它们写得像大学生一样,但健康建议应该写给 6 年级或 8 年级的学生看。

“人为因素”问题

这项研究中有一个棘手的部分:负责为答案评分的五位医生并不总是达成一致。

  • 类比: 想象五位才艺表演赛的评委。如果一位评委给歌手打 4/5 分,而另一位给 2/5 分,很难判断谁是对的。
  • 这意味着: 医生们在判断“清晰度”或“安全性”时难以达成共识。然而,当他们查看所有五位医生的平均值时,ChatGPT 和 Gemini 在准确性上的差异仍然清晰可见。

“尤那尼”转折

研究中包含了关于尤那尼医学(一种在南亚流行的传统疗法)和文化习惯(如在地上祈祷)的问题。研究人员想要看看这些机器人是否理解这些特定的文化背景。虽然研究涉及了这些问题,但主要的结论是关于回答的整体质量,而不是针对处理尤那尼医学的具体排名。

底线

如果你是一个因膝盖疼痛而向这些机器人寻求帮助的患者:

  • ChatGPT 倾向于给你提供更完整、更准确的信息,就像一本详细的百科全书。
  • Gemini 的阅读体验略微容易一些,但差距不大。
  • 两者 的写作水平可能都过于复杂,导致普通人难以轻松理解。

最后的警告: 研究人员表示,尽管 ChatGPT 表现更好,但在使用这些机器人之前,都不应在没有人类医生检查的情况下直接使用。 你不应该把机器人的回答当作最终结论;需要一位真正的医生来审核,以确保它对来说是安全且正确的。

简而言之: ChatGPT 更像是一本优秀的“教科书”,但两者都需要一位“老师”(医生)来向“学生”(患者)讲解课程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →