Large Language Models for Pulmonary Embolism Health Education: A Four- Model Comparison of Reliability, Quality, and Readability
本研究对比了四种大语言模型在肺栓塞健康教育方面的表现,发现尽管 Copilot 和 Perplexity 在可靠性和溯源方面表现更优,但没有任何一个模型达到推荐的患者教育可读性标准,这凸显了专业监督的必要性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一座巨大且繁忙的图书馆,任何人都可以走进去提问。在过去,如果你询问关于可怕的医疗状况,你可能会得到一叠旧书、一篇令人困惑的报纸文章,或者来自陌生人的荒诞传闻。但最近,一种新型的“图书管理员”出现了:大语言模型(LLM)。把它们想象成超级聪明、不知疲倦的机器人,它们读过了互联网上几乎所有的文字,并且可以用平实的英语与你聊天。它们擅长写故事、解数学题,甚至回答健康问题。
但这里有一个棘手之处:当涉及到严重的健康问题时,仅仅做一个好的讲故事的人是不够的。你需要一位既了解事实,又会在不确定时承认自己不知道,还能用足够简单的语言向一个疲惫、担忧的人解释清楚的图书管理员。有一种可怕的疾病叫做肺栓塞(PE)。它就像是肺部发生的交通堵塞,由血块引起,可能非常危险。正因为如此,人们经常急于通过谷歌寻找答案。这篇论文提出了一个大问题:如果你向四位不同的 AI 图书管理员询问关于 PE 的问题,它们会给出同样好的建议吗?还是有些听起来很自信但其实是错误的,或者给出的答案太难阅读?
AI 大对决:谁是最好的健康图书管理员?
在这项研究中,来自新丰县人民医院的研究人员决定对四种最流行的 AI 聊天机器人进行测试。他们选择了 ChatGPT、Gemini、Microsoft Copilot 和 Perplexity AI。为了确保比赛公平,他们没有问机器人奇怪的、虚构的问题。相反,他们查看了过去五年内人们在谷歌上实际搜索的内容。他们找到了人们询问肺栓塞最常见的 31 个问题——比如“症状有哪些?”、“如何治疗?”以及“怀孕期间危险吗?”等。
然后,他们将这 31 个确切的问题输入到四个 AI 模型中。由于有四个模型和 31 个问题,研究人员最终得到了 124 个不同的答案待评分。他们扮演着严格教师的角色,使用四份不同的“成绩单”来检查这些答案:
- 可靠性: AI 是否承认了它知道的和不知道的?它是否展示了自己的“作业”(来源)?
- 质量: 建议是否平衡且有用?
- 可读性: 语言是否简单到足以让一名六年级学生理解?(医生通常建议健康信息的难度应为此水平,以便所有人都能理解)。
- 整体流畅度: 读起来是否顺畅?
结果:既有“好消息”,也有“坏消息”
剧情转折来了:所有四个 AI 模型都回答了每一个问题。 没有一个崩溃或拒绝交流。它们听起来都很自信,并且用清晰、流畅的句子进行写作。如果你只看第一段,它们看起来都像是乐于助人的专家。
然而,当研究人员仔细观察时,差异非常巨大。
“来源”得分(JAMA 基准):
想象一篇作文,如果你列出了参考来源,就会得到分数。只有两个模型——Copilot 和 Perplexity——注意到了展示它们的工作。它们提供了引用(指向它们获取信息的链接)。另外两个模型,ChatGPT 和 Gemini,大多只是给出答案而没有展示来源。事实上,ChatGPT 和 Gemini 在展示来源方面的得分为 0,而 Copilot 和 Perplexity 的得分略高(大约为 1 分出 4 分)。这意味着如果你想检查 AI 是否在说实话,你只能通过前两个模型来进行。
“可靠性”得分(DISCERN):
这个分数检查建议是否平衡且安全。
- Copilot 和 Perplexity 的中位得分为 41。
- ChatGPT 得分为 35。
- Gemini 得分为 33。
在一个 63 分为“优秀”、16 分为“很差”的量表中,所有四个模型都落在“差”到“一般”的范围内。即使是那两个“赢家”(Copilot 和 Perplexity)也没有达到“好”的水平。它们还可以,但并不出色。
“可读性”问题:
这是情节变得有些令人沮丧的地方。美国医学会表示,健康建议的写作水平应达到六年级阅读水平,这样无论教育程度如何,任何人都能理解。
- 研究人员使用了六种不同的数学公式来测量文本的阅读难度。
- 四个模型都没有通过测试。
- 最简单的答案仍是按照九年级水平编写的(ChatGPT)。
- 最难的答案则是按照十六年级水平编写的(Copilot),这相当于大学水平的阅读!
- “Flesch 阅读易读性”得分(分数越高越容易)在所有模型中都在 35 到 48 之间。要通过测试,它们需要达到 80 或更高。
基本上,这些 AI 机器人写的语言对于普通人来说太复杂了,尤其是在人们感到恐惧和担忧医疗紧急情况时,很难快速阅读。
结论:不要让机器人来开车
研究发现,虽然这些 AI 模型在听起来很聪明和组织信息方面表现出色,但它们还没有准备好取代医生。
- Copilot 和 Perplexity 是“更好的”学生,因为它们展示了来源并具有较好的结构,但它们使用的词汇仍然过于深奥。
- ChatGPT 和 Gemini 在展示来源方面表现稍逊,尽管它们的表达同样流畅。
- 至关重要的是,研究发现没有任何一个模型能同时结合可靠的事实、清晰的来源和简单的语言。
作者得出结论,这些 AI 工具就像是一个得力的“副驾驶”,但它们永远不应该是那个开车的人。它们可以帮助解释一种疾病是什么,或者应该向医生询问哪些问题,但它们不能诊断你,不能告诉你是否安全,也不能决定你的治疗方案。如果你使用 AI 获取健康信息,你必须记住,它可能看起来很自信,但可能是错误的,而且可能太难阅读。最好的计划是使用 AI 作为一个起点,但随后必须由真正的真人医生来核实工作。
简而言之,这些 AI 图书管理员很有礼貌且反应迅速,但它们仍在学习如何说“人类语言”,以及如何证明自己不是在胡编乱造。在它们变得更好之前,我们需要保持“人在回路中”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。