← 最新论文
📄 medicine

Large Language Model Responses to Patient Questions About Return to Activities of Daily Living After Knee Arthroplasty: A Multidimensional Evaluation Before and After Plain-Language Prompting

本研究评估了通俗语言提示如何影响 ChatGPT、Gemini 和 Claude 关于膝关节置换术后恢复日常活动的土耳其语回答,发现虽然可读性和易理解性有所提高,但完整性和治疗信息质量往往有所下降,从而强调了在使用此类 AI 生成的指导之前进行专业审查的必要性。

原作者: Nevriye Ünal Süzer, Nihal Büker

发布于 2026-09-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Nevriye Ünal Süzer, Nihal Büker

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在经历重大的人工膝关节置换手术后,康复之路不仅仅是关节的愈合,更是对生活的重新掌控。患者面临着一系列实际的问题:他们什么时候可以开车?多久可以爬楼梯?哪些日常家务是可以安全尝试的?虽然医生提供了初步的路线图,但在医院度过的时间往往太短,无法回答患者回到家中后产生的每一个具体担忧。因此,许多人转向互联网寻求指导,越来越多地向人工智能系统求助。这些被称为大语言模型的计算机程序旨在理解人类语言并生成听起来像知识渊博的对话伙伴一样的答案。它们承诺填补患者教育的空白,就何时以及如何恢复正常活动提供即时、易获取的建议。

然而,来自土耳其研究人员的一项新研究提出了一个关键问题:这些机器给出的建议真的足够值得信赖吗?研究人员想知道,这些人工智能是否能为进行膝部手术的人提供安全、完整且清晰的指令,以及要求它们“简单表达”会使它们的回答变得更好还是更差。他们重点研究了三个流行的系统——ChatGPT、Gemini 和 Claude,并使用土耳其患者实际在搜索引擎中输入的真实问题对它们进行了测试。目标是观察这些工具能否成为可靠的康复伙伴,或者是否会让患者获得不完整或令人困惑的信息。

研究人员设计了一个精心的实验来测试这些系统。他们收集了十二个患者在膝部手术后常问的问题,涵盖了疼痛管理、穿衣以及在房屋内走动等主题。他们将这些问题以原始形式询问了这三个人工智能模型。然后,他们要求这些模型再次回答这些问题,但这一次增加了一个特定的指令:“请用更容易理解的方式来解释。”第二步旨在观察强制机器使用通俗语言是否能提高其帮助程度。随后,两名物理治疗师在不知道哪个模型生成了哪个答案的情况下,阅读了每一个回答。他们根据几个标准对答案进行了评分:医学事实是否正确、建议是否安全、信息是否完整,以及内容是否易于阅读和执行。

结果呈现出一幅复杂且优缺点并存的图景。在最关键的要点上,人工智能系统的表现非常出色。它们生成的每一个回答在医学上都是准确且安全的,这意味着没有任何一台机器给出了会伤害患者或违背既定医学知识的建议。这是一个重要的发现,表明对于一般安全性而言,这些工具已经相当可靠了。然而,当研究人员观察答案的完整性时,情况发生了变化。当模型被要求简化语言时,其中两个模型——ChatGPT 和 Claude——实际上变得不再完整了。为了听起来更简单,它们省略了一些重要的细节,例如具体的康复时间表或必要的预防措施。第三个模型 Gemini 则成功地在简化语言后仍保持了答案的完整性,在这一特定领域表现优于其他模型。

研究还发现,虽然语言变得更容易阅读,但关于治疗选择的信息质量却有所下降。在要求简化之后,ChatGPT 和 Claude 在解释不同治疗方案及支持决策方面的得分显著下降。似乎当这些机器试图说得更简单时,它们有时会剥离掉患者做出明智选择所需的细微差别和深度。此外,虽然文本变得更易读,但并不一定变得更具可操作性。研究人员发现,所有模型的指令在可操作性方面仅维持在百分之六十左右。这意味着虽然文字很清晰,但往往缺乏患者安全执行某项任务所需的具体、循序渐进的细节,例如具体如何移动肢体或如何进行练习。

研究人员得出结论,虽然这些人工智能工具可以提供准确且安全的通用信息,但它们尚未准备好取代物理治疗师的个性化建议。要求机器使用通俗语言虽然使文本更易读,但也可能导致其失去使建议变得有用且完整的关键细节。研究表明,这些工具可以作为患者教育的有益补充,但在患者利用其进行自我康复管理之前,其输出内容必须经过医疗专业人员的审核和调整。最好的方法仍然是一种协作模式:技术提供初步信息,而人类专家则确保这些信息符合特定患者的个人需求和安全要求。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →