Reliability and Clinical Accuracy of ChatGPT in Post-FESS Counselling: A Multi-Reviewer Evaluation.
本研究评估了 ChatGPT 在生成术后功能性内窥镜鼻窦手术(FESS)咨询方面的表现,发现虽然其在提供标准化指导方面具有可接受的可靠性,且在适用性方面具有高度的评分者间一致性,但在上下文准确性和可读性方面存在局限性,因此需要临床医生的监督。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你刚刚完成了一场复杂的鼻窦清除手术(称为 FESS)。你离开医院时脑子里有一堆问题:“这种出血正常吗?”“我什么时候可以回去工作?”“我该如何清洗鼻子?”
在过去,你必须等待医生来回答这些问题。但现在,人们开始转向像 ChatGPT 这样的 AI 聊天机器人来获取即时答案。这项研究提出了一个简单的问题:如果患者向 ChatGPT 询问这些特定的术后问题,这个机器人给出的建议是否安全、准确且易于理解?
以下是研究人员发现的结果,使用了其中一些日常类比。
设定: “机器人医生”测试
研究人员并没有随机提问。他们创建了一个严格的“考试”,包含 15 个真实的患者在鼻窦手术后通常会问的具体问题。这些问题涵盖了五个主要领域:
- 症状(例如:“出血正常吗?”)
- 鼻子清洁(例如:“我该如何清洗鼻子?”)
- 生活方式(例如:“我什么时候可以回去工作?”)
- 嗅觉(例如:“我的嗅觉会恢复吗?”)
- 药物与随访(例如:“我需要一直喷药吗?”)
他们将这些问题输入到 ChatGPT(具体为 2026 年初可用的版本)中,然后让四位真正的耳鼻喉科(ENT)医生对机器人的回答进行评分。医生们根据三个维度对回答进行 1(非常差)到 5(优秀)的评分:
- 适切性(Appropriateness): 回答是否符合当前情况?
- 有用性(Usefulness): 对患者是否有实际帮助?
- 准确性(Accuracy): 医学事实是否 100% 正确?
结果:机器人的成绩单
1. 总成绩:B+(合格,但并不完美)
机器人的平均得分为 3.9 分(满分 5 分)。
- 好消息: 机器人在“适切性”(4.1/5)和“有用性”(4.0/5)方面表现出色。它听起来像是一个乐于助人的助手,提供的建议在一般情况下感觉很到位。
- 坏消息: 它的“准确性”较低(3.6/5)。虽然建议大致安全,但其医学精确度并不总是足以独立作为医疗依据。
2. “教科书式” vs. “现实世界”
机器人的表现取决于问题的类型:
- “教科书式”问题(高分): 当被问及标准规则时,如 “我该如何清洗鼻子?” 或 “我应该服用什么药?”,机器人的表现非常出色。这些问题就像是食谱指令;它们写在书里,机器人可以完美地复制。
- “现实世界”问题(低分): 当被问及生活方式问题时,如 “我什么时候可以回去工作?” 或 “还要多久才会感觉好起来?”,机器人就显得有些力不从心。这些问题就像是询问气象预报员是否会影响你特定的野餐。机器人并不知道你的具体工作、你具体的愈合速度或你具体的健康史。它只能给出通用的回答,这可能显得含糊不清或略有偏差。
3. “语言障碍”问题
研究人员检查了机器人回答的阅读难度。
- 问题所在: 机器人的写作水平达到了大学程度(12.8 年级)。
- 类比: 想象一位老师在向孩子解释一个简单的概念,却使用了像“利用(utilize)”而不是“使用(use)”,或者“随后(subsequently)”而不是“然后(then)”这样的词汇。机器人的回答过于华丽。典型的患者可能会读完这些建议并点头表示同意,但由于语言过于复杂,他们可能无法真正理解其含义。
4. 医生们的共识
当四位人类医生对机器人进行评分时,他们的意见基本一致(特别是在是否适切这一点上)。这意味着测试是公平的,且结果是可靠的。
核心结论
研究得出结论,ChatGPT 是一个良好的“补充性”工具,就像一份学习指南或小抄。
- 它能做什么: 它可以强化标准指令(比如如何清洗鼻子)并提醒你一些通用规则。
- 它不能做什么: 它无法取代人类医生。它缺乏观察“你”这个特定个体并说出:“因为你的手术比较复杂,所以你需要等待两周才能工作,而不是一周” 的能力。
总结: 你可以使用 AI 来获取快速、通用的概览,但你仍必须听取你的主刀医生给出的最终、个性化的结论。机器人是一个得力的助手,但它不是老板。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。