← 最新论文
📄 urology

Evaluation of Large Language Models for Post-Cystectomy Sexual Health Counseling in Women: A Pilot Study

这项初步研究评估了三种用于生成膀胱切除术后性健康咨询的大型语言模型,发现 ChatGPT 生成的响应最符合指南规范,而所有模型生成的内容的阅读复杂度均过高,且遵循程度深受提示词结构的影响。

原作者: Shafau, F., Dave, A. A., Omole, I., Guzman, T., Rehman, N., Enemchukwu, E., Bresler, L.

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Shafau, F., Dave, A. A., Omole, I., Guzman, T., Rehman, N., Enemchukwu, E., Bresler, L.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你有三位不同的“数字图书管理员”(ChatGPT、Gemini 和 Perplexity),你要求他们为即将接受一项名为膀胱切除术的大型膀胱手术的女性写一份指南。具体来说,你希望他们解释手术后会对她们的性健康和性关系产生什么影响。

这项研究就像是给这些图书管理员打的一份成绩单。研究人员想要观察两件事:

  1. 他们是否遵守了规则手册?(他们是否包含了医生应该提供的所有重要建议?)
  2. 语言是否太难理解了?(他们写得像个教授,还是像个友好的邻居?)

以下是他们的发现,已进行简单化处理:

1. “规则手册”测试(指南遵循度)

研究人员给图书管理员提供了一份基于官方医学指南的清单。他们要求图书管理员回答关于术后生活的六个不同问题。

  • 获胜者:ChatGPT 是表现最好的学生。它最紧密地遵循了规则手册,达到了约 77% 的要求点。
  • 亚军:GeminiPerplexity 的得分要低得多,分别仅达到了约 50%46% 的要求点。它们遗漏了很多关键建议。
  • “简单提问”的小技巧: 研究人员注意到一个有趣的现象。当研究人员使用简单的日常语言(就像患者会问的那样)向图书管理员提问时,它们的回答更好,且遵循规则的频率更高。当使用复杂的医学术语(就像医生会问的那样)提问时,图书管理员遵循规则的能力反而变差了。就好像这些图书管理员被那些花哨的词汇搞糊涂了,从而忘记了基础知识。

2. “阅读水平”测试(可读性)

即便图书管理员掌握了事实,如果患者看不懂答案,那也毫无意义。研究人员检查了文本的理解难度。

  • 问题所在: 这三位图书管理员写的语言都太难了。它们写的水平适合大学毕业生甚至拥有高级学位的人。
  • 现实情况: 大多数人的阅读水平在 6 年级左右。如果你把一份 12 年级或 16 年级阅读水平的小册子交给一位正为癌症手术而焦虑的患者,她们可能根本无法理解。
  • 对比: Perplexity 写出的文字最难,属于“研究生水平”的散文。Gemini 稍易一些,但仍然过于复杂。ChatGPT 是三者中相对最容易阅读的,但即使是它,对于普通人来说仍然太难了。

3. “一个核心观点”的发现

研究人员使用了一种特殊的数学工具(称为主成分分析)来观察衡量“难度”的不同方式。他们发现,所有不同的难度测试实际上都在测量完全相同的东西。这就像是有五把不同的尺子都说桌子长 6 英尺;它们并不是五种不同的测量结果,只是表达同一件事的五种方式。这证实了文本在各个方面都一致地过于复杂。

总结

把这些 AI 工具想象成知识渊博但有点笨拙的助手

  • ChatGPT 是记住重要规则最可靠的助手,但即使是它,说话的语言对于患者轻松消化来说也太华丽了。
  • Gemini 和 Perplexity 在遵循规则方面不太可靠,且使用的语言更加复杂。
  • 提示词很重要: 如果你用简单的、直白的英语向这些助手提问,它们在遵循规则方面做得比你试图听起来像个医生时还要好。

启示: 虽然这些 AI 工具可能很有帮助,但它们目前产生的信息对于患者来说过于复杂,且在包含多少重要的医学建议方面差异巨大。它们还没有准备好取代医生的谈话,尤其是在涉及癌症手术后性健康这类敏感话题时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →