Comparing Human and Large Language Model Responses to Patients Online Questions: Towards Multi-dimensional Patient-centered Support
这项研究实证比较了大语言模型与同伴对患者在线提问实验室检测结果的回复,发现虽然大语言模型在提供清晰、结构化的医学解释方面表现出色,但同伴能提供更具个性化的情感支持,这表明如果大语言模型能够提升其情感深度、推理透明度以及与社区规范的一致性,它们可以有效地补充同伴社区。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你正站在一个名为“在线健康社区”的广阔、繁忙的数字城镇广场上。这是一个人们在生病、担忧或仅仅是对自己的身体感到好奇时聚集在一起提问和分享故事的地方。在这个城镇里,有两种主要的帮手。首先是同伴(Peers):像你我一样的普通人,他们经历过类似的健康危机。他们提供温暖的拥抱、共同的故事以及一种“我也经历过”式的慰藉。其次是大语言模型(LLMs)。把它们想象成极其聪明、反应极快的机器人,它们几乎读过所有书籍和网站。它们可以像教授一样解释复杂的医学术语,并能比图书管理员更好地组织信息。
现在科学家们正在提出的一个大问题是:当有人在网上发布一份令人困惑的化验结果时,谁能提供更好的帮助?是那位理解恐惧的感性人类,还是那位掌握事实的超级智能机器人?这项研究深入探讨了正是这样的场景。它观察了当人们发布关于其化验结果的内容时,这两类截然不同的帮手是如何反应的,并检查了谁更容易阅读、谁能提供更好的情感支持,以及谁能提供最具个性化的建议。其目标并不是用机器人取代人类,而是为了弄清楚这些机器人能否在城镇广场中成为有用的“副手”,而不至于引起困惑或伤害感情。
伟大的对决:健康聊天室中的人类 vs. 机器人
研究人员设计了一个引人入胜的实验。他们从一个人们发布化验结果(如血液检查)并寻求帮助的在线健康社区中,提取了 122 个真实问题,并将这些完全相同的问题输入到四个不同的 AI “大脑”中(GPT-3.5, GPT-4o, DeepSeek-R1, 和 Mistral-7B)。他们将机器人的回答与人类用户撰写的 519 条回复进行了对比。以下是研究结果,分为四个关键类别。
1. 长度与阅读水平:机器人的唠叨
如果你向人类求助,他们可能会发一条简短、友好的短信。如果你向机器人求助,你可能会得到一部小说。研究发现,人类的回复很短,平均约为 5.09 句话。然而,机器人却非常话痨。GPT-3.5 平均为 9.26 句,GPT-4o 写了 15.83 句,DeepSeek-R1 写了 18.92 句,而 Mistral-7B 写了 13.06 句。
机器人不仅仅是说话更多,它们使用的词汇也更高级。研究人员使用两种工具(ARI 和 SMOG)测量了“可读性”。人类的评论写作水平易于高中生理解。机器人(尤其是 GPT-3.5)的写作水平稍高,更为复杂。虽然机器人的表达清晰且结构化,但有时过于冗长,使用的词汇对于那些只想了解简单测试结果的人来说可能有点难。
2. 情感支持:拥抱 vs. 励志演讲
这是最有趣的部分。你可能认为机器人是冰冷的,而人类是温暖的,但数据展示了一个惊喜的转折。
- 人类: 约 38.4% 的人类回复提供的心理支持非常少。他们通常只是给出事实或模糊的鼓励。然而,当人类真正投入情感时,他们的表现是非常多样化的。他们提供慰藉(44.3%)、宽慰(29%)和共情(12.9%)。他们分享个人故事,比如“我完全理解你的感受,因为我也经历过这个”,这让人们觉得不再孤单。
- 机器人: 机器人的情感支持水平实际上比平均水平的人类更高。大约 65% 到 71% 的机器人回复被评为具有“高”情感支持。但问题在于:它们的支持非常单一。它们主要依赖于鼓励(根据机器人的不同,范围在 42.9% 到 82% 之间)。它们会说类似“你可以做到!”或“保持坚强!”之类的话,但它们很少提供那种深刻的、具体的安慰或分享亲身经历。
隐喻: 想象一下,你因为害怕一个医疗结果而哭泣。一个人类可能会坐在你身边,陪你一起哭,然后说:“我记得当我得到这个结果时,我也很害怕,但后来发生了这些事。”一个机器人可能会站起来,递给你一张纸巾,然后说:“我理解你很害怕。这是一个艰难的时期,但你很坚强,你会度过难关的。”两者都有帮助,但机器人的拥抱感觉更像是教练的励志演讲,而不是朋友的拥抱。
3. 个性化:镜子 vs. 讲述者
谁更关注个人故事中的具体细节?令人惊讶的是,机器人在这一轮赢了。
- 机器人: 超过 90% 的机器人回复是“高度个性化”的。它们表现得像完美的镜子。如果你告诉它们你的 TSH 水平是 47.15 并且感到疲劳,它们会把这些确切的数字重复一遍,并整齐地组织起来。它们非常擅长将你凌乱的故事转化为结构化的列表。
- 人类: 只有 64% 的人类回复是高度个性化的。人类经常给出泛泛的建议,比如“希望你感觉好起来”,而没有仔细查看你发布的具体数字。然而,当人类进行个性化表达时,方式有所不同。他们不仅是镜像反射你的事实,还会加入自己的生活经验。他们可能会说:“你丈夫在患肝炎 C 型的情况下饮酒是很危险的,因为我见过我兄弟犯过这种错误。”
隐喻: 机器人就像一个超级有序的笔记本,记录下你说的每一件事并加上一份整洁的总结。人类则像是一个倾听你故事的朋友,然后讲述一个关于他们表亲也有同样问题的故事。机器人在“笔记本”方面做得更好;而人类在“讲故事”方面做得更好。
4. 透明度:“为什么” vs. “是什么”
透明度意味着解释你是如何得出答案的。帮助者是否展示了他们的推理过程?
- 人类: 约 51.6% 的人类回复具有高度透明度。他们会逐步解释自己的推理,例如:“我认为情况是这样的,因为我的医生告诉我 X,而且我读到了 Y。”即使他们错了,他们也会诚实地说明信息的来源。
- 机器人: 只有大约 28% 到 32% 的机器人回复具有高度透明度。虽然它们很有礼貌并承认自己是 AI,但它们通常在没有展示深度推理的情况下就给出了答案。它们会说“与您的医生讨论很重要”,但并不总是解释为什么在特定的语境下要给出那项特定的建议。它们通常为了安全起见而显得含糊其辞。
最终裁定:团队协作成就梦想
那么,谁赢了?论文指出,双方都无法单独取胜。机器人擅长组织信息、清晰地解释医学术语,并快速提供结构化的支持性回复。但它们缺乏人类所具备的那种深刻的、混乱的、真实的共情以及“亲身经历”。人类擅长情感连接和分享个人故事,但他们的表现并不稳定,有时很含糊,且不一定是整理复杂数据的专家。
作者们的结论是,我们不应该试图用机器人取代人类的城镇广场。相反,机器人应该是副手。想象这样一个系统:机器人首先介入,说:“这是对你化验结果的清晰解释,以及这些结果意味着什么。”然后,人类社区介入并说:“我也经历过,以下是我当时的处理方式。”
论文警告说,我们还没有准备好让机器人来主导一切。它们需要更好地理解情感,更清晰地展示其推理过程,并尊重在线社区的规则。但如果我们谨慎使用它们——作为填补空白而非接管一切的助手——它们可以成为一种强大的工具,帮助人们感到不再孤单且信息更加透明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。