← 最新论文
💬 NLP

How sensitive do we want AI to be? Socio-communicative competencies of large language models in healthcare

本研究利用 IC-MD 工具评估了三种大语言模型(GPT-4o、Llama 3 和 Command R+)在医疗对话中的社会沟通能力,结果发现尽管这些模型表现出非敌意性,但它们缺乏作为医疗顾问进行安全且有效使用时所必需的一致敏感性、非侵入性和结构化技能。

原作者: Dorothee Amelung, Andrew M. Bean, Sabine C. Herpertz, Felix H. Krones, Guy Parsons, Adam Mahdi, Isabella Schneider

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Dorothee Amelung, Andrew M. Bean, Sabine C. Herpertz, Felix H. Krones, Guy Parsons, Adam Mahdi, Isabella Schneider

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走进一家图书馆,那里的管理员是一个极其聪明的机器人。这个机器人读过每一本医学教科书,甚至能比你眨眼的速度更快地背诵疾病知识。但问题在于,成为一名好医生不仅仅是掌握事实;更关乎于当人们感到恐惧、困惑或痛苦时,你如何与他们交流。这个研究领域被称为“社会沟通能力”(socio-communicative competence)。它是倾听、展现共情、整理混乱的对话以及让对方感到安全的一种艺术。我们之所以关注这一点,是因为如果我们开始使用这些超级聪明的机器人来辅助医疗,我们需要知道它们是否能处理医疗中的“人性面”,而不只是“数学面”。如果一个机器人给出了正确的答案,却让你感到被忽视或惊慌失措,它真的在提供帮助吗?

这正是来自海德堡大学和牛津大学的研究团队想要探究的问题。他们决定让三个流行的AI聊天机器人——GPT-4o、Llama 3 和 Command R+——接受一场“社交技能测试”,测试使用了1,800场人们寻求医疗帮助的真实对话。研究人员扮演着严格但公正的教练角色,根据四项特定的特质为这些机器人评分:非敌对性(保持礼貌且不粗鲁)、敏感度(展现共情并理解情感)、非侵入性(让用户做出自己的选择而不显得霸道)以及结构化(保持对话的组织性,并循序渐进地引导用户)。

结果有点喜忧参半,就像一个数学考试拿了满分却忘了说“请”的学生。机器人在礼貌方面表现出色;它们几乎从不粗鲁或具有敌意,在非敌对性上获得了高分。它们在非侵入性方面也表现得尚可,这意味着它们通常会让用户主导对话。然而,它们在敏感度方面却表现得很糟糕。虽然它们能说出“我很遗憾你生病了”,但它们经常错过那些需要更深层连接的情感线索,使得聊天感觉像是枯燥的事实交换,而非充满关怀的对话。

但最大的问题在于结构化。想象一下,你正在尝试解一个拼图,机器人把碎片一个接一个递给你,却从未告诉你这些碎片如何组合在一起,或者更糟的是,在没有解释原因的情况下中途改变了图案。在研究中,机器人经常无法提出正确的问题来获取清晰的问题全貌。它们并没有引导用户走过一条逻辑路径来弄清楚问题所在,而是直接倾倒信息,让用户承担起整理信息的全部重任。在其中一个案例中,机器人告诉用户其症状“很可能只是暂时的”,随后又在没有解释变化的情况下,将同样的症状称为“令人担忧的情况”,这让用户感到困惑和焦虑。

研究人员得出结论:虽然这些人工智能工具在医学事实方面正变得越来越强,但它们目前仍缺乏作为安全、有效的医疗顾问所需的可靠社交技能。它们还没有准备好去取代医生的“床边谈话技巧”,因为它们难以建立信任关系,也难以用稳健的手法引导对话。这项研究表明,如果我们想在医疗中使用这些机器人,我们不能仅仅教它们变得更有礼貌;我们需要教它们如何成为更好的倾听者和组织者,并且我们需要记住,机器人的职责与人类医生是不同的。在它们学会像构建句子那样有效地构建对话结构之前,它们应该被视为有用的工具,而不是你在身体不适时主要交谈的对象。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →