← 最新论文
💬 NLP

From Generation to Collaboration: Using LLMs to Edit for Empathy in Healthcare

本研究表明,将大语言模型作为辅助医生润色其书面回复的编辑助手,而非作为自主生成器,能在保持事实准确性的同时显著提升感知的共情能力,并得到了用于评估情感基调和医学正确性的新型定量指标的支持。

原作者: Man Luo, Bahareh Harandizadeh, Amara Tariq, Halim Abbas, Umar Ghaffar, Christopher J Warren, Segun O. Kolade, Haidar M. Abdul-Muhsin

发布于 2026-01-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Man Luo, Bahareh Harandizadeh, Amara Tariq, Halim Abbas, Umar Ghaffar, Christopher J Warren, Segun O. Kolade, Haidar M. Abdul-Muhsin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一位医生在手术后给病人写了一份简短的便条。这份便条在医学上是完美且准确的,但显得有些枯燥、机械,就像机器人在读说明书一样。现在,想象一个 AI 试图从头开始写一份新的便条。那个 AI 可能会听起来非常温暖、亲切且体贴,但它可能会不小心编造出一些并不真实的医学事实——就像一个为了让故事更动人而信口开河的讲故事的人。

这篇论文探讨了“第三种方法”:如果 AI 不负责编写故事,而是充当医生故事的温柔编辑呢?

以下是他们研究内容的拆解,使用了简单的类比:

1. 问题所在:“冷漠的医生” vs. “撒谎的讲故事者”

  • 医生: 医生们很忙也很疲惫。他们的笔记通常简短且注重事实。他们就像是一位精密的设计师:蓝图是完美的,但房子感觉有些空旷。
  • AI 生成器: 如果你要求 AI 从头开始写一段回复,它表现得就像一个过度热情的小说家。它加入了所有正确的感受和温暖的词汇,但有时会为了让故事流畅而编造事实(幻觉)。在医学领域,编造事实是危险的。
  • 目标: 研究人员想要保留医生完美的蓝图,同时让 AI 为其“粉刷墙壁”,让房子感觉温暖宜人,而不改变其结构。

2. 解决方案:“共情编辑”

研究人员并没有让 AI 撰写整个信息,而是让 AI 编辑医生现有的信息。

  • 过程: 医生编写医疗建议。AI 查看这些内容,并加入诸如“我理解这对您来说很令人担忧”或“很高兴看到您正在康复”之类的短语,同时严格保持医生所写的医疗建议原封不动。
  • 类比: 把医生的笔记看作一张黑白素描。AI 是一位艺术家,通过添加色彩和阴影让它看起来更美观,但它绝不会重新绘制素描的线条。

3. 新工具:两份“评分卡”

为了测试这是否奏效,研究人员发明了两种新的 AI 评分方式,因为旧的测试方法不足以胜任这项特定的工作。

  • “温暖度评分”(共情排名):

    • 旧方法: 仅仅询问,“这是否友善?”
    • 新方法: 研究人员创建了一种“三方投票制”。与其强迫在“友善”或“不友善”之间做出选择,AI 评委可以说:“这两个同样友善。”这更符合人类的真实感受——有时两条信息确实一样亲切。他们发现这种新方法比之前的 AI 测试更能匹配人类的感受。
  • “真实度评分”(医学事实检查/MedFactChecking):

    • 这是一个两部分的安全性检查。
    • 部分 A(我们是否丢失了内容?): 编辑是否不小心删除了一个关键的医学事实?(就像校对员删掉了一本书的一页)。
    • 部分 B(我们是否添加了假象?): 编辑是否添加了一个原件中不存在的新事实?(就像校对员在传记中加入了一个虚构的角色)。
    • 系统会进行双向检查,以确保医生的原始事实是安全的,且没有捏造新的谎言。

4. 他们的发现

研究人员使用几种不同的 AI 模型进行了测试,并发现了明显的模式:

  • 编辑优于生成: 当 AI 从头开始撰写信息时,它虽然非常温暖,但丢失了大部分医生的特定事实(就像一位翻译为了让语言富有诗意而改变了整个故事)。当 AI 编辑 医生的笔记时,它保留了几乎所有的事实(90%+),同时听起来要温暖得多。
  • “严格编辑”效果最好: 他们尝试了两种不同类型的编辑指令。
    • 宽松指令: AI 添加了很多温暖的词汇,但开始编造一些微小的细节。
    • 严格指令: AI 被告知:“只添加温暖感,不要改变事实。”这个版本是获胜者。它保证了事实的安全,同时又增加了足以被察觉的共情感。
  • 短笔记很棘手: 当医生写下非常简短的笔记时,一些 AI 会试图通过编造细节来使内容看起来更长、更亲切,以“填补空白”。然而,表现最好的 AI 模型(Gemini)能够做到既简洁明快,又不编造内容。
  • 过度的共情 = 较低的真实度: 他们发现,如果你告诉 AI 要“极其共情”,它就会开始产生幻觉。这就像一位音乐家太沉浸在歌曲的情绪中,以至于开始弹错了音符。适度的共情才是最佳平衡点。

5. 核心结论

该论文得出结论:在医疗保健领域,AI 应该是协作式的编辑,而不是自主的创作者。

如果你让 AI 从头开始撰写医疗建议,它听起来可能很好,但在事实上有误。如果你让 AI 编辑医生的笔记,它可以将一段冰冷、事实性的信息转化为温暖的人际连接,同时不丢失医学真相。这就像是请求机器人帮你写一封情书(有风险),与请求机器人帮你润色你自己的情书(安全且有效)之间的区别。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →