Evaluating Safety-Critical Communication Behavior of Large Language Models Using Workflow-Embedded Multi-Agent Clinical Simulation
本研究表明,将大语言模型嵌入角色锁定、多智能体临床模拟中可以发现,虽然结构化的 ISBAR 交接减少了幻觉并提高了沟通效率,但未能消除关乎安全的遗漏,这凸显了在评估临床安全性时,对自动化评估系统进行专家人工监督的持续必要性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
医院依赖于一条精密的沟通链来保障患者安全。当护士注意到患者病情恶化时,他们必须迅速致电高级医生(称为住院医师)以报告问题并获取指令。这一升级流程的时刻至关重要;如果护士遗漏了关键细节,或者医生误解了紧急程度,患者可能会遭受本可避免的伤害。为了提供帮助,许多医院使用一种名为 ISBAR 的标准清单,其代表为:识别(Identify)、情况(Situation)、背景(Background)、评估(Assessment)和建议(Recommendation)。这一工具迫使说话者在开口前组织好思路,确保像生命体征和具体请求这类至关重要的信息不会被遗漏。
随着医院开始探索利用人工智能来辅助这些对话,一个新问题随之而来:计算机程序能否安全地处理这种高风险的沟通?大型语言模型(现代聊天机器人背后的技术)非常擅长生成类人文本。然而,如果任由它们自行发挥,它们也容易出现捏造事实或遗漏关键细节的情况。在任何此类系统被信任并应用于真实医院之前,研究人员需要一种方法来测试这些程序在置于真实的、有时间压力的医疗工作流中时,是否能表现得安全。
为了回答这个问题,科克大学(University College Cork)的一个研究小组构建了一个模拟医院病房精确流程的数字模拟环境。他们没有使用真实的患者或真实的医生。相反,他们创建了一个受控环境,由人工智能代理扮演特定角色:一个代理扮演病房护士,另一个扮演高级住院医师,第三个扮演护士长。这些代理是“角色锁定”的,这意味着计算机程序被严格指示要保持角色身份,绝不打破分配的工作去讲述故事或扮演另一个人。研究人员向这些代理输入了描述患者病情恶化的合成病例文件,例如有人患有严重感染或出血性伤口。目标是观察当患者状况恶化时,这些人工智能代理之间是如何交谈的。
研究人员通过为每个病例运行两次相同的场景来设置公平测试。在第一个版本中,护士代理以自然、非结构化的方式开始对话,就像人类在没有剧本的情况下说话一样。在第二个版本中,护士被要求使用 ISBAR 清单,按照特定的、有组织的格式传递信息。住院医师代理对这两种类型的电话做出响应,研究人员记录了由此产生的每一句对话。随后,他们使用一套复杂的自动化系统来阅读数百场此类对话,寻找特定类型的错误。他们检查护士是否遗漏了救命的细节,医生是否给出了带有明确随访时间的清晰计划,以及人工智能是否捏造了不在患者档案中的事实。
结果显示出一种令人惊讶的成功与失败并存的状态。当护士使用 ISBLAR 结构时,对话变得更加高效。对话更短,达到决策所需的轮次更少,且人工智能捏造虚假医疗事实的可能性也大大降低。在非结构化对话中,人工智能在约 26.5% 的案例中捏造了关于患者状况的细节,但在使用清单后,这一比例降至 10.0%。这表明,给人工智能一个严格的格式有助于使其立足于所提供的实事。
然而,这项研究也揭示了一个隐藏的危险。虽然结构化对话更加简洁高效,但它们并未让沟通在最关键的方面变得更安全。研究人员发现,遗漏关键信息的比例(即安全关键型遗漏)并没有下降。事实上,结构化对话中这类危险缺口的发生率略高,为 16.0%,而无结构化对话中为 11.5%。研究人员怀疑,当人工智能遵循僵化的清单时,它可能会认为自己已经涵盖了所有内容,从而停止提出人类可能会用来填补空白的澄清性问题。清单防止了人工智能编造事实,但并没有阻止它忘记说出某些本质性的东西。
为了确保计算机分析的准确性,研究人员请两位经验丰富的重症监护护士对一小部分对话进行了审查。人类专家寻找的内容与计算机相同:缺失的细节、捏造的事实以及明确的行动计划。人类护士与自动化系统并不总是达成一致。计算机在识别潜在信息缺失方面表现出色,但往往过于严苛,会将人类护士认为无关紧要的遗漏也标记出来。相反,计算机有时会忽略一些计划在现实安全性方面缺乏的部分。这种差距表明,尽管计算机可以快速扫描数千场对话,但它们仍无法像受过训练的人类那样理解临床安全的细微差别。
最终,这项工作证明了在现实的角色扮演模拟中测试人工智能,对于理解其在现实世界中的行为至关重要。研究表明,仅仅让系统遵循沟通清单就能提高效率并减少其撒谎的倾向,但这并不能保证它不会遗漏关键的安全细节。研究人员得出结论,在将此类工具用于医院之前,不仅要评估它们是否听起来礼貌或是否遵循某种格式,更要评估它们是否能可靠地传达患者病情的完整图景。通往安全医疗人工智能之路需要的不仅仅是更好的软件,更需要一个结合了自动化检查与人类专家不可替代判断力的严谨测试过程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。