← 最新论文
💻 computer science

CareGuardAI: Context-Aware Multi-Agent Guardrails for Clinical Safety & Hallucination Mitigation in Patient-Facing LLMs

CareGuardAI 是一个情境感知型多智能体框架,它通过采用包含双重风险评估(SRA 和 HRA)的多阶段推理流水线,在发布前对回答进行过滤和细化,从而确保面向患者的大型语言模型的临床安全性并减轻幻觉问题。

原作者: Elham Nasarian, Abhilash Neog, Kwok-Leung Tsui, Niyousha HosseiniChimeh

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Elham Nasarian, Abhilash Neog, Kwok-Leung Tsui, Niyousha HosseiniChimeh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明、学识渊博的机器人助手,它精通医学知识。你问它:“怀孕期间可以服用阿司匹林吗?”这位 eager 想要提供帮助的机器人可能会回答:“是的,低剂量通常是可以的。”

虽然这个答案对某些人而言在技术上可能是正确的,但对于没有医生具体许可的孕妇来说,它是极度不完整且危险的。机器人忽略了背景:怀孕是一种特殊的高风险状况。

这正是CareGuardAI所要解决的问题。它是一个全新的“安全网”系统,旨在在医疗 AI 给出可能伤害患者的建议之前将其拦截。不要把它想象成一位单独的医生,而应将其视为一个高科技分诊团队,协同工作以确保每一个回答都是安全且真实的。

以下是该系统的运作方式,使用简单的类比说明:

1. 分诊护士(控制器)

当患者提出问题后,CareGuardAI 首先将其发送给一位“分诊护士”(一个小型、快速的 AI)。

  • 职责:这位护士并不直接回答问题。相反,它像医院的前台接待员一样运作。它会扫描问题,查看是否有信息缺失。
  • 类比:想象你走进医生办公室。护士不会直接递给你处方;他们会问:“你怀孕了吗?你有过敏史吗?你多大了?”
  • 作用:如果患者询问阿司匹林,分诊护士会识别出“怀孕”这个词,并将其标记为高风险。它会告诉系统的下一部分:“务必小心!这是一个敏感情况。不要给出具体的医疗指令。”

2. 撰写者(生成器)

一旦分诊护士设定了规则,“撰写者”(一个强大的 AI)就会起草回答。

  • 职责:撰写者尝试回答问题,但它戴着由分诊护士提供的“安全护目镜”。
  • 类比:如果分诊护士说“这是高风险怀孕”,那么撰写者就会被告知:“你不能说‘服用此药’。你必须说‘请去看你的医生’。”
  • 结果:撰写者不会开具阿司匹林处方,而是会说:“请咨询您的产科/妇科医生,因为阿司匹林在怀孕期间可能存在风险。”

3. 双重检查员(评估器)

在回答展示给患者之前,它会经过两位并行工作的严格检查员。

  • 检查员 A(安全检查):这位检查员审视回答,看其是否在医学上具有危险性。他们使用 1 到 5 的评分标准(类似于飓风预警)。
    • 1 级:仅提供信息。
    • 5 级:“这可能致人死亡。”
    • 规则:如果评分高于 2,该回答将被拒绝。
  • 检查员 B(真实性检查):这位检查员寻找幻觉(谎言或编造的事实)。
    • 1 级:完全真实。
    • 5 级:危险的谎言。
    • 规则:如果评分高于 2,该回答将被拒绝。

4. “红灯绿灯”闸门(决策层)

这是最终的关卡。它查看两位检查员的评分。

  • 绿灯:如果两个评分都较低(安全≤2 且真实≤2),该回答将发布给患者。
  • 红灯:如果任一评分过高,该回答将被拦截。
  • “重来”循环:如果回答几乎安全但存在小错误,系统不会直接删除它。它会将其退回给撰写者,并附注:“你说了 X,但这有风险。请重试。”撰写者重新撰写,检查员再次检查。此过程最多进行三次。如果仍然不安全,系统将完全拦截该回答,并告知患者去咨询真人医生。

这与我们现在拥有的有什么不同?

大多数现有的医疗 AI 就像一个死记硬背教科书的學生。他们可以在书面考试中完美通过,但如果你问他们一个混乱的、现实生活中的问题(比如“我怀孕了而且头痛”),他们可能会给出一个忽略现实世界危险的教科书式答案。

CareGuardAI 则像一个专业团队(一名护士、一名撰写者和两名检查员),他们在让回答发出之前会停下来思考:“等等,这对这个特定的人安全吗?”

结果(论文发现)

研究人员在数千个棘手的医疗问题上测试了这个系统。

  • 安全性:没有该系统时,AI 给出危险建议的频率约为 20%。有了 CareGuardAI,这一比例降至 3% 以下。
  • 真实性:该系统阻止了 AI 编造虚假的医疗事实。
  • 速度:处理一个问题大约需要 14 秒。这比聊天机器人稍慢,但论文认为,为了确保回答不会伤害任何人,这种等待是值得的。

简而言之:CareGuardAI 不仅仅是试图让 AI 变得更聪明;它在 AI 周围构建了一个安全笼,以确保它不会给出危险或虚假的建议,特别是在患者的情况复杂或不明确时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →