← 最新论文
💬 NLP

SEMA-RAG: A Self-Evolving Multi-Agent Retrieval-Augmented Generation Framework for Medical Reasoning

SEMA-RAG 是一种自我演进的多智能体框架,通过将临床解读、迭代检索和证据裁决解耦为专门角色来增强医学推理能力,从而在多个基准测试中超越静态单轮 RAG 基线。

原作者: Yongfeng Huang, Ruiying Chen, James Cheng

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yongfeng Huang, Ruiying Chen, James Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,正在试图解开一个复杂的医学谜团。在过去,如果你向一个智能 AI 助手询问答案,它会像一名侦探那样,从图书馆抓起一份文件,瞥上一眼,随即大声喊出结论。如果那份文件略显模糊或缺少关键细节,AI 就会进行猜测,往往导致“幻觉”(即自信但错误的答案)。

这篇论文介绍了一种名为SEMA-RAG的新系统。该系统不像一名侦探那样急于得出结论,而是像一个专业的医疗团队在循环中协同工作。它将任务分解为三个截然不同的角色,模仿真实医生的思维方式:解读(Interpret)、探索(Explore)和裁决(Adjudicate)

以下是该团队的工作方式,使用简单的类比说明:

1. 解读员(“翻译官”)

角色I-Agent(解读智能体)
问题:当患者说“我在住院第 7 天出现了发烧和咳嗽”时,标准 AI 可能只会搜索“发烧和咳嗽”。它忽略了关键细节:住院第 7 天 意味着一切皆变(这提示是医院获得性感染,而非普通感冒)。
解决方案:解读员就像一名临床翻译官。它不只是阅读问题,而是将其重写为精确的“搜索蓝图”。它提取隐藏的约束条件(如“第 7 天”、“中风患者”、“医院环境”),将杂乱的人类问题转化为结构化的专业搜索查询。它确保团队在开始挖掘之前,确切知道要寻找什么。

2. 探索者(“自我进化的侦探”)

角色E-Agent(探索智能体)
问题:大多数系统搜索一次就停止。如果第一次搜索没有提供足够的证据,它们仍会进行猜测。
解决方案:探索者是一名带有“充分性计量表”的好奇侦探

  • 它首先使用解读员提供的蓝图进行搜索。
  • 随后它暂停并自问:“我们是否有足够的证据来解决这个问题?”
  • 如果答案是肯定的:它停止并进入下一步。
  • 如果答案是否定的:它不会猜测。相反,它会弄清楚究竟缺少了什么(例如:“我们知道这是医院感染,但我们不知道第 7 天是由哪种细菌引起的”)。然后,它会生成一个新的、有针对性的搜索来填补这一具体缺口。
  • 它重复这一循环,根据所发现的内容“进化”其搜索策略,直到证据完整。这就是“自我进化”的部分——它根据实时情况调整路径,而不是遵循僵硬的脚本。

3. 仲裁者(“法官”)

角色A-Agent(仲裁智能体)
问题:有时,不同的搜索结果会相互矛盾(例如,一个来源说是"A 细菌”,另一个说是"B 细菌”)。标准 AI 可能会感到困惑,或者选择它看到的第一条结果。
解决方案:仲裁者是一名严格的法官。它收集探索者 gathered 的所有证据,将其整理成一份清晰的报告,并权衡相互冲突的线索。它将证据与原始问题的约束条件进行核对,然后才选择最终答案。它确保决定是基于已发现的事实,而不仅仅是猜测。

为什么这更好?

该论文在五项不同的医学考试(如美国医学执照考试)中,将这种“团队”方法与标准 AI 系统进行了测试。

  • 结果:SEMA-RAG 团队的表现始终优于最佳单侦探系统。平均而言,其准确率提高了6.46 个百分点
  • 原因:通过分离任务,该系统避免了“认知过载”。解读员处理细微差别,探索者确保证据足够深入,仲裁者确保逻辑严密。它防止了 AI 在证据薄弱时过早做出决定。

论文中的一个现实案例

论文给出了一个案例:一名患者在住院第 7 天出现发烧。

  • 旧 AI(单轮):搜索“发烧和咳嗽”,发现肺炎链球菌是肺炎的常见原因,并选择了它。错误。它忽略了“第 7 天”这一线索。
  • SEMA-RAG(团队)
    1. 解读员将“第 7 天”标记为关键约束。
    2. 探索者进行搜索,意识到初步结果无法区分社区感染和医院感染,于是提出了一个问题:“住院 5 天后引起肺炎的细菌有哪些?”
    3. 探索者发现金黄色葡萄球菌是晚期医院感染的常见元凶。
    4. 仲裁者审查报告,看到匹配项,并正确选择了金黄色葡萄球菌

权衡

论文指出,这种“团队”方法比单轮方法需要更多的时间和计算能力,因为它会提出更多问题并检查其工作。然而,作者认为,对于高风险的医学问题,为了获得正确答案并避免危险错误,额外的成本是值得的。

简而言之:SEMA-RAG 用“思考 - 计划 - 研究 - 裁决”的团队取代了“猜测 - 检查”的 AI,确保医学答案建立在坚实的证据基础之上,而不是基于单次可能 flawed 的搜索。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →