Diagnostic Performance of Agentic AI for Rare Disease Diagnosis: A Systematic Review, Meta-analysis, Workflow Development, and Benchmark-based Validation
本研究通过系统评价和元分析评估了代理式人工智能(Agentic AI)在罕见病诊断中的性能,识别出推理和规划等关键能力,这些能力在整合进标准化工作流后,与独立的大型语言模型相比,能显著提高诊断准确性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
对于全球数百万人口而言,诊断并非一个起点,而是一个仍无法触及的目的地。罕见病由于其本质,往往具有隐匿性。它们的症状通常表现为模糊、重叠,或仅针对个体独有,而连接这些线索所需的医学知识则散落在极少数医生在日常实践中才会接触到的专业领域中。这导致了一个被称为“诊断奥德赛”的挫折过程,患者及其家属在长年的寻找中,试图在海量的医疗数据中发现那些可能就在眼皮底下的答案。近年来,人工智能为破解这些难题提供了新的希望。具体而言,新一代智能系统已经出现,它们不仅能阅读文本,还能主动思考问题。这些系统通常被称为“智能体”(agent)系统,旨在模仿人类专家的工作方式:将复杂问题分解为较小的步骤,在外部数据库中查找信息,并在收集更多证据时不断完善其推测,而非仅仅基于单一提示进行猜测。
来自浙江中医药大学及其附属医院的研究人员致力于了解这些先进的“思考型机器”在面对罕见病这一特定挑战时的表现如何。他们并没有亲自构建一台新机器;相反,他们扮演了调查者的角色,收集并分析了在2025年至2026年间已经发表或作为预印本分享的七项不同研究的结果。这些研究在数千例罕见病病例上测试了各种版本的智能体,提出了一个简单但至关重要的问题:系统在第一次尝试时正确识别出正确疾病的频率是多少?通过整合这些独立调查的数据,研究人员描绘出了该技术的现状全景。他们发现,在超过33,000个病例中,这些智能系统在第一次尝试时得出正确诊断的比例约为一半。虽然这比依赖单一、静态模型的旧方法有了显著进步,但结果远非完美。其表现因所使用的特定系统和测试数据的类型而异,波动极大,有些设置的成功率接近80%,而有些则难以达到30%。这种不一致性表明,尽管这项技术充满前景,但它尚未成为一种统一的解决方案。
为了理解这些系统的成功与失败之处,团队仔细观察了不同智能体所使用的内部“工作流”或分步流程。他们发现,最成功的系统具有一组共同的行为特征。几乎所有有效的智能体都采用了一种策略,即将诊断任务分解为更小、更易处理的步骤,然后通过这些步骤进行推理,以完善其初步想法。它们还经常向外部医学知识库(如遗传信息数据库或罕见病登记库)寻求支持,以验证其假设。研究人员提取了这些常见的成功模式,并构建了一个简化、轻量化的工作流版本。随后,他们将这一新工作流与一组标准的50例罕见病病例进行对比测试,让这个“思考型”智能体与运行在“独立模式”下的同一底层计算机模型进行对决——在独立模式下,模型必须在没有分步流程或外部查询辅助的情况下进行猜测。
这项面对面比较的结果呈现出一个微妙的故事。当模型独立运行时,在50例病例中仅正确识别了5例首选诊断。当同一模型由结构化工作流引导时,其表现有所提升,在50例中实现了11例的首选正确诊断。虽然这代表了明显的进步,但在如此小的样本量中,其差异在统计学上尚不足以被视为决定性的胜利。然而,研究人员在观察“前五名猜测”而非仅仅是“第一名”时,发现了更令人鼓舞的现象。在工作流辅助下,模型将正确诊断纳入其前五名选择中的概率达到了50%,较基准线有了大幅跃升。这表明,虽然系统并不总是能立即锁定完美的答案,但结构化的思考过程有助于将其保持在候选范围内,从而显著缩小了可能性的范围。
研究结论指出,这些智能体已展示出辅助诊断罕见病的真实能力,但它们还不是一件完成品。不同系统之间表现的巨大差异表明,工作流的具体设计以及其访问的数据质量至关重要。研究人员强调,他们的发现是一种“概念验证”,而非最终解决方案。他们构建的工作流提供了一种改进系统思考方式的可复制方法,但仍需在更大规模和真实临床环境中进行进一步测试,以证明其可靠性。最终,目标并非用机器取代人类医生,而是创造一种协作伙伴关系,利用机器处理海量信息和遵循严密推理过程的能力来支持临床医生的判断,从而可能缩短患者等待答案的漫长且艰难的旅程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。