HemOncAgent: an artificial intelligence system for retrieving structured and narrative oncology knowledge
本文介绍了 HemOncAgent,这是一种集成了结构化知识图谱与叙述性诊疗路径的 AI 系统,旨在提供高保真、混合式的肿瘤学知识检索,从而克服单一来源系统的局限性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在复杂的癌症治疗世界中,医生必须应对两种截然不同的信息。一类是僵硬且精确的,就像一份成分目录,准确列出了哪些药物属于特定的组合,或者哪些医学代码描述了某种特定的疾病。另一类则是流动的、描述性的,存在于专家的书面笔记中,这些笔记解释了如何随时间推移来编排治疗顺序,例如何时开始一种新疗法,或如何在复发后管理患者。几十年来,旨在帮助医生的计算机系统一直难以同时处理这两者。有些系统擅长寻找确切的事实,却无法理解治疗方案的故事;而另一些系统虽然擅长阅读文本,却忽略了特定药物之间的关键联系。这种差距至关重要,因为医生在询问有关癌症护理的问题时,可能这一刻需要一份精确的药物列表,下一刻就需要一段关于治疗路径的叙述性解释。
一个研究团队构建了一个名为 HemOncAgent 的新型数字助手,以弥合这一鸿沟。该系统并没有强迫单一方法承担所有工作,而是像一位聪明的图书管理员,知道何时该查阅结构化数据库,何时该阅读详细的手册。研究人员使用数百个关于肿瘤学知识的问题对该工具进行了测试。他们发现,通过让计算机针对每个特定问题选择合适的来源,这个新系统能够高精度地回答事实性查询和复杂的治疗场景问题。结果表明,对于既包含硬数据又包含人类经验的医学知识,混合方法比仅依赖一种类型的搜索要可靠得多。
肿瘤学的挑战在于知识以两种截然不同的形式存在。一方面,有经过整理的数据库,存储着结构化的事实,例如哪些药物构成了一个特定的方案,或者哪些标准医学代码适用于某种病症。这些就像游戏的硬性规则,其中每一个元素都有其定义的地位。另一方面,有由临床医生编写的资源,描述了在实践中如何实际使用治疗方案,详细说明了在不同疾病阶段给药的先后顺序。这些叙述捕捉到了僵化数据库往往会错失的决策细微差别。虽然大型语言模型(经过大量文本训练的计算机程序)可以回答问题,但当它们缺乏访问这些特定外部来源的途径时,往往会产生幻觉或进行猜测。为了解决这个问题,研究人员开发了一个能够触达这两类资源的系统,并能根据用户的提问选择最合适的资源。
研究人员创建了 HemOncAgent,将其作为连接两个特定知识源的核心枢纽。第一个是结构化知识图谱,这是一个包含超过 126,000 个概念和 424,000 个关系的庞大网络,将药物、方案和疾病联系在一起。这个来源非常适合回答有关精确组成或监管批准的问题。第二个来源是一个包含数千页专家撰写的叙述性网站,描述了治疗路径和护理序列。当提出问题时,智能体(agent)会分析请求,并决定是查询结构化图谱、搜索叙述性文本,还是两者兼用。随后,它会检索相关信息并综合出一个最终答案。为了验证这种方法的有效性,团队将 HemOncAgent 与其他三个系统进行了对比:一个没有任何外部知识的标准语言模型,一个仅搜索叙述性文本的系统,以及一个仅查询结构化图谱的系统。
测试涉及 600 个问题,分为两组。第一组侧重于结构化事实,例如识别方案中的药物或查找特定的医学代码。第二组侧重于叙述性细节,例如确定特定疾病环境下治疗的先后顺序。结果显示出一个清晰的模式。仅搜索叙述性文本的系统在处理治疗序列方面表现良好,但在寻找确切代码或药物列表方面表现极差。相反,仅使用结构化图谱的系统在事实方面表现出色,但在寻找文本中描述的正确治疗路径方面却显得力不从心。没有外部帮助的标准语言模型在两方面表现都很差。然而,HemOncAgent 取得了最高的综合得分。它在事实性问题上达到了与专门的图谱系统相当的表现,并在叙述性问题上超越了纯文本系统,成功结合了两者的优势。
当研究人员进一步深入观察特定类型的问题时,混合系统的优势变得更加明显。对于需要精确匹配的问题,例如寻找药物分类或临床试验编号,该智能体几乎完全依赖结构化数据库,实现了近乎完美的准确度。对于关于治疗环境的问题,例如在一线治疗失败后会发生什么,该智能体主要搜索叙述性页面。在这些案例中,它的表现显著优于仅靠图谱的系统,因为后者无法找到隐藏在散文中的答案。该智能体还展示了它在必要时智能混合来源的能力,在约四分之一的叙述性问题中同时使用了图谱和文本,以确保提供完整的答案。这种灵活性使其能够在整个肿瘤学知识范围内保持高准确度。
研究人员还通过更换生成答案的基础计算机模型,测试了这些发现的稳健性。即使研究人员更换了主要的 AI 引擎,混合系统依然优于单源替代方案。虽然绝对得分略有变化,但模式保持不变:拥有获取结构化和叙述性来源的渠道,提供了持续的优势。研究人员指出,用于评估答案的自动化评分系统与第二个独立的评分系统在近 94% 的响应上达成了一致,这使得研究结果并非仅仅是某种特定评估方法的偶然现象。
尽管取得了这些成功,作者也谨慎地指出了其研究结果的局限性。用于测试的问题直接生成自该系统所搜索的相同资源,这意味着测试衡量的是系统从这些特定资源中检索信息的能力,而非其对全新的、未见过的临床场景进行推理的能力。这项研究并不声称该系统已准备好取代医生,也不声称它可以回答所有关于癌症护理的问题,因为医学指南变化迅速,且该知识库仅代表了一个时间点的快照。然而,结果有力地表明,对于跨越硬数据和人类叙述的临床知识资源,单一的搜索策略是不够的。通过允许人工智能智能体为任务选择合适的工具,研究人员展示了一种让医学信息变得更加易于获取且更加可靠的实用方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。