Answering clinicians' questions over trial evidence tables with verifiable, feedback-driven language models
本文介绍了 FD-SCoPE,这是一个反馈驱动的语言模型框架,它通过将可执行查询与专家修正相结合,以提供可审计、高准确性的答案,从而增强临床医生从系统评价证据表中查询并获取见解的能力。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
医学进步依赖于不断的证据积累。当医生决定为患者提供哪种治疗方案时,他们会参考系统评价(systematic reviews),这些是临床试验的大规模总结。这些评价将数百项研究浓缩成一张单一的表格,其中每一行代表一项试验,每一列列出诸如所治疾病、所用药物和结果等细节。这张表格是现代医疗的基础,但它往往被锁在那些最需要它的群体之外。为了寻找特定的信息,医生通常必须请求数据分析师运行计算机查询,这一过程可能耗时数天。此外,表格仅包含明确记录的内容。如果医生想根据药物名称了解其“类别”,或者将随访时间归入有意义的类别,表格无法提供直接答案。这些缺失的细节必须通过人工处理,这是一个缓慢且易出错的任务,且因专家而异。
亚利桑那州立大学和梅奥医学中心的研究人员开发了一种新工具,旨在解锁这张被锁定的表格,让医生能够用自然语言提问并获得即时、可靠的答案。这个名为 FD-SCoPE 的系统充当了人类好奇心与结构化数据之间的桥梁。它不仅仅是猜测答案;相反,它将医生的提问转化为精确的计算机指令以找到正确的试验,然后使用一个独立的、经过验证的步骤来计算任何缺失的细节。至关重要的是,该系统能从错误中学习。当专家纠正一个答案时,系统会将该纠正保存为一个规则,确保即使涉及系统从未见过的试验,下次遇到相同问题时也能得到正确答案。
团队在包含 159 条癌症试验记录的“活证据表”(living evidence table)上测试了这种方法,这些试验涉及免疫检查点抑制剂,这是一种帮助人体免疫系统对抗癌症的药物。他们向系统提出了 140 个临床医生可能会实际提出的问题,例如“哪些 3 期试验测试了某种特定药物与化疗的结合?”或“有多少患者参与了针对特定疾病的试验?”系统正确回答了所有这些任务。相比之下,其他依赖相同底层语言模型但缺乏 FD-SCoPE 特定保障措施的方法,其正确率在 91% 到 98% 之间。这些其他方法的错误通常是因为它们未能精确匹配药物名称,或将条件应用到了错误的数据列上。FD-SCoPE 通过在生成答案前先检查表中存储的实际值,避免了这些陷阱。
然而,真正的挑战在于那些需要系统推导并非明确记录之内容的问题。例如,一项试验可能仅列出药物的通用名,但医生需要知道它是否针对特定的蛋白质。研究人员创建了 1,500 个此类问题来测试这种能力。FD-SCoce 在这些问题中成功找到了正确的试验,并以高准确度推导出了缺失的信息。它的表现优于其他四种方法,包括那些试图一次性读取整张表格或编写代码来解决问题的系统。其成功的关键在于一个两步走的过程:首先,它使用严格的计算机查询来选择相关的试验,确保考虑的是正确的患者群体。只有在选定正确试验后,系统才会计算缺失的属性。这种分离防止了系统遗漏相关研究,而在其他方法中,大约有十分之一的相关试验会被遗漏。
或许最重要的发现是,该系统如何通过反馈不断改进。研究人员模拟了一个场景,即专家审查了一组包含 299 个答案的小型数据集并纠正了其中的错误。系统将这些纠正转化为可重复使用的规则。当在包含 1,201 个系统从未见过的全新问题集上进行测试时,其准确率显著提升。对于涉及复杂细节(如药物给药方案或特定类型的治疗终点)的问题,准确率从大约 60% 跃升至 90% 以上。这证明了该系统不仅是在记忆特定的答案,它还在学习如何推导新信息的底层逻辑。然而,研究人员也发现了这种学习的局限性。如果一条规则被应用于其并非设计的提问类型,系统可能会做出自信的错误。为了防止这种情况,设计要求任何由系统学习的新规则在再次使用前必须经过专家的批准。
研究还考察了该系统处理人类语言中“混乱现实”的能力。医生经常使用缩写、品牌名而非通用名,或者出现微小的输入错误。该系统对这些变化具有鲁棒性,面对拼写错误或简写时,准确率仅有极微小的下降。它还包含了安全检查,以确保它不会被误导去篡改数据或提供超出其范围的医疗建议。研究人员谨慎地指出,虽然该系统在这些测试中表现出色,但它是基于单张癌症试验表进行的评估,尚未在现实世界的医疗环境中投入使用。结果表明,将语言模型与严格的计算机查询及专家反馈相结合,可以创造出一个强大的、可审计的工具。它让临床医生无需数据分析师,即可获取临床试验证据的全部深度,将静态表格转变为一个能够快速、精准回答复杂问题的动态资源。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。