← 最新论文
💻 computer science

Timely Clinical Diagnosis through Active Test Selection

本文介绍了 ACTMED,这是一个将贝叶斯实验设计与大语言模型相结合的诊断框架,旨在实现能够模拟现实世界临床推理、提高诊断准确性并保持临床医生监督的自适应、资源感知型检测选择,且无需大量的特定任务训练数据。

原作者: Silas Ruhrberg Estévez, Nicolás Astorga, Mihaela van der Schaar

发布于 2026-09-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Silas Ruhrberg Estévez, Nicolás Astorga, Mihaela van der Schaar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在医生问诊的日常节奏中,诊断很少是一个瞬间的启示,而是一个细致、循序渐进的过程。医生收集患者病史,倾听其症状,然后面对琳琅满目的潜在检查项目。挑战不仅在于了解存在哪些检查,还在于决定下一步该进行哪项检查。过度检查会浪费时间和金钱,而错误的检查则可能延迟真相的发现或遗漏关键线索。这种平衡行为需要一种能够权衡新信息的价值与其获取成本的推理方式。几十年来,医学指南一直提供静态的清单以提供帮助,但这些规则通常是为平均水平的患者设计的,而非为站在诊室里的那个个体设计的。随着人工智能进入该领域,一个新的问题随之而来:计算机能否学会像医生一样思考,在应对不确定性的同时,在不需要庞大预设规则库的情况下,选择最有帮助的下一步?

剑桥大学的一个研究团队开发了一种名为 ACTMED 的新方法来回答这个问题。他们并没有构建一个仅仅通过查看全套数据并给出最终答案的系统,而是创建了一个模仿人类诊断中主动、迭代过程的框架。该系统将诊断过程视为一系列的选择。在每一步,它都会询问:“如果我们进行这项特定的检查,它会在多大程度上改变我们对患者病情诊断的信心?”为了回答这个问题,该系统使用大型语言模型(一种在海量文本上训练过的 AI 类型)作为一个灵活的模拟器。该系统不需要关于疾病行为的僵化数学公式,而是要求语言模型根据它已掌握的所有信息,去想象针对特定患者的某项检查结果可能是什么样的。随后,它进行多次此类模拟,以观察不同的可能结果将如何改变诊断的概率。

其核心创新在于系统如何决定何时停止。它并不只是简单地选择看起来最显而易见或最便宜的检查。相反,它会计算哪项检查预期能带来最大的不确定性降幅。如果一项检查很可能证实医生已经高度确定的怀疑,系统可能会跳过它;如果一项检查很可能澄清模糊的局面,系统则会优先考虑它。这个过程会持续进行,直到系统达到足够的置信度,并在该阶段停止索要更多数据。这模仿了资深临床医生在知道已收集到足够证据做出决策时的做法,从而避免了不必要程序的陷阱。研究人员在涉及三种不同疾病(慢性肾脏病、丙型肝炎和糖尿病)的真实世界医疗数据上测试了这种方法。在这些模拟中,系统被限制在少量的检查次数内,正如现实中的医生可能会受到预算或时间的约束一样。

结果显示,这种自适应方法优于其他几种方法。在丙型肝炎和糖尿病的案例中,该系统的诊断准确率甚至高于允许一次性看到所有可用检查结果的模型。这一反直觉的发现表明,通过仔细选择最具信息量的检查,该系统避免了因同时观察过多数据而产生的噪音和混乱。研究人员还发现,该系统非常高效,平均每次只需不到两次检查即可得出确定的诊断,而其他方法则需要完整的全部三项检查。当人类医生审查该系统的选择时,他们发现其推理在近 95% 的案例中在临床上是合理的。医生们指出,该系统的逐步逻辑让他们感到熟悉,反映了他们在权衡不确定性时的思维过程。

研究还强调了仅仅要求大型语言模型直接猜测诊断的局限性。当研究人员让模型在没有这种结构化、概率化框架的情况下自行选择检查时,模型往往会对每个患者都选择相同的几项检查,忽略了每个个体的独特细节。相比之下,新的框架迫使系统考虑每个患者的具体背景,从而实现了更具个性化且更有效的决策。研究人员强调,该工具旨在与人类医生协同工作,而非取代他们。它作为一个决策支持伙伴,提供关于下一步应进行哪些检查的建议,并解释为什么这些检查很重要。虽然当前版本最适用于像血检数值这样的结构化数据,但团队预见到未来此类系统可以帮助应对现代医学日益增长的复杂性,确保进行的每一项检查都能让医生离真相更近一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →