✨ 要点🔬 技术摘要
在医生问诊的日常节奏中,诊断很少是一个瞬间的启示,而是一个细致、循序渐进的过程。医生收集患者病史,倾听其症状,然后面对琳琅满目的潜在检查项目。挑战不仅在于了解存在哪些检查,还在于决定下一步该进行哪项检查。过度检查会浪费时间和金钱,而错误的检查则可能延迟真相的发现或遗漏关键线索。这种平衡行为需要一种能够权衡新信息的价值与其获取成本的推理方式。几十年来,医学指南一直提供静态的清单以提供帮助,但这些规则通常是为平均水平的患者设计的,而非为站在诊室里的那个个体设计的。随着人工智能进入该领域,一个新的问题随之而来:计算机能否学会像医生一样思考,在应对不确定性的同时,在不需要庞大预设规则库的情况下,选择最有帮助的下一步?
剑桥大学的一个研究团队开发了一种名为 ACTMED 的新方法来回答这个问题。他们并没有构建一个仅仅通过查看全套数据并给出最终答案的系统,而是创建了一个模仿人类诊断中主动、迭代过程的框架。该系统将诊断过程视为一系列的选择。在每一步,它都会询问:“如果我们进行这项特定的检查,它会在多大程度上改变我们对患者病情诊断的信心?”为了回答这个问题,该系统使用大型语言模型(一种在海量文本上训练过的 AI 类型)作为一个灵活的模拟器。该系统不需要关于疾病行为的僵化数学公式,而是要求语言模型根据它已掌握的所有信息,去想象针对特定患者的某项检查结果可能是什么样的。随后,它进行多次此类模拟,以观察不同的可能结果将如何改变诊断的概率。
其核心创新在于系统如何决定何时停止。它并不只是简单地选择看起来最显而易见或最便宜的检查。相反,它会计算哪项检查预期能带来最大的不确定性降幅。如果一项检查很可能证实医生已经高度确定的怀疑,系统可能会跳过它;如果一项检查很可能澄清模糊的局面,系统则会优先考虑它。这个过程会持续进行,直到系统达到足够的置信度,并在该阶段停止索要更多数据。这模仿了资深临床医生在知道已收集到足够证据做出决策时的做法,从而避免了不必要程序的陷阱。研究人员在涉及三种不同疾病(慢性肾脏病、丙型肝炎和糖尿病)的真实世界医疗数据上测试了这种方法。在这些模拟中,系统被限制在少量的检查次数内,正如现实中的医生可能会受到预算或时间的约束一样。
结果显示,这种自适应方法优于其他几种方法。在丙型肝炎和糖尿病的案例中,该系统的诊断准确率甚至高于允许一次性看到所有可用检查结果的模型。这一反直觉的发现表明,通过仔细选择最具信息量的检查,该系统避免了因同时观察过多数据而产生的噪音和混乱。研究人员还发现,该系统非常高效,平均每次只需不到两次检查即可得出确定的诊断,而其他方法则需要完整的全部三项检查。当人类医生审查该系统的选择时,他们发现其推理在近 95% 的案例中在临床上是合理的。医生们指出,该系统的逐步逻辑让他们感到熟悉,反映了他们在权衡不确定性时的思维过程。
研究还强调了仅仅要求大型语言模型直接猜测诊断的局限性。当研究人员让模型在没有这种结构化、概率化框架的情况下自行选择检查时,模型往往会对每个患者都选择相同的几项检查,忽略了每个个体的独特细节。相比之下,新的框架迫使系统考虑每个患者的具体背景,从而实现了更具个性化且更有效的决策。研究人员强调,该工具旨在与人类医生协同工作,而非取代他们。它作为一个决策支持伙伴,提供关于下一步应进行哪些检查的建议,并解释为什么这些检查很重要。虽然当前版本最适用于像血检数值这样的结构化数据,但团队预见到未来此类系统可以帮助应对现代医学日益增长的复杂性,确保进行的每一项检查都能让医生离真相更近一步。
技术摘要:ACTMED —— 通过主动测试选择实现及时的临床诊断
问题陈述 临床诊断本质上是序列化且资源受限的,然而大多数现有的机器学习(ML)方法依赖于静态的、全观测的数据集。这些模型无法反映临床医生在实践中使用的迭代式、上下文感知型推理过程,通常假设数据是完全可用的,或将诊断视为一个静态的分类任务。这导致了效率低下,包括不必要的检测(估计占病例的 40–60%)以及在高压或资源有限环境下的延迟。此外,尽管大语言模型(LLMs)在医疗决策方面展现出潜力,但其直接部署面临着透明度、可解释性以及对概率推理遵循程度方面的挑战。目前亟需一种能够根据预期效用进行动态推理、优化测试选择,并能在无需大量特定任务训练数据的情况下与临床工作流保持一致的框架。
方法论:ACTMED 作者提出了 ACTMED (基于模型的实验设计驱动的自适应临床测试选择),这是一个将**贝叶斯实验设计(BED)与 大语言模型(LLMs)**相结合的诊断框架。其核心目标是选择下一个能够最大化减少相对于其成本的认知不确定性(知识型不确定性)的诊断测试。
基于智能体的诊断模型: 该系统在一个离散时间范围 T T T 内运行。在每个步骤 t t t ,智能体观察一部分地面真值信息 K t K_t K t ,并且必须从可用测试集 U t U_t U t 中选择一个测试 U t ′ U'_t U t ′ 。智能体的目标是最小化一个平衡诊断误差与信息获取成本的拉格朗日目标函数:L ( y , u t , λ ) = ∑ t I [ y ≠ y d t ] + λ ∑ t c ( u t ) L(y, u_t, \lambda) = \sum_t I[y \neq y_{d_t}] + \lambda \sum_t c(u_t) L ( y , u t , λ ) = t ∑ I [ y = y d t ] + λ t ∑ c ( u t ) 其中 c ( u t ) c(u_t) c ( u t ) 是测试成本,λ \lambda λ 控制两者之间的权衡。
作为代理采样器的 LLM: 由于生理动力学的显式机械模型通常无法以闭式形式存在,ACTMED 利用 LLMs 作为灵活的生成式代理模型。给定患者当前的知识库 K t K_t K t ,LLM 作为一个条件采样器,生成未观测到的测试结果的合理实现 u t ( i , j ) ∼ P ( U t ( i ) ∣ K t ) u^{(i,j)}_t \sim P(U^{(i)}_t | K_t) u t ( i , j ) ∼ P ( U t ( i ) ∣ K t ) 。这使得系统能够在无需特定任务微调或结构化训练数据的情况下,近似测试结果的条件分布。
基于 KL 散度的测试选择: 为了确定候选测试的效用,ACTMED 计算了先验信念与基于假设测试结果的后验信念之间的预期库尔贝克-莱布勒(KL)散度 。
对于每个候选测试,LLM 采样 M M M 个假设结果。
对于每个结果,估计后验概率分布。
预期信息增益计算为平均 KL 散度:E [ K L ( B ( p p o s t ) ∥ B ( p p r i o r ) ) ] = 1 M ∑ j = 1 M ( p p o s t ( j ) log p p o s t ( j ) p p r i o r ( j ) + ( 1 − p p o s t ( j ) ) log 1 − p p o s t ( j ) 1 − p p r i o r ( j ) ) E[KL(B(p_{post}) \parallel B(p_{prior}))] = \frac{1}{M} \sum_{j=1}^M \left( p^{(j)}_{post} \log \frac{p^{(j)}_{post}}{p^{(j)}_{prior}} + (1 - p^{(j)}_{post}) \log \frac{1 - p^{(j)}_{post}}{1 - p^{(j)}_{prior}} \right) E [ K L ( B ( p p os t ) ∥ B ( p p r i or ))] = M 1 j = 1 ∑ M ( p p os t ( j ) log p p r i or ( j ) p p os t ( j ) + ( 1 − p p os t ( j ) ) log 1 − p p r i or ( j ) 1 − p p os t ( j ) ) 被选中的是具有最高预期 KL 散度(经成本归一化)的测试。
自适应停止准则: 该框架采用基于“置信差距” δ = ∣ p p r i o r − θ ∣ \delta = |p_{prior} - \theta| δ = ∣ p p r i or − θ ∣ 的原则性停止规则,其中 θ \theta θ 是决策阈值(例如 0.5)。只有当新测试的预期 KL 散度足以将信念转向目标后验 q t a r g e t = θ ± γ δ q_{target} = \theta \pm \gamma\delta q t a r g e t = θ ± γ δ 时,测试才会继续。如果没有任何剩余测试预期能显著更新信念,则停止采集。
临床医生在环(Clinician-in-the-Loop): 该系统旨在支持而非取代临床医生。它提供逐步的测试建议、模拟结果和更新的风险概率,允许临床医生根据临床判断进行审查、解释和覆盖建议。
核心贡献
形式化: 作者形式化了一个透明的、逐步进行的诊断框架,使其符合临床推理,从而从静态分类转向序列化、资源感知的决策制定。
ACTMED 框架: 他们引入了一种概率方法,利用 LLMs 作为 BED 框架内的代理模拟器,根据预期的诊断效用进行自适应测试选择。
推理转向: 论文表明,将推理从 LLM 的内部潜空间转向自然语言输出空间(通过结构化采样和 KL 计算)可以提高临床决策能力。
验证: 该框架在真实世界数据集上得到了验证,显示出在诊断准确性、可解释性和资源效率方面的提升。
实验结果 作者在三个单病种数据集(慢性肾脏病、丙型肝炎、糖尿病)以及一个源自 AgentClinic 的自定义多病种 OSCE 式数据集上评估了 ACTMED。
代理保真度: LLMs(特别是 GPT-4o)在近似诊断测试结果的分布方面表现出高保真度,与经验数据相比,实现了较低的 Wasserstein 距离和能量距离。
诊断准确性: ACTMED 一致优于基准模型,包括随机选择、全局最优固定子集以及隐式 LLM 选择。值得注意的是,在丙型肝炎和糖尿病任务中,ACTMED 超越了“全特征”基准,这表明有针对性的测试选择减少了噪声和过拟合。
效率: 基于 KL 的停止准则显著减少了所需的测试次数。在保守阈值下,平均测试次数减少到不足两次(原限制为三次),同时保持或提高了准确性。
个性化: 与倾向于选择全局最优特征而忽略患者特异性的隐式选择方法不同,ACTMED 会根据个体患者的不确定性调整测试选择。
临床医生评估: 在一项涉及资深临床医生的研究中,94.5% 的 ACTMED 测试选择和风险调整被判定为在临床上是合理的。临床医生赞赏其逐步处理过程的透明度,但也指出现实世界的临床路径有时会覆盖纯粹的贝叶斯理性。
意义与主张 论文声称 ACTMED 代表了向透明、自适应且符合临床医生需求 的诊断系统迈进了一步。其主要意义在于:
泛化性: 该框架以零样本(zero-shot)方式运行,跨越不同的疾病,无需针对每种情况进行特定领域的训练数据。
资源意识: 它显式地优化了成本和时间,解决了资源受限环境下的全球性挑战。
可解释性: 通过展示中间推理过程(模拟结果和信念更新),它减轻了 LLMs 的“黑盒”性质,从而培养信任并允许人工监督。
互补性: 作者强调,目前的 LLMs 尚未准备好进行自主诊断;相反,ACTMED 将其定位为决策支持工具,用于构建并精炼诊断过程,从而减轻认知负担并减少不必要的测试。
作者承认了局限性,包括目前对二分类的依赖、需要高容量 LLMs 来生成连贯样本,以及使用结构化数值/类别数据而非自由文本报告的限制。他们总结道,虽然该框架提高了数据高效决策的能力,但未来的工作必须解决多模态数据和多标签共病问题,以充分反映现实世界的临床复杂性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。