Treatment effect estimation by comparing observed and predicted outcomes: conditions for valid inference and practical illustration
本文利用潜在结果框架和实际案例研究,旨在阐明在将观察到的新治疗方案下的结果与来自既有模型的预测结果进行比较时(这种方法常用于放射治疗中的基于模型的临床评估),进行有效的平均治疗效应估计所必需的条件。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名试图破解谜团的侦探,但你有一个非常奇怪的规则:你只能采访目前在场的人,并且被禁止与任何留在家里的人交谈。这正是医学研究人员在想要了解一种全新的、闪亮的疗法是否真的有效时,每天面临的挣扎。通常,解决这个谜团的金标准是“随机对照试验”,即医生通过抛硬币来决定谁接受新药,谁接受旧药。但有时,抛硬币并非可行、符合伦理或足够快速的选择。也许某种新技术对于所有人进行测试成本太高,或者某种疾病过于紧迫,无法等待漫长的研究过程。
因此,研究人员尝试了一种聪明的技巧,叫做“反事实预测”(counterfactual prediction)。这就像是建造一台时光机,但它发送回过去的不是一个人,而是一个“预测”。他们选取一组接受了新疗法的患者,并询问:“如果这些人当时接受的是旧的标准疗法,会对他们产生什么影响?”为了回答这个问题,他们使用了一个“模型”——一个基于仅接受了旧标准疗法的人群的历史数据构建而成的数学配方。他们将新患者的细节代入这个配方,从而生成一个“幽灵结局”(ghost outcome),即他们在旧系统下的健康状况预测。然后,他们将新疗法的实际结果与这些幽灵预测进行比较。如果新疗法看起来更好,那就太棒了!但问题在于,这个技巧只有在配方完美、时光机没有故障、且“幽灵”与真实的人完全一致时才有效。如果这些条件中有任何一项不稳固,整个谜团都可能是一个错误的线索。
这篇由荷兰研究团队撰写的论文,旨在为侦探的工具箱进行整理。他们采用了这种直觉性的方法——将新疗法的实际结果与旧疗法的预测结果进行比较——并赋予其严谨的数学改造。他们不仅仅是说“只要小心就有效”,而是明确阐述了“小心”究竟意味着什么。作者使用一种被称为“潜在结局”(potential outcomes)的框架(这只是一个高级说法,意指“可能发生的情况”)使该方法形式化。他们确定了五个必须成立的具体条件,才能确保这种比较是公平的且结果是值得信赖的。
可以将这五个条件想象成魔术表演的五条规则。如果你打破了其中任何一条,兔子可能就不会出现,或者更糟,你掏出了鸭子却声称那是兔子。第一条规则是可迁移性(Transportability):这个“配方”(模型)在新的患者群体中必须像在旧群体中一样有效。如果新患者在模型不知道的方面(比如隐藏成分)存在差异,预测就会出错。第二条规则是治疗分配的可忽略性(Ignorability of Treatment Assignment):一旦考虑了已知信息,患者接受新治疗的原因不应与他们在旧治疗下的预期健康状况相关联。如果医生只把新疗法给那些注定会康复的“幸运”患者,模型就会产生混乱。第三条规则是一致性(Consistency):治疗的含义在每次使用时必须保持一致。如果“质子治疗”在新的医院里的含义与旧数据中的略有不同,那么这种比较就是“苹果比橘子”。第四条规则是正向性(Positivity):新患者必须看起来像是模型曾经见过的类型。你不能用一个为成年人设计的配方去预测蹒跚学步的幼儿,如果模型从未见过幼儿。第五条规则是正确的模型设定(Correct Model Specification):数学配方本身的形状必须正确。如果患者年龄与健康之间的关系是曲线型的,而配方假设它是直线型的,那么预测就会偏离。
作者通过一个涉及头颈癌患者的现实案例说明了这些规则。他们观察了一组接受了名为**质子治疗(proton therapy)的高科技放射治疗的新型患者,以观察其与标准的光子治疗(photon therapy)**相比,是否能减少吞咽困难(dysphagia)的情况。他们利用 2007 年至 2017 年间接受光子治疗的 750 名患者的数据构建了预测模型。然后,他们将该模型应用于 2018 年和 2019 年接受质子治疗的 93 名患者。结果表明,与光子治疗可能产生的结果相比,质子治疗使吞咽问题的风险降低了约 22%(差异为 -0.22)。然而,论文强调,只有在遵循所有五条规则的情况下,这个数字才是值得信赖的。
研究人员还展示了如何检查规则是否被遵守。例如,他们观察了新组中那些确实接受了标准光子治疗的患者,并检查了模型的预测是否准确。如果模型在他们身上预测正确,就说明模型对质子组“幽灵预测”的准确性更有信心。在他们的示例中,模型对光子组的预测非常出色(差异为 0.0),这是一个良好的迹象。
最终,论文得出结论:虽然这种方法是我们在无法进行完美试验时的一种强大工具,但它并不是一根魔杖。它需要通过领域专家和现实世界的数据,对所有五个条件进行系统的检查。作者警告说,如果违反了这些条件,结果可能会产生偏差,使某种疗法看起来比实际更好或更差。他们建议研究人员应该公开这些假设,并尽可能使用额外的数据来测试它们。这提醒我们,在科学领域,即使是最优雅的捷径也需要坚实的基础作为支撑。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。