Formalising Sample Size Calculations for the Development of Risk Prediction Models: The Importance of Accounting for Performance Variability
本文提出了一种用于风险预测模型开发中样本量计算的新框架,该框架不再仅仅以目标预期性能指标为依据,而是通过明确考虑性能变异性,从而确保获得理想的模型校准度和稳健性的高概率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位正在尝试为一道新菜创作完美食谱的厨师。你有一份食材清单(预测因子),你想做出一个完美的食谱(模型),让每一个品尝它的人都觉得味道恰到好处。在医学领域,这些“食谱”被称为风险预测模型。它们能帮助医生根据年龄、体重和病史等信息,预测患者发生特定健康事件(如心脏病发作或感染)的可能性。但这里有一个棘手的问题:仅仅因为你的食谱在自己的厨房里味道极佳,并不意味着它在其他厨房里也会有同样的味道。如果你只制作了几批次来测试你的食谱,你可能只是碰巧撞到了完美的风味,或者仅仅是因为混合的食材不够多,就得到了一批味道奇怪、过咸的成品。这就是“变异性”(variability)的问题。科学家需要准确知道需要测试多少个批次(或患者),才能确保他们的食谱是可靠的,而不仅仅是一个幸运的巧合。
长期以来,确定所需样本量的标准方法是瞄准一个“平均”的完美结果。这就像是在说:“如果我做 1,000 批次的菜,平均味道应该是美味的。”但本文的作者 Menelaos Pavlou、Rumana Z. Omar 和 Gareth Ambler 意识到,仅仅追求平均值是不够的。有时候,即使平均水平很棒,由于食材带来的运气不好,你仍可能做出一批完全无法入口的成品。他们认为我们需要改变目标:与其仅仅希望平均值是好的,不如确保我们制作出的大多数批次实际上都是好的。他们称之为“可接受性能的概率”(Probability of Acceptable Performance)。这就像是在说:“我们需要制作足够多的批次,使得任何单次从烤箱里拿出来的批次都有 80% 的概率味道极佳”,而不是仅仅希望所有批次的平均水平是好的。
本文指出,旧有的计算样本量的方法往往会导致模型不稳定,尤其是当模型只有少量成分(预测因子)时。如果你试图用仅有的两种食材去烤一个蛋糕,你需要一个更大的厨房(更多的数据)来确保你不仅仅是在靠运气。作者通过计算机模拟证明,当你忽略这种“变异性”时,你得到的模型在纸面上看起来很好,但在现实世界中却会失败。他们提出了一种考虑了这种风险的新方法,这通常需要更大的样本量,以确保模型的稳健性。他们还研究了一种叫做“收缩”(shrinkage)的技术——这就像是温和地调整你的食谱,使其变得稍微保守一些——并发现虽然它有所帮助,但如果初始数据不足,它并不能完全解决问题。
可靠预测的食谱
把构建医学预测模型想象成训练一个机器人识别照片中的猫。你向机器人展示成千上万张照片,它从中学习模式。如果你只给它看十张照片,它可能会完美地记住这特定的十只猫,但在看到新猫时却会彻底失败。这就是“过拟合”(overfitting),它是良好预测的敌人。为了避免这种情况,科学家需要准确知道要向机器人展示多少张照片(患者)。
论文首先解释了目前决定需要多少患者的规则手册是如何关注期望值(expected value)的。想象你在掷骰子。“期望值”是你掷一百万次后得到的平均值(是 3.5)。旧方法说:“让我们掷足够多次,直到平均值为 3.5。”但作者指出其中的缺陷:如果你只掷十次,你可能每次都掷出 6,或者每次都掷出 1。长期来看平均值可能是 3.5,但你特定的这十次投掷可能会是一场灾难。在医学术语中,这意味着一个模型在许多研究中平均表现完美,但为你所在医院构建的那个特定模型可能会极其不准确。
作者引入了一个新概念:PrAP(可接受性能的概率)。与其只关心平均值,PrAP 问的是:“我们现在构建的模型有多大的概率是足够好的?”他们定义了一个“足够好”的范围,比如校准斜率在 0.85 到 1.15 之间(1 是完美的)。目标是选择一个足够大的样本量,使得有(例如)80% 的概率使性能落在该“良好”区间内。
模拟厨房
为了测试他们的想法,作者不仅仅是凭空猜测;他们运行了数千次计算机模拟。他们创建了具有不同数量“成分”(预测因子)的虚拟患者数据,范围从 4 到 28 个。他们比较了两种决定使用多少患者的方法:
- 标准方法: 计算所需的规模,使平均性能达到 0.9(接近完美)。
- 新方法: 计算所需的规模,使有 80% 的概率性能落在 0.85 到 1.15 之间。
结果令人震惊。当模型具有较少数量的预测因子(如 4 或 5 个)时,标准方法建议使用相对较小的样本量。然而,当他们实际运行模拟时,他们发现用这种小样本构建的模型表现得极其不稳定。有时它们很棒,但通常都很糟糕。获得“好”模型的概率仅为 54% 左右——基本上是抛硬币的结果!
相比之下,新方法要求更大的样本量。对于一个只有 4 个预测因子的模型,新方法要求的患者人数是标准方法的 2.7 倍。但回报是巨大的:通过这个更大的样本量,获得“好”模型的概率跃升到了目标 80%。作者发现,对于具有许多预测因子(如 18 个或更多)的模型,这两种方法建议的样本量相似;但对于更小、更简单的模型,两者的差异巨大。
“收缩”捷径?
论文还调查了一种流行的技巧,叫做收缩(shrinkage)。想象你烤了一个蛋糕,它有点太甜了。收缩就像是拿走一点点糖,让它变得更安全。在统计学中,这涉及略微降低模型预测的力量,以防止过度自信。
作者测试了使用收缩是否可以让研究人员在较小的样本量下完成任务。他们发现,收缩确实有助于提高平均性能,使模型更接近完美。然而,它也引入了一种新的“摇摆”。因为你必须估计要收缩多少,这种估计过程本身会增加不确定性。模拟显示,虽然收缩提高了获得好模型的概率,但如果样本量太小,它并不能完全解决问题。事实上,对于非常小的模型(少于 6 个预测因子),来自收缩的额外不确定性意味着获得好模型的概率并没有得到太多改善。作者认为,收缩是一个有用的工具,但不应将其作为跳过收集足够数据的“魔杖”。
现实世界的测试:心脏瓣膜手术
为了证明他们的理论不仅仅是计算机幻想,作者将他们的方法应用于一个包含 16,679 名患者的心脏瓣膜手术真实数据集。他们想要构建一个预测住院死亡风险的模型。
使用标准方法,他们计算出需要 2,250 名患者。使用他们的新 PrAP 方法,他们计算出需要 2,740 名患者。然后他们运行了一个模拟,通过反复从真实数据中抽样这些组别,来观察会发生什么。
结果证实了他们的猜想。拥有 2,250 名患者的组别(标准法)的中位性能虽然不错,但模型的差异极大。有些很棒,有些很差。拥有 2,740 名患者的组别(新法)则要一致得多。几乎所有由这个更大组别构建的模型都落入了“可接受”的范围。此外,当他们在混合中使用收缩技术时,较大的组别(2,740)在可靠性方面看到了明显的提升,而较小的组别则几乎没有看到任何收益。
总结
本文的核心信息是对“平均”结果过于乐观的警告。在医疗预测的高风险领域,如果单个模型可能出现惨败,那么平均成功率是不够的。作者建议,为了构建真正可靠的风险模型,特别是那些成分较少的模型,研究人员需要愿意收集更多的数据。他们提出了一种新的计算样本量的方法,该方法优先考虑成功的概率而非平均的成功。
虽然这可能意味着需要收集比以前认为更多的患者,但其代价是一个稳定且值得信赖的模型。正如作者所言,如果你想有 80% 的把握确保你的模型有效,你就不能仅仅瞄准平均值;你必须瞄准安全余量。他们的工作提供了实现这一目标的数学工具,确保当医生依赖一个预测模型时,那不仅仅是一个幸运的猜测,而是一个经过充分测试的食谱。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。