← 最新论文
📊 statistics

Incorporating Missing Data Considerations into Sample Size Calculations for Developing Clinical Prediction Models

本研究证明,预测变量数据的缺失会显著增加开发稳定且校准良好的临床预测模型所需的样本量,并提出了一种基于后验的样本量计算的实用改进方法,以直接纳入缺失数据假设和插补策略。

原作者: Glen P. Martin, Sian Bladon, Rebecca Whittle, Molly Wells, Gary S. Collins, Richard D. Riley

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Glen P. Martin, Sian Bladon, Rebecca Whittle, Molly Wells, Gary S. Collins, Richard D. Riley

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对该论文的解读。

全局概览:为何数据缺失时需要更多样本

想象你是一位厨师,试图创造一种新的、完美的汤食谱(即临床预测模型)。为了确保这道汤适合所有人,你需要在一个大群体中进行试吃测试。

通常,统计学家有一个“经验法则”,用来确定你需要多少试吃者才能获得可靠的食谱。他们假设你询问的每个人都能准备好所有食材(例如,他们都有盐、胡椒和胡萝卜)。

问题在于: 在现实世界中,人们经常忘记带食材。也许某人没有胡萝卜,或者他们的盐不见了。这就是数据缺失

这篇论文认为,如果你预期人们会缺少食材,那么关于需要多少试吃者的旧“经验法则”就是错误的。它太低了。如果你坚持使用旧数字,你的汤可能在小试厨房里尝起来很棒,但当你试图将其端给全世界时,结果将是一场灾难。

核心发现:缺失的食材需要更大的锅

研究人员进行了一次大规模的模拟(计算机实验),以观察在食材缺失的情况下烹饪会发生什么。

  1. “完美”场景: 如果每个人都带来了所有食材,标准的试吃者数量食谱就能正常工作。
  2. “缺失”场景: 当 20%、40% 甚至 60% 的试吃者缺少食材时,食谱开始失效。汤变得“过拟合”了。
    • 类比: 想想“过拟合”就像死记硬背某次特定的考试。如果你只学习某次练习卷上的确切题目,你可能会在那次考试中得 100 分。但如果你走进真正的考场,题目略有不同(或者有些题目缺失了),你就会不及格。该模型学习的是小型、混乱数据集中的“怪癖”,而不是真正的规律。

发现: 要在食材缺失的情况下获得同样可靠的汤食谱,你通常需要两倍的试吃者数量,而不是标准规则所建议的数量。

解决方案:新的“模拟厨房”

该论文提出了一种确定所需人数的新方法。与其仅仅进行快速的数学计算,他们建议在开始真实研究之前先运行一次模拟(预演)。

以下是他们新方法的分步运作方式:

  1. 制造一个虚假世界: 首先,你创建一个拥有 50 万人的巨大、完美的计算机世界,在那里你确切知道“真正”的汤食谱应该是什么。
  2. 破坏这个世界: 然后,你通过让一些人忘记带食材(模拟数据缺失)来故意“破坏”这个世界。
  3. 预演: 你尝试用不同的策略来煮汤:
    • 策略 A: 扔掉任何缺少食材的人(完整案例分析)。
    • 策略 B: 根据他们确实带来的食材来猜测缺失的食材(插补)。
  4. 品尝味道: 你品尝汤。它是否符合“真正”的食谱?
  5. 调整锅的大小: 如果汤尝起来不好,你就增加模拟中的试吃者数量并再次尝试。你持续这样做,直到找到确切需要的试吃者数量,以确保即使有缺失食材,汤也能尝起来不错。

关键概念通俗解释

  • 过拟合(Overfitting): 想象一个学生死记硬背了某次练习测验的答案。他得了 A。但当真正的考试来临,且有一道题目缺失时,他惊慌失措并不及格。模型之所以“过拟合”,是因为它学习的是噪声(数据缺失的怪癖),而不是信号(真正的规律)。
  • 校准斜率(Calibration Slope): 这是一个分数,告诉你模型被“收缩包裹”得有多紧。1.0 的分数是完美的。低于 0.9 的分数意味着你的模型过于自信且很可能出错。该论文发现,在数据缺失的情况下,除非你将样本量加倍,否则分数通常会降至 0.9 以下。
  • 插补(Imputation): 这是“猜测”缺失值的行为。该论文测试了不同的猜测方法(如使用随机森林或简单平均值),发现虽然猜测有帮助,但它并不能完全解决问题——你仍然需要更多数据。
  • EVPI(完美信息的期望价值): 这是一种询问“由于没有完美数据,我们损失了多少?”的复杂方式。它计算了不确定性的成本。该论文表明,数据缺失会增加这种“成本”,而在研究中增加人数可以降低它。

该论文实际说了什么(以及没说什么)

  • 他们的发现: 数据缺失会使你的模型变得不稳定且不准确。为了解决这个问题,你需要增加样本量,有时甚至需要增加一倍。
  • 他们的建议: 不要仅仅使用旧的、简单的数学公式。使用他们新的模拟方法来规划你的研究。这涉及对数据如何缺失做出假设(例如,是随机的,还是由其他因素导致的?),并在计算机模拟中测试这些假设。
  • 他们没做的事: 他们目前没有在某个具体的现实世界医院中对此进行测试。他们使用了计算机模拟和两个假设性示例(一个是有旧数据帮助猜测,另一个是必须盲目猜测)。
  • “经验法则”的替代方案: 如果你无法进行复杂的模拟,他们建议一个粗略的修正方法:将你的标准样本量数字除以 (1 - 数据缺失百分比)。例如,如果你预期有 50% 的数据缺失,你就需要双倍的样本量。然而,他们承认这只是一个粗略的猜测,模拟方法更好。

结论

如果你正在计划一项研究来构建医疗预测模型,并且你知道一些数据将会缺失(这几乎是必然的),不要信任标准的样本量计算器。它们给出的数字会太小。

相反,使用这种新的“模拟厨房”方法。它允许你测试不同的场景,并找到你真正需要招募的人数,以确保你的模型稳定、准确,并准备好应对现实世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →