Sample Size Determination Under Selection Bias: Robust Tolerance Limits for Prevalent Cohort Data
本文推导并验证了适用于多种有偏抽样方案(如权重偏差和删失)的修正分布无关容忍限公式,以解决在无法获得无偏代表性样本时传统方法的局限性,并通过加拿大健康与老龄化研究中的痴呆症数据展示了其应用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位面包师,正试图计算需要烤制多少块饼干,以确保当你从烤盘中取出两块特定的饼干(例如第 3 小的和第 10 大的)时,它们之间的空间能包含你可能制作的所有饼干尺寸中至少 80% 的分布。
在统计学领域,这被称为寻找容忍限。几十年来,统计学家一直拥有一个著名且简单的“配方”(Scheffé-Tukey 公式)来回答这个问题。如果你的饼干烤盘是整个批次的一个公平、随机的样本,那么这个配方就能完美运作。如果你盲目地挑选饼干,数学推导就是成立的。
问题所在:“有偏”的烤盘
然而,在现实生活中——特别是在追踪痴呆症患者的医学研究中——你往往无法获得一个公平、随机的烤盘。由于收集方式的原因,你可能只能得到那些“更长”或“更重”的饼干。
- 类比:想象你正在研究人们带病生存的时间长度。如果你只在人们患病一段时间后(即“现患队列”)才开始观察,你就更有可能发现那些生存时间较长的人。而那些生存期短的患者已经去世,对你来说是不可见的。
- 结果:你的样本是有偏的。这就像一个烤盘,只允许最大的饼干留下。如果你在这个有偏的烤盘上使用旧的、简单的配方,你会计算出只需要很少的饼干就能达到 80% 的覆盖率。但在现实中,你的结果会大相径庭。你会以为数据量足够,但实际上远远不够。
解决方案:为有偏世界设计的新配方
本文的作者 James McVittie、Martin Lysy 和 Masoud Asgharian 意识到,当数据存在偏差时,旧的配方会失效。他们创建了两个新的“配方”(方法)来修正数学模型,使其即使在样本存在偏斜时也能发挥作用。
“不等式”法(过度准备者):
这种方法试图通过一系列逻辑上的“如果 - 那么”规则来确保安全。这就像一位面包师,因担心有偏的烤盘,决定烤制远超必要数量的饼干,只为绝对保险。- 缺点:它虽然有效,但很浪费。它要求你收集海量的数据(巨大的样本量)以确保安全,往往会高估你实际所需的数据量。
"FFT"法(精准厨师):
这是本文的明星方法。"FFT"代表快速傅里叶变换,这是一种高级数学工具,就像概率曲线的超高速搅拌机。- 工作原理:这种方法不是靠猜测或使用松散规则,而是利用你数据的有偏形状,在数学上将其“反向搅拌”,以还原出原本公平分布的样子。随后,它计算出所需的精确饼干数量(样本量)。
- 结果:它极其精准。它能告诉你为了达到 80% 的覆盖率,确切需要研究多少人,不多也不少。
验证:模拟测试与现实检验
作者通过两种方式测试了这些新配方:
- 模拟测试:他们创建了已知“真实”答案的虚假计算机数据。当他们在有偏数据上使用旧配方时,结果惨败(预测所需人数过少)。“不等式”法则过于谨慎(预测所需人数过多)。而FFT 方法每次都正中靶心。
- 现实世界测试:他们将此方法应用于**加拿大健康与老龄化研究(CSHA)**的真实数据,该研究追踪痴呆症患者。由于该研究只捕捉到那些已被确诊的人(一个有偏样本),旧的数学方法会给出错误的答案。利用他们新的 FFT 方法,他们精确计算出还需要多少参与者才能在统计学上获得信心。
核心结论
如果你正在进行一项数据天然“有偏”的研究(例如观察那些已经带病生存了一段时间的人群),切勿使用旧的、简单的数学公式。它会欺骗你。
相反,请使用本文提出的新FFT 方法。这就像从粗略的猜测升级为激光导向的计算器。它确保你既不会浪费金钱和时间去收集过多的数据,也不会因收集过少而面临研究失败的风险。这是处理混乱、现实世界数据最高效的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。