A closed-form sample size correction for always-valid inference with optional stopping
本文引入了一种闭式样本量修正因子,用于对始终有效序列检验中的固定样本计算进行调整,从而在无需模拟的情况下实现准确的功效估计,并使所需的样本预算比保守的最后一点规则减少 8–20%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名正在试图破解案件(即 A/B 测试)的侦探,目的是看新线索(实验组)是否比旧线索(对照组)更好。你想确保自己不会犯错,但同时也希望在获得足够证据时能立即停止调查。
问题所在:“终点陷阱”
在过去,侦探们使用一种被称为**“终点规则”(Last-Stop Rule)*的准则。他们会说:“我会每天查看证据,但我只会在第 100 天正式宣布获胜。我需要确保专门在第 100 天这一天*,我有 95% 的把握抓到罪犯。”
为了保险起见,他们会计算需要多少天才能达到这 95% 的把握。但问题在于,因为他们在第 100 天之前每天都可以查看证据,所以罪犯可能在第 10 天、第 50 天或第 99 天就被抓住了。“终点规则”忽略了所有这些早期的机会。
由于忽略了早期的机会,这个规则显得过于保守。它告诉侦探:“你需要 100 天才能确保安全”,但实际上,他们可能只需 85 天就足够安全了。这意味着他们在不必要的长期调查中浪费了时间、金钱和资源。
解决方案:“魔法乘数”
本文作者 Mårten Schultzberg 发现了一个闭式修正因子(这是一个高级数学术语,指无需进行复杂计算机模拟即可计算出的简单“魔法数字”)。
你可以把它看作是一个**“魔法乘数”**(称为 )。与其猜测要运行多久实验,不如拿你的标准“固定”计算结果乘以这个魔法数字。
- 旧方法: “我们需要 1,000 人才能确保安全。”(这实际上太多了)。
- 新方法: “我们需要 1,000 人,但乘以这个魔法数字 0.85。所以,我们只需要 850 人。”
这种新方法考虑到了你在持续检查证据这一事实。它意识到,因为你在时刻观察,所以你不需要等待那么久就能确定结果。
它是如何运作的(隐喻)
想象一下,证据就像是一个沿着山坡向上滚动的球。
- 边界(Boundary) 是山顶处的一道篱笆。如果球越过了篱笆,你就停止并宣布胜利。
- 旧规则 假设球只需要在赛道的终点越过篱笆。为了保险,他们建造了一条非常长的赛道。
- 新方法 意识到球可以在赛道的任何地方越过篱笆。
- 作者使用了一个巧妙的技巧:他们画了一条直线(切线),这条线恰好在终点处触碰到篱笆的顶端。因为篱笆是弯曲的(越往上越难越过),所以这条直线会位于实际篱笆的上方。
- 通过计算球越过这条“直线”而非“弯曲篱笆”的概率,数学计算变得简单且可解。这种直线近似法非常精确,它能准确告诉你赛道可以缩短多少。
结果:节省金钱与时间
论文将这个“魔法乘数”与 Spotify 等公司使用的三种不同类型的“篱笆”(统计边界)进行了对比测试。
- 节省程度: 通过使用这种新公式,公司可以节省 8% 到 20% 原本需要收集的样本量。
- 类比: 如果你原本计划为 100 人准备蛋糕,这种新方法会告诉你:“实际上,你只需要准备 85 人的食材,同时你仍有 95% 的把握确保蛋糕是美味的。”
- 准确性: 当他们进行数千次计算机模拟时,新方法几乎完美地达到了目标成功率(误差在 3 个百分点以内)。
- 现实世界的证明: 作者在 Spotify 实验平台的真实数据上测试了该方法。在 713 次不同的测试中,该方法使样本量中位数节省了 9.5%。这节省了大量的资金和时间。
重要限制
论文指出,当数据表现良好(如符合正态分布/钟形曲线)并且你有合理的初始数据量(称为“预热期/burn-in”)时,这个“魔法数字”效果最好。如果你测试的是非常罕见的事物(例如发生率仅为 1/10,000 的疾病),数学计算会变得不稳定,节省的效果也可能不再那么可靠。
总结
简而言之,这篇论文为实验者提供了一个简单的、预先计算好的样本量“折扣码”。它让那些允许持续监测的实验不再过度准备,从而在不牺牲结论安全性的前提下,节省了大约 10–20% 的预算。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。