← 最新论文
📊 statistics

Bayesian Inference Procedures for A/B Testing: An Overview

本文提出了一个系统的贝叶斯 A/B 测试配置三层层级结构,并论证了尽管许多商业平台使用未经校准的方法,但通过合理选择先验分布和停止规则(特别是贝叶斯因子停止法和经验贝叶斯法)对于控制诸如假阳性率、估计误差和遗憾值等不同风险至关重要。

原作者: Mårten Schultzberg, Mattias Frånberg

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Mårten Schultzberg, Mattias Frånberg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜题的侦探:“这个新线索是真的破解了案件,还是仅仅是一个幸运的猜测?”在科学和商业领域,这被称为 A/B 测试。它是比较两个版本(比如红色按钮与蓝色按钮)以观察哪一个效果更好的方法。但这里有一个棘手之处:如果你在实验运行期间不断检查结果,你可能会被随机噪声所欺骗。这就像抛硬币,如果你在看到连续三次正面时就立即停止,你可能会认为这枚硬币有魔力,但其实那只是运气。这就是“窥探”(peeking)的危险。

为了解决这个问题,科学家们使用 贝叶斯推断(Bayesian inference),这是一种随着新数据的到来不断更新信念的方法,有点像你在看电影时根据新出现的场景来更新对电影的看法。然而,实现这一目标的方法并不只有一种。有些方法像是基于直觉进行猜测,而另一些则像是使用严格的规则手册来避免虚假警报。核心问题在于:哪种方法能真正让你免于做出错误决策,而哪种方法仅仅是让你“感觉”安全?这篇论文深入探讨了这些不同方法的复杂现实,旨在弄清楚哪些方法是真正可靠的,而哪些仅仅是让你被偶然性戏耍的华丽手段。


真相的三层境界

作者马尔滕·舒尔茨伯格(Mårten Schultzberg)和马蒂亚斯·弗兰贝里(Mattias Frånberg)来自 Spotify,他们意识到人们经常把“贝叶斯 A/B 测试”当作一种单一的、神奇的工具来谈论。他们发现,它实际上是一个拥有不同超能力(以及弱点)的工具家族。为了理清思路,他们将这些工具组织成了一个三层等级体系,就像一个拥有三个难度和安全性等级的游戏。

第一层:“直觉”层(后验一致性)

想象你在玩一个游戏,你只想对自己做出的猜测感到自信。你观察数据并说:“我有 95% 的把握认为蓝色按钮更好!”这就是第一层。它在数学上是一致的,意味着你的信念更新在内部逻辑上是合理的。但问题在于:如果你不断查看结果,它对于防止虚假警报完全没有保护作用

论文显示,如果你使用“平坦先验”(基本上是从没有任何观点开始)并且只要感到 95% 确定就停止,那么你做的和“简单窥探者”完全一样。这就像你每秒钟都去检查一次硬币,并在看到连续三次正面时立即停止。论文的模拟证实,这种方法的假阳性率约为 30%(远高于人们通常想要的 5%)。它感觉很好,但非常危险。即使你尝试使用“决策论”方法(计算错误的成本),如果你没有严格的停止规则,你最终可能仍然有一半的时间是在发布一个糟糕的功能。

第二层:“防御”层(贝叶斯因子停止法)

现在,让我们增加一名保安。第二层使用了一种叫做贝叶斯因子(Bayes Factor)的东西。你可以把它看作一个分数,用于比较数据支持“版本 B 比 A 好”与“版本 B 与 A 相同”的程度。

论文发现,如果你使用适当的先验(一个合理的初始猜测)并且仅在分数超过特定界限时才停止,你就能获得一个保证。无论你窥探多少次,虚假警报的概率都会保持在你的限制之下(通常为 5%)。这意义重大。作者指出,对于许多现实世界的商业成本,这种方法几乎是决定何时停止的最佳方式。这就像有一个保镖,每次你试图进入时都会检查你的身份证,确保只有真正有实力(或真正幸运)的人才能进去。

有趣的是,论文认为在“贝叶斯”与“频率派”(另一种主要的统计学派)之间的选择往往不像人们想象的那样重要。如果你用特定的成本模型建立一个贝叶斯测试,它往往看起来和频率派测试一模一样。数学逻辑不同,但结果往往相同。

第三层:“大师”层(经验贝叶斯)

这是 VIP 区域。第三层加入了一个秘密武器:历史。它不再猜测什么是“合理的”起点,而是通过观察同一家公司过去数百次实验的数据,来学习关于效应通常有多大这一事实。

想象你是一名厨师。在第二层中,你根据食谱书来猜测该加多少盐;而在第三层中,你会查阅过去一年里你烹饪过的每一道菜的记录本,看看顾客实际喜欢多少盐。这就是所谓的经验贝叶斯(Empirical Bayes)先验。

论文显示,当你使用这种基于历史的先验时,你会获得两个惊人的好处:

  1. 自动修正:它能自然地解决同时测试过多项目的问题(多重性问题)。如果你测试了 10 个按钮,你不需要为了避免虚假警报而进行额外的数学计算;历史会为你完成这项工作。
  2. 校准收缩:它会将极端结果拉回现实。如果一项测试显示有 50% 的巨大提升,但你的历史记录显示提升通常很微小,那么这种方法会说:“这可能只是个偶然现象”,并将估计值向下调整。这防止了“赢家诅咒”(Winner's Curse),即在其实只是噪声的情况下却庆祝一个巨大的胜利。

但其中有一个陷阱。 论文警告说,这种第三层的魔力只有在你的历史记录是诚实且具有代表性时才会生效。

  • 如果你只看过去的“成功案例”(忽略了失败),你的历史就是破碎的,该方法就会失效。
  • 如果你混合了两种不同类型的实验数据(比如把蛋糕配方和汽车发动机测试混在一起),历史就会变得混乱,保护机制也会消失。
  • 你需要相当数量的历史记录(大约 200 次过去的实验)才能可靠地运行此方法。

结论:关键在于风险,而非标签

作者通过模拟实验,将这些层级与彼此以及标准的频率派方法进行了对比测试。以下是他们的发现:

  • 第一层(平坦先验 + 窥探): 对错误控制来说是一场灾难。它产生假阳性的概率约为 30%,就像简单的窥探一样。
  • 第二层(贝叶斯因子): 它能将假阳性率控制在较低水平(低于 5%),并且非常灵活。它不需要你预先决定实验要运行多久。
  • 第三层(经验贝叶斯): 当历史记录良好时,它产生的是所有方法中最准确的估计值(误差最低)。它比任何人都更能将疯狂的猜测拉回现实。
  • “期望损失”陷阱: 有些人尝试根据“我们可能会损失多少钱”来停止。论文显示,只有当发布一个糟糕的功能是免费的时候,这种方法才有效。如果发布一个糟糕的功能有任何成本(比如修复代码或惹恼用户),这种方法开始频繁地发布错误的功能。

论文的结论是,所谓“最好的”方法不在于你是贝叶斯派还是频率派。而在于你试图控制什么样的风险

  • 如果你需要绝对确定自己没有做出错误的声明,你需要 第二层或第三层
  • 如果你有大量的历史记录并想要最准确的数字,第三层是王者。
  • 如果你没有足够的历史记录,请坚持使用 第二层 并使用严格的规则来避免虚假警报。

最后,论文建议最重要的步骤不是挑选一个花哨的统计学名称,而是问自己:“如果我错了,会发生什么?”如果犯错的代价很高,你需要第二层或第三层的护栏。如果你把这种方法当作一根魔杖而不了解其背后的规则,你最终可能会为一个仅仅是幸运猜测的胜利而欢呼。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →