← 最新论文
📊 statistics

Accelerating A/B-Tests with Counterfactual Estimation: Reducing Variance through Policy Overlap

本文提出了一种新颖的 A/B 测试协议,该协议利用策略重叠(policy overlap)和 Δ\Delta-离策估计(Δ\Delta-Off-Policy Estimation)来消除一致动作带来的噪声,从而与标准方法相比,降低方差并加速对处理效应(treatment effects)的评估。

原作者: Olivier Jeunen

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Olivier Jeunen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名试图解决谜题的侦探:哪件新装置更好用?在网络平台的世界里——比如你手机上的应用程序或你访问的网站——公司会运行“A/B 测试”来寻找答案。他们将用户分为两组:A 组看到旧装置(对照组),B 组看到新装置(实验组)。通过比较每组产生的收入、点击量或时长,公司便能决定这个新装置是否值得保留。

但问题在于:互联网是混乱的。人类是不可预测的。某天用户可能会点击一切;另一天他们可能对一切视而不见。这种“噪声”使得很难判断一个新装置是真的更好,还是仅仅因为偶然发生的。为了获得清晰的答案,公司通常必须运行这些测试很长时间,或者向数百万人展示新装置,这既昂贵又缓慢。科学家们一直试图寻找切开这种噪声的方法,通常是通过数学来预测“本该发生”的情况,并从实际结果中减去这个预测值。这篇论文登场了,它提出了一个简单但强大的问题:如果我们利用“两个装置经常做完全相同的事情”这一事实,是否可以使我们的测试更快、更准确?

这篇题为《通过反事实估计加速 A/B 测试》(Accelerating A/B-Tests with Counterfactual Estimation)的论文提出了一种巧妙的新方法来运行这些实验。作者奥利维尔·热内恩(Olivier Jeunen)认为,标准的比较两种装置的方法实际上浪费了很多数据。其核心思想是:想象这两个装置是两位不同的厨师。如果两位厨师都决定为顾客做一份披萨,那么无论你雇佣了哪位厨师,结果(一份披萨)都是一样的。如果你试图通过观察这份披萨来比较这两位厨师,你学不到任何关于谁更好的信息;你只能看到披萨味道好坏带来的噪声。标准方法将这份披萨视为一个数据点,从而增加了混乱。

热内恩的论文认为,我们应该将随机选择雇佣哪位厨师的行为视为一个“元厨师”(即元策略),它混合了两个原始厨师。通过使用一种被称为“反事实估计”(Counterfactual Estimation)的数学技巧,这种新方法意识到,当两个厨师对某个动作达成一致时(例如都去做披萨),那个数据点无法告诉我们两者之间的差异。因此,新方法本质上是在说:“忽略那些披萨;只关注那些厨师产生分歧的时刻,比如一个做披萨而另一个做汉堡。”通过降低那些策略一致时的权重,并提高那些策略相异时的权重,该方法剥离了噪声。

论文在数学上证明,只要两种策略有任何重叠(即它们有时会对某个动作达成一致),这种方法总是优于标准方法。它表明,新方法的“噪声”取决于策略之间的差异程度,而不是仅仅取决于用户行为的原始混乱程度。如果策略非常相似(这在公司进行微小更新时很常见),新方法可以显著降低噪声,使测试结果更加清晰。

此外,论文还指出,我们并不一定需要将流量进行 50/50 的分配。就像厨师可能需要更多食材来测试一个风险较高的食谱一样,数学表明,为了以最快的速度获得最准确的答案,最佳的流量分配可能是不对称的(例如,将 81% 的用户发送到新装置,19% 的用户发送到旧装置)。作者还引入了一种新的训练计算机模型的方法(称为 Δ\Delta-MRDR),它专门侧重于学习策略之间的差异,而不是试图完美地预测一切。最后,他们证明了即使对于复杂的任务,如排名列表(如搜索结果),该方法同样适用,因为这里的“动作”不仅仅是一个项目,而是一整个列表。

为了测试这些想法,作者运行了数千次计算机模拟。他们创建了具有不同混乱程度和不同动作空间大小(从 10 个项目到 5,000 个项目)的虚拟世界。在这些模拟中,他们的新方法始终优于标准方法,在某些情况下将误差(方差)降低了高达 75%。他们发现,当策略非常相似时,新方法的误差几乎降至零,而旧方法仍然充满噪声。他们还证实,他们计算出的最优流量分配(在某一特定场景下约为 81% 倾向于新策略)确实是运行测试的最佳方式,与标准的 50/50 分配相比,降低了约 18% 的方差。

然而,论文谨慎地指出,这些结果来自模拟,而非在大型平台上的真实世界实时测试。虽然数学逻辑严密且模拟过程严谨,但现实世界可能会有额外的复杂情况,例如不断变化的消费习惯或对策略行为了解不全的情况。作者建议,虽然该方法已准备好投入尝试,但在实际环境中的确切表现取决于策略之间的重叠程度以及计算机模型预测用户行为的能力。

简而言之,这篇论文为一个老问题提供了全新的视角。它表明,通过意识到“一致是乏味的,而分歧才是信号所在”,我们可以运行更好的实验、节省成本并更快地做出决策。它将标准的 A/B 测试从一种钝器转变为一把精准的手术刀,利用策略往往相似这一事实,使比较变得更加锐利。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →