Variance Reduction for Heavy-Tailed Monetization Metrics in Ranking Experiments via Post-Stratification
本文提出了一种结合后分层(post-stratification)与 CUPED 的实用框架,旨在降低排名实验中重尾变现指标的方差,使 ShareChat 能够以减少约 45% 的流量达到同等的统计置信度,并提升决策稳定性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是该论文的通俗易懂版解释,使用了日常生活的类比。
问题所在:A/B 测试中的“鲸鱼”问题
想象一下,你正在进行一项测试,想看看视频应用中的一个新功能是否会让用户花更多的钱。你将用户分为两组:A 组看到旧版本,B 组看到新版本。
通常情况下,你只需把 A 组所有人的消费总额加起来,然后与 B 组进行比较。但在像 ShareChat(用户会为创作者购买虚拟礼物)这样的应用中,用户的消费习惯是极度不均衡的。
把这想象成一次钓鱼旅行:
- 99.9% 的鱼是你捕捉到的几乎不值钱的小鱼。
- 0.01% 的鱼是巨大的“鲸鱼”(超级富有的用户),它们的重量相当于一辆汽车。
在标准的测试中,如果由于纯粹的运气,其中一条“鲸鱼”恰好落入了 A 组,那么 A 组看起来就像是一个巨大的成功。如果同一条“鲸鱼”落入了 B 组,B 组看起来就像是一个失败。因为这些“鲸鱼”太重了,它们会主导数学计算。它们创造了如此多的“噪声”(随机性),以至于你无法判断究竟是新功能起到了作用,还是仅仅因为你在鲸鱼分配的位置上运气好。
这意味着你必须运行测试很长时间,或者获取海量的流量才能得到可靠的答案。通常,你无法获得足够的流量,因此无法做出决策。
解决方案:给鱼缸分类
作者提出了一种被称为**后分层(Post-Stratification)**的巧妙方法,并结合了名为 CUPED 的技术来解决这个问题。
以下是其运作步骤:
1. 给鱼分类(分层)
与其将整个鱼缸里的鱼看作一个大整体,不如在开始测试之前,根据他们过去的表现将他们分到不同的桶里。
- 桶 1: “鲸鱼”(消费水平前 0.01% 的用户)。
- 桶 2: “普通用户”(其他所有人)。
2. 为桶分配权重
这里有一个神奇的技巧。当你计算最终结果时,你不能平等地累加各个桶的数据。你会根据现实世界中实际的人数比例,给不同的桶赋予不同的权重。
- 由于“鲸鱼”非常稀有,他们的桶会被赋予一个极小的权重(例如 0.0001)。
- 由于“普通用户”很常见,他们的桶会拥有巨大的权重。
类比: 想象你正在评判一场烹饪比赛。如果有一位评委是亿万富翁,他给出了 1,000,000 分,而另外 999 位评委只给了 5 分,那么这位亿万富翁的分数就会毁掉平均分。
- 旧方法: 你取所有分数的平均值。亿万富翁的分数占据了主导地位。
- 新方法: 你说:“这位亿万富翁只是一个人,所以他的分数只占总分的 0.001。那 999 位普通评委的分数占 99.9%。” 现在,亿万富翁那离谱的分数就不会剧烈地改变结果了。
3. 平滑数据(CUPED)
在每个桶内部,他们还使用了一种名为 CUPED 的技巧。这就像是将用户过去的消费行为作为一种“基准线”。
- 如果一个用户平时消费 100 美元,而在测试期间消费了 110 美元,CUPED 会说:“好吧,这只是他们原本就高的消费水平,不一定是由于新功能引起的。”
- 它减去了消费中可预测的部分,从而留下了由实验真正引起的真实变化。
结果:用更少的流量做出更快的决策
通过使用这种方法,作者在 ShareChat 取得了令人印象深刻的成果:
- 减少噪声: 他们将数据中的“噪声”(方差)降低了 99%。
- 更快的测试: 他们现在可以用减少 45% 流量的方式获得同样的置信度水平。
- 类比: 这就像是在嘈杂的房间里清晰地听到耳语,而不需要大声喊叫。你不需要更大的观众群来听到真相;你只需要更好的倾听方式。
- 可靠性: 他们在 40 多个真实的实验中测试了这种方法。该方法帮助他们发现了以前无法察觉的微小且真实的改进。
重要规则与警告
论文还指出了何时不应使用这种方法:
- 如果你正在测试的是专门针对“鲸鱼”的功能,请不要使用它。
- 类比: 如果你正在测试一个专门为富豪“鲸鱼”设计的“VIP 休息室”,你肯定不想降低他们的重要性。如果你这样做,你可能会忽略掉“VIP 休息室对他们非常有吸引力”这一事实。这种方法适用于能帮助整个用户群体的通用改进。
- 如果只有“鲸鱼”发生了变化,请不要使用它。
- 如果新功能只影响前 0.01% 的用户,这种方法会掩盖这种效应,因为它将鲸鱼视为一个低权重的微小群体。
总结
这篇论文为运行涉及金钱相关指标 A/B 测试的公司提供了一个实用的工具。通过将用户分类并降低稀有的、超高消费离群值的权重,他们可以防止“鲸鱼”劫持实验结果。这使得他们能够在不需要更多用户的情况下,更快、更自信地对产品做出决策。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。