想象一下你是一名正在试图弄清楚一种新的营销手段是否真的能促使人们购买商品的侦探。在在线购物和广告的世界里,有一个著名的两步舞步:首先,用户必须点击一条广告(即“点击”),其次,他们必须真正购买产品(即“转化”)。那些点击了广告后又去购买的人所占的比例被称为转化率,或 CVR。这就像是在衡量有多少走进商店的人最终真的提着购物袋离开了。
但棘手的部分在于,如果你只观察那些点击了的人,你可能会得到错误的答案。这就像仅仅通过询问走进店里的人来评判一家餐厅的好坏,却忽略了那些看了菜单、觉得太贵而转身离开的人。那些没有点击的人,可能才是如果给他们一个不同的优惠券或更好的交易,就会购买最多的人。这被称为“选择性偏差”。科学家们长期以来一直试图利用数学方法来修复这个问题,即通过推测如果每个人都点击了会发生什么,但旧的工具在数据变得混乱或计算机模型过于灵活时往往会失效。这篇论文介入了这个侦探故事,旨在建立一个更好、更可靠的工具来破解是否一种策略真正奏效的谜团。
作者 Jiayi Dan、Bo Li 及其团队提出了一种计算这些效应的新方法,他们称之为“双重稳健”(doubly robust)估计量。把这想象成一个高科技的安全护具。在他们的方法中,他们需要对数据进行三种不同的猜测(例如,某人点击的可能性、某人购买的可能性以及广告是如何展示的)。通常情况下,如果你的其中一个猜测错了,整个计算就会崩溃。但这种新的“安全护具”很特别:它被设计成即使你对其中两项的猜测有些偏差,只要其中至少有一项是正确的,最终答案仍然是准确的。这就像是一个备用降落伞,即使第一个失效了,它依然能发挥作用。
为了让这种数学方法在现实世界中(一个可能摇晃且不稳定的环境)发挥作用,团队加入了一个聪明的技巧,叫做“目标正则化”(targeted regularization)。想象一下你正试图在骑单轮车时平衡一叠盘子。旧的数学方法就像是通过突然、剧烈的调整来平衡这一叠盘子,这经常会导致盘子掉落。而新方法则像是一个精巧的自动陀螺仪,通过细微、平滑的修正来保持堆叠的稳定,而不会使其失去平衡。他们在合成数据和来自名为 CRITEO-UPLIFTv2 的大规模数据集(包含约 1300 万个样本)的真实世界数据上测试了这个想法。结果表明,他们的新方法比旧方法更能找到真实的效应,并且即使在调整参数设置时也能保持稳定。
该论文还探讨了一个常见的诱惑:仅仅将用于预测销售额的旧有“损失去偏”(loss debiasing)技巧直接套用到这些新的因果问题上。作者发现,这种“混搭”的方法效果并不好。这就像试图通过仅仅给汽车引擎喷漆来修理破损的发动机;它看起来可能很漂亮,但引擎依然无法正常运转。他们证明了你不能只修复预测部分的数学逻辑,就指望最终答案是正确的;你必须从头开始,用正确的零件构建整个引擎。他们的新框架结合了“安全护具”与“平滑陀螺仪”,在实验中始终优于其他流行的方法,这表明它是一种更可靠的方式,可以用来判断一种营销策略究竟是在真正帮助用户,还是在损害用户体验。
技术摘要:针对 CVR 的带有目标正则化的双重稳健估计
1. 问题定义
本文解决了估计治疗(A,例如优惠券分配)对**后点击转化率(Post-click Conversion Rate, CVR)**因果效应的挑战。CVR 被定义为条件概率 P(Y2=1∣Y1=1),其中 Y1 表示点击,Y2 表示转化。目标估计量是特定治疗策略下的平均潜在 CVR:
ψa=E[P(Y2(a)=1∣Y1(a)=1,X)]
其中 X 代表协变量。
核心挑战:
- 样本选择偏差: 仅应用于已点击样本(Y1=1)的标准因果推断方法会引入偏差,因为点击事件是非随机的,且依赖于治疗。
- 现有 CVR 预测的局限性: 先前的 CVR 预测工作利用“理想损失(ideal loss)”通过在全量样本上优化无偏损失来纠正选择偏差。然而,本文指出,无偏损失在理论上并不保证最终的因果效应估计量是无偏的。
- 标准因果估计器的局限性: 直接应用插件估计器(估计扰动参数并取其比值)会导致收敛速度慢,并且对模型设定错误非常敏感,尤其是在使用灵活的非参数估计器(如神经网络)时。
2. 方法论
作者从半参数理论的角度切入,推导出了一个专门针对 CVR 结果的链式结构定制的新估计器。
A. 双重稳健(DR)估计器的构建
论文推导了目标估计量的影响函数(influence function)和 von Mises 展开。基于此,他们构建了一个新的双重稳健估计器:
ψ^adr=ψ^plug−in+Pn(ϕa(P^))
其中 ϕa(P) 是包含以下扰动参数的影响函数:
- μ1(x,a)=E(Y1∣X,A=a) (点击概率)
- μ2(x,a)=E(Y2∣X,A=a) (转化概率)
- π(a∣x) (倾向评分)
该估计器包含一个修正项,用于消除插件估计器的阶一偏差。在理论上,即使扰动参数的估计速率较慢(例如 oP(n−1/4)),只要它们的误差乘积收敛足够快,该估计器也能实现 n-一致性 和渐近正态性。这一特性在其中一个扰动估计器不一致的情况下依然成立(即双重稳健性)。
B. 目标正则化框架
为了解决直接进行一步修正(one-step correction)可能带来的数值不稳定问题(例如产生超出参数空间的估计值,或由于低点击率导致不稳定),作者提出了一个**目标正则化(Targeted Regularization)**框架。
- 他们没有采用硬性的修正步骤,而是引入了一个可学习的扰动参数 ϵ(a)(对于连续治疗,通过样条函数进行近似)。
- 在损失函数中添加了一个正则化项 R,以强制使影响函数的经验均值为零:
R=n1i=1∑n(μ^1iy2i−μ^2i−μ^1i2(y1i−μ^1i)μ^2i−π^iϵ^(ai))2
- 多任务学习: 该框架同时估计 CTR 和 CVR 的因果效应。为了强制执行“转化意味着点击”(Y2≤Y1)这一逻辑约束,模型预测 μ^2=μ^1×μ~2。
- 梯度阻断: 来自目标正则化项的梯度被阻断,不传播到倾向评分估计器 π^,以确保倾向评分估计的准确性。
3. 主要贡献
- 理论公式化: 本文从半参数视角重新审视了 CVR 因果估计,推导了影响函数,并建立了一个专门针对链式结构结果的新双重稳近估计器。文中证明了在温和假设下,该估计器具有 n-一致性。
- 实践框架: 提出了一个目标正则化框架,将双重稳健概念扩展到稳定、端到端的训练过程中,无需进行样本拆分(cross-fitting),使其适用于神经网络等复杂模型。
- 实证验证: 在合成数据、半合成数据和真实世界数据上的广泛实验表明,所提方法优于标准基准(如 DragonNet、VCNet、Causal Forest)以及现有的 CVR 特定方法。
- 新估计器的理论必要性: 本文证明了将“损失去偏(loss debiasing)”(来自 CVR 预测文献)与标准因果估计器结合使用会导致较差的结果,从而强调了直接针对最终估计量推导估计器的必要性。
4. 实验结果
- 数据集: 实验在合成数据和基于 News 数据集的半合成数据上进行。此外,还在大规模真实世界数据集(CRITEO-UPLIFTv2)上进行了实验,作者明确指出由于公开数据的限制(例如二元治疗 vs 连续治疗,缺乏目标估计量的地面真值),该数据集仅作为补充参考。
- 指标: 使用平均均方误差(AMSE)衡量合成/半合成数据;使用 AUUC 和 QINI 衡量真实世界数据集。
- 性能表现:
- 在主要的合成和半合成数据集上,所提方法显著优于所有基准模型,包括标准的 DR 估计器和“本文方法(无目标正则化)”消融实验。
- 消融研究证实了目标正则化的重要性;移除它会导致性能大幅下降,使该方法退化为稳定性较低的插件估计器。
- 该方法在不同的正则化权重超参数设置下表现出鲁棒性。
- 与结合了损失去偏和标准因果估计器的替代方法相比,本文方法更优,这证实了无偏损失并不保证无偏的因果估计。
- 在 CRITEO-UPLIFTv2 数据集上的结果进一步验证了该方法的实际应用价值,尽管作者提醒由于数据集限制,其性能可能被低估。
5. 意义与主张
本文声称提供了一个用于估计链式结构结果(如 CVR)因果效应的通用框架。其意义在于弥合了理论上的半参数效率与实际深度学习应用之间的鸿沟。
- 文中指出,现有的依赖于 CVR 预测中“理想损失”的方法对于因果效应估计是不够的,因为它们不能保证最终估计量的无偏性。
- 本文证明,通过目标正则化进行稳定的双重稳健估计器,既提供了理论保证(一致性和渐近正态性),又提供了实际稳定性(对模型设定错误和低点击率的鲁棒性)。
- 该工作旨在为电子商务和广告领域的企业决策提供解决方案,在这些领域,理解策略的阶段性效率(特别是点击后的转化效率)至关重要。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。