技术摘要:实时广告交易中的竞争感知型请求分发
1. 问题陈述
实时竞价(RTB)广告交易目前普遍采用一种主流行业做法,即向需求方平台(DSP)转发几乎所有符合条件的曝光请求。然而在生产环境中,这些转发的请求中只有不到 40% 会产生出价。这种“过度分发”造成了显著的低效问题:
- 资源浪费: DSP 在计算、延迟和预算方面面临严格限制。向其灌注大量低价值流量会触发节流或选择性参与,从而降低其有效的竞价能力。
- 拍卖结果退化: 当 DSP 因流量过多而节流时,有限竞价能力的分配会变得次优,从而降低了变现效果。
- 现有解决方案的局限性: 当前的交易侧方法(例如响应率过滤)优化的是“响应概率”,而非“响应价值”对拍卖的贡献。DSP 可能会对请求做出响应,但对最终拍卖价格的竞争贡献微乎其微。
核心挑战在于优化质量与数量之间的权衡:即确定应该将哪些请求转发给哪些 DSP,以最大化拍卖的参与质量和收入,而非仅仅最大化原始流量规模。
2. 方法论
作者提出了一种竞争感知型请求分发框架,该框架集成了分布式出价建模、概率性转发以及自适应阈值优化。该系统在严格的实时约束下运行(CPU 上延迟 <7ms),同时每天处理超过 200 亿个请求。
2.1 分布式出价建模
系统利用生产级模型 Bias-LF-DCN(带有后期融合的深度交叉网络)来为每个“请求-DSP 对”估计两个信号:
- 填充概率 (pfill):DSP 返回出价的概率。
- 出价价值分布:给定填充事件时的条件出价价值分布,使用 Gamma 分布 (Γ(α,β)) 进行建模。
架构效率: 为了降低 CPU 开销,该模型采用了**后期 DSP 融合(late DSP fusion)**技术。共享的请求特征被编码一次,随后仅与 DSP 特有特征结合,再进入任务特定的塔结构(填充预测和出价分布)。相比于每个 DSP 独立的模型,这种架构在保持预测质量(AUC ~0.96)的同时,减少了约 30% 的 CPU 使用量。
2.2 竞争感知分发逻辑
分发的目的不是最大化响应率,而是转发那些 DSP 具有高预期边际贡献的请求。
- 机会价值 (vi):计算方式为 pfill×E[Bid Value]。
- 竞争阈值 (τ):基于特定曝光请求的前 K 个最高机会价值(包括保证需求)来定义。
- 转发概率 (pfwd):一种概率策略,根据以下因素决定是否向 DSP i 发送请求:
- 该 DSP 出价超过竞争阈值的概率。
- 用于抑制低响应流量的平滑“填充门控(fill gate)”。
- 用于维持反事实覆盖度并减少选择偏差的探索底线 (pmin)。
2.3 自适应阈值优化 (PPO)
由于市场动态的非平稳性以及 DSP 行为之间的耦合(例如,改变一个 DSP 的阈值会改变其他 DSP 的竞争环境),静态阈值并不适用。
- 机制: 系统使用**近端策略优化(PPO)**定期在离线环境下更新每个 DSP 的分发阈值 (λp,λf)。
- 状态 (st):聚合的市场统计数据(填充率、请求量、出价分布、DSP RPM、拍卖结果)。
- 动作 (at):调整竞争阈值的保守程度和填充过滤的激进程度。
- 奖励 (Rt):最高出价与每千次请求 DSP 收入(RPM)的加权和,旨在平衡拍卖价值与请求效率。
3. 核心贡献
- 问题建模: 本文将交易侧的请求分发建模为一个竞争感知的优化问题,将关注点从最大化响应率转向最大化拍卖参与的质量。
- 生产级框架: 开发了一个结合了分布式出价建模、概率分发和基于 PPO 的自适应阈值优化的实用系统,部署在处理每天 >200 亿个请求的平台上。
- 实证验证: 大规模在线实验证明,选择性分发可以同时减少 DSP 流量并提高变现效果。
- 分层分析: 作者通过对每个 DSP 和流量细分领域的分析表明,聚合指标可能会掩盖关键的异质性,揭示了该策略如何凸显不同 DSP 之间的比较优势。
4. 实验结果
该框架通过四个连续的在线实验(E1–E4)在生产平台上进行了评估。
4.1 单 DSP 实验 (E1–E3)
针对中等 RPM 流量层级,这些实验显示:
- 流量削减: DSP 请求量减少了 34% 至 71%。
- 效率提升: 填充率显著提高(高达 +293%),且 DSP RPM 得到改善。
- 收入: 在成功的轮次中,净收入增加了 15.1% 至 24.3%,最高出价在所有情况下均有所上升。
4.2 多 DSP 部署 (E4)
在生产平台进行为期 20 天的全量部署(包含 14 天的后置适应窗口),覆盖了前 N 个 DSP(涵盖 >80% 的流量),结果如下:
- 请求量: 减少了 34.2% 的 DSP 请求。
- 收入: 净收入增加了 4.6%(具有统计学显著性,p<0.001)。
- 效率: DSP 填充率提高了 41.8%,且 DSP RPM 上升了 59.0%。
- 用户指标: 尽管总曝光量略有下降(-1.5%),但净点击量增加了 3.0%,这表明该策略保留了更高质量的曝光。
4.3 分层洞察
- 低 RPM 流量: 占请求量的 96.4%,但曝光实现率极低(4.9%)。该策略积极过滤此类流量,虽然导致了“最高出价”的负面聚合效应,但保护了整体收入。
- 中 RPM 流量: 显示出最大的收入增幅(+10.5%)和正向的最高出价效应,证实了这是分发创造价值的核心领域。
- DSP 异质性: 不同 DSP 表现出不同的“比较优势”。一些 DSP 精炼了其请求组合(请求更少,出价更高),而另一些则提高了出价价格和 eCPC。该策略有效地将每个 DSP 集中在其模型和预算相匹配的流量上。
5. 重要性与主张
本文声称,在现代 RTB 市场中,流量策展(Traffic Curation)和参与质量比最大化请求量更为关键。
- 范式转移: 这项工作挑战了“流量越多,收入越高”的假设。相反,它证明了减少低价值流量可以缓解 DSP 的约束,从而引导更好的竞价行为并提高拍卖效率。
- 市场动态: 该策略不仅提高了内部价格,还通过凸显 DSP 之间的比较优势重塑了竞争格局,提升了交易在整个变现链条上的外部竞争力。
- 局限性: 作者也坦诚地指出了局限性,包括 PPO 是基于聚合统计数据而非单个拍卖进行的,离线模拟只能部分复现 DSP 行为,且结果源自单一交易环境。他们建议未来的研究应侧重于对跨 DSP 竞争效应进行更强的因果识别。