想象你是一位厨师,正在为一位贵宾准备品鉴菜单。你有一篮 12 种美味的食材(即候选项),但盘中只能呈现 6 种。目标不仅仅是挑选出 6 种 individually 最好的食材,而是要将它们以完美的顺序排列,让客人享受整餐体验,因为第一口便奠定了其余部分的基调。
这就是推荐系统(如淘宝或亚马逊)中重排序(Reranking)所面临的挑战。本文介绍了一种名为DeGRe的新方法,旨在解决厨师(算法)在尝试排列这些菜单时面临的两大难题。
两大难题
1. “启发式标签偏差”(即“点击陷阱”)
- 旧方法:想象一所烹饪学校,其评判好菜单的唯一规则是:“如果客人点击了某种食材,就将其排在最前面。”
- 问题:这过于简单。仅仅因为客人点击了辣椒,并不意味着它应该作为第一口。也许它更适合作为最后的点缀。旧方法假设“点击=置顶”,忽略了项目顺序如何改变整体体验。此外,它们仅从实际展示给客人的菜单中学习,而错过了那些从未尝试过但可能极其出色的组合。
2. “信用分配问题”(即“盲眼厨师”)
- 旧方法:想象客人吃完整餐后给出一个单一评分:“8 分(满分 10 分)”。
- 问题:厨师不知道这 8 分是为什么得来的。是因为第一道菜?第二道?还是第三道菜里的盐放坏了?由于反馈模糊且仅在最后出现,厨师难以确定下次应改进哪个具体步骤。
解决方案:DeGRe(稠密监督生成式重排序)
DeGRe 通过将工作分为两个截然不同的阶段来解决这一问题:离线规划和在线服务。这可以比作一位“主厨”在培训一名“线厨”。
第一阶段:离线的“前瞻”训练(主厨)
在餐厅开业前,前瞻评估器(主厨)带着所有食材进入厨房。
- 模拟:主厨不再仅仅猜测,而是利用强大的工具(束搜索,Beam Search)模拟成千上万种不同的菜单组合。它试图精确预测,如果客人按特定顺序食用,会对菜单产生多大的享受度。
- “稠密”反馈:主厨不再仅在最后给出一个单一分数,而是为菜单的每一个步骤写下详细的笔记。“如果你把辣椒放在这里,总分将增加 0.5;如果你把它放在那里,它将减少 0.2。”
- 结果:这创建了一个包含“完美”菜单和详细分步说明的巨大库。这解决了“盲眼厨师”的问题,因为每个决策都附带了清晰、即时的理由。
第二阶段:在线的“蒸馏”(线厨)
现在,餐厅开业了,客人们正在等待。我们无法为每一位客人运行耗时的模拟,那太慢了。
- 学生:我们拥有一个轻量级的在线生成器(线厨)。
- 训练:线厨研读主厨的详细笔记。他们不仅死记硬背最终的菜单,更学习每一步背后的逻辑。他们学会:“啊,当我看到这种食材时,我应该接着选那个,因为它能带来更好的总分。”
- 结果:线厨将主厨的规划技能内化于心。
第三阶段:实时服务(推理)
当真实客人到来时:
- 线厨查看食材篮。
- 由于内化了主厨的逻辑,他们可以在单次闪电般的快速通过中,立即选出最佳的 6 种物品并按完美顺序排列。
- 他们无需在实时中模拟数千种选项;只需遵循训练期间学到的“肌肉记忆”。
为何有效(结果)
该论文在来自淘宝闪购(一个巨大的在线市场)的真实世界数据上测试了此方法。
- 更优的菜单:该系统发现了比以往方法更好的物品组合,从而带来了更多的点击和订单。
- 真实的商业影响:在针对真实用户的实地测试中,与旧系统相比,DeGRe 将GMV(商品交易总额,即总销售额) 提高了 3.75%。
- 速度:尽管训练过程复杂,但实际的在线版本速度很快。它仅将页面加载时间增加了约 14.8 毫秒(眨眼不及的时间)。
总结
DeGRe 就像一家餐厅,它利用超级智能的 AI 在后办公室模拟数百万次晚宴,以创建一本完美的、包含分步决策的“食谱书”。然后,一位快速高效的厨师利用这本食谱书即时服务真实顾客,确保每一盘菜都经过精心排列以最大化享受,同时不会拖慢服务速度。
技术摘要:DeGRe:用于推荐系统的密集监督生成式重排序
1. 问题陈述
在多阶段推荐系统中,重排序阶段对于通过建模列表内的上下文依赖关系来优化整体效用至关重要。然而,在指数级巨大的排列空间中寻找最优序列,为现有的生成式重排序方法带来了两个根本性挑战:
- 启发式标签偏差:现有方法通常基于简单的启发式规则(例如,将点击过的物品置顶)构建训练目标。这种方法忽略了列表上下文中的因果依赖关系,并隐含地假设点击过的物品无论位置如何都始终更优。因此,模型拟合的是有偏的数据分布,而非学习真正的全局最优排序,导致无法探索未暴露空间中的高价值序列。
- 信用分配问题:现有依赖列表级后验奖励(例如,整体点击率 CTR 或商品交易总额 GMV)的方法提供的反馈是稀疏的。这些粗粒度的标量信号无法将价值归因于序列生成过程中的具体中间步骤,导致优化方向模糊,并限制了性能上限。
2. 方法论:DeGRe 框架
为解决这些问题,作者提出了DeGRe(密集监督生成式重排序),这是一个通过离线 - 在线解耦设计连接离线探索与在线效率的框架。该系统包含两个核心组件:前瞻评估器(DeGRe-E)和在线生成器(DeGRe-G)。
2.1 离线阶段:前瞻评估器与密集监督构建
对排列空间的计算密集型探索被卸载到离线阶段。
- 前瞻评估器:该组件是一个基于因果 Transformer 的模型,利用累积回归。它不预测单个标量值,而是通过预测累积值 V 在任意步骤 t 达到或超过阈值 k 的概率,来建模离散指标(例如点击次数)的分布。这使得能够细粒度地估计任何子序列的期望累积值。
- 前瞻序列挖掘:利用训练好的评估器,系统采用**束搜索(beam search)**主动挖掘未暴露空间中的高价值序列。评估器通过估计追加候选物品的累积值来引导搜索,识别出历史曝光数据可能遗漏的潜在最优解。
- 密集监督构建:评估器的逐步价值估计被转化为生成器的密集监督信号:
- 硬标签:在挖掘出的前瞻序列中,每一步选择的特定物品作为确定性目标。
- 软标签:基于评估器的价值估计,构建剩余候选物品的概率分布,保留次优替代方案的细粒度排序信息。
- 序列加权:序列按其估计的累积值进行加权,以确保生成器专注于高置信度、高价值的路径。
2.2 训练阶段:混合蒸馏
在线生成器是一个专为低延迟推理设计的轻量级编码器 - 解码器架构。
- 架构:它使用双向 Transformer 对候选集进行编码(捕捉竞争/互补关系),并使用用户引导的因果解码器进行自回归生成。它采用候选约束解码机制(指针网络风格),确保生成的物品严格来自输入候选集。
- 目标:生成器通过混合蒸馏进行训练,最小化结合以下内容的损失函数:
- 前瞻模仿(LCE):拟合从挖掘出的序列中获得的硬标签(目标决策)。
- 价值对齐(LKL):与软标签分布对齐,以内部化评估器的细粒度价值估计。
2.3 在线阶段:高效推理
在在线服务期间,计算密集的前瞻评估器不部署。轻量级的在线生成器执行单次高效贪婪解码以生成推荐列表。通过在训练期间内部化前瞻规划能力,生成器无需两阶段生成 - 评估过程的计算开销即可逼近全局最优。
3. 主要贡献
- DeGRe 框架:一种采用离线 - 在线解耦策略的新型生成式重排序框架。它利用丰富的离线资源挖掘高价值序列,有效缓解了由启发式标签引入的偏差。
- 密集监督机制:一种基于前瞻评估器的方法,提供逐步价值估计。与稀疏的后验奖励不同,该方法提供密集指导,有效缓解了序列生成过程中的信用分配问题。
- 实证验证:在公共基准(ML-1M、淘宝广告)和工业数据集(淘宝闪购)上的广泛实验表明,DeGRe 在保持高效推理的同时,优于最先进的方法。
4. 实验结果
离线性能
- 生成器:在淘宝闪购数据集上,DeGRe(束宽 B=8)实现了 88.72% 的 HR@1%,相比最强基线(GoalRank)绝对提升了 53.19%。即使使用弱监督(B=1),它也超越了现有基线。
- 评估器:前瞻评估器在淘宝闪购数据集上实现了 0.7090 的 R-AUC 和 0.9932 的 PCOC,优于点式和列表式基线,验证了累积回归在序列价值估计中的有效性。
在线 A/B 测试
DeGRe 部署在淘宝闪购首页推荐场景中,持续 8 天,覆盖 2% 的实时流量。
- 业务指标:与基础策略相比,DeGRe 实现了 CTR 提升 +2.85%、订单量(ORDER)提升 +2.14% 以及 GMV 提升 +3.75%。
- 与 PRM 对比:与行业标准的单阶段模型 PRM 相比,DeGRe 进一步将订单量提升了 1.0%,GMV 提升了 2.99%。
- 延迟:平均推理延迟仅增加了 14.8 毫秒,满足大规模实时系统的低延迟要求。
- 鲁棒性:该模型在不同用户群体(老用户:+3.73%,新用户:+2.72%)和客户端场景(淘宝 App:+3.75%,支付宝 App:+4.14%)中均表现出一致的 GMV 提升。
5. 意义与主张
论文声称,DeGRe 成功解决了生成式重排序中探索深度与推理效率之间的权衡。通过将昂贵的探索(离线)与推理(在线)解耦,该框架使生成器能够“内部化”前瞻规划能力。这使得系统能够通过单次贪婪解码逼近全局最优,避免了传统两阶段生成器 - 评估器范式中的目标不一致和高延迟问题。在淘宝闪购中的成功部署带来了显著的 GMV 增长,验证了密集监督和离线挖掘在工业推荐系统中的实际效用。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。