✨ 要点🔬 技术摘要
想象一下,你正试图教一个超级聪明的机器人去猜你下次想买什么。这个机器人是一个“推荐系统”,是那些你最喜欢的购物应用中“你可能还喜欢”列表背后的数字大脑。长期以来,构建这类机器人的最佳方法是使用一种特殊的数学工具,叫做“Transformer”。你可以把 Transformer 想象成一位非常严谨的图书管理员,他观察你点击过的所有内容,并试图找出它们之间的联系。在处理像写作或图像识别这样信息平滑且流动自然领域时,这位管理员的表现极其出色。但当科学家们尝试让这位管理员去经营一家规模巨大的在线商店时,事情出了差错。机器人开始变得混乱,它忽略了你可能喜爱的那些稀有或独特的商品,而只关注那些最热门、最乏味的商品。这就像是那位管理员被海量的书籍搞得晕头转向,于是不再阅读那些有趣的藏书,而是只会一遍又一遍地大声喊出畅销书的名字。这篇论文探讨的是:为什么在购物场景下会发生这种情况?我们又该如何修复它,好让机器人能够真正学习整个商店的精髓,而不只是盯着顶层货架?
由来自浙江大学和阿里巴巴的崔宇及其同事领导的研究团队发现,问题不在于图书管理员的智力,而在于数据中的“噪声”。在图书馆里,书籍之间具有一定的相似性;但在购物应用中,数据是狂野且杂乱的。有些商品每天被购买数百万次(即“头部”商品),而有些商品一年才会被购买几次(即“尾部”商品)。研究人员发现,这种杂乱的长尾分布会导致“谱坍缩”(spectral collapse)。想象一下机器人的大脑是一束手电筒的光束。正常情况下,光束应该向四周扩散以照亮整个房间。但在这些购物应用中,光束被挤压成了一个极小且极其刺眼的亮点。机器人只能看到那些最明亮的、最热门的商品,从而对其他一切都变得“失明”了。更糟糕的是,他们增加的脑层数越多,使机器人变得越聪明,这种失明现象就越严重。这是一个恶性循环:机器人忽略了稀有商品,无法学到新知识,然后在下一步中变得更加看不见它们。
为了解决这个问题,团队构建了一种新型的机器人大脑,称为 SpecFormer 。SpecFormer 不再让手电筒的光束挤压成一个点,而是使用了一种特殊的“谱软化”(spectral softening)透镜。你可以把它想象成一个神奇的扩散器,它能将那束强烈集中的光线温柔地扩散开来,确保房间阴暗的角落也能被照亮。这使得机器人能够像关注热门商品一样,关注那些稀有的长尾商品。他们不仅限于此,还添加了一个“残差位置编码”(residual position encoding),这就像是给了机器人一张地图,提醒它:“嘿,也不要完全忘记那些热门的东西,只要平衡好即可。”
结果令人印象深刻。当他们在来自大型电子商务平台的真实世界数据上测试 SpecFormer 时,它不仅表现得更好,而且随着模型变得更深,它变得更聪明了。当其他模型在变得过于复杂时崩溃时,SpecFormer 却在持续提升。在一次涉及数百万用户的真实测试中,新模型使广告点击量增加了 1.34% ,并将实际订单量提升了 16.72% ,而这一切仅让网站速度减慢了微小的 5 毫秒 。这篇论文表明,通过修复这种“坍缩”问题,我们终于可以构建出既深邃强大,又能理解人类真实需求中那完整、杂乱且精彩多样性的推荐系统。
技术摘要:SpecFormer
问题陈述 尽管 Transformer 架构在自然语言处理(NLP)和计算机视觉(CV)领域取得了显著成功,但将其直接应用于推荐系统(RS)时,往往表现出次优的性能,有时甚至逊于设计精良的简单模型。作者指出,这一瓶颈源于推荐场景中一个独特的现象:严重的嵌入与注意力塌缩(embedding and attention collapse) 。
与 NLP Token 相对连续且平滑的语义空间不同,推荐数据(用户画像、物品 ID、上下文)具有高度的异质性和严重的长尾分布特征。这导致了“谱塌缩(spectral collapse)”:嵌入矩阵被少数几个主奇异值所主导,而次要的谱分量则被有效抹除。论文从理论上证明,这引发了一个恶性循环 :
前向传播: 塌缩的输入嵌入导致注意力矩阵退化为由主成分主导的稀疏、低秩形式,从而丧로了特征辨别力。
反向传播: 流经该低秩注意力矩阵的梯度几乎完全投影到主导谱子空间上。次要谱方向遭受“梯度饥渴(gradient starvation)”,接收到的更新微乎其微。 这种循环随着层数的堆叠而加速塌缩,阻碍了 Transformer 在推荐任务中的深度扩展能力。
方法论:SpecFormer 为了解决这些问题,作者提出了 SpecFormer ,这是一种谱感知(Spectral-Aware)Transformer,旨在通过在动态软化的谱域内进行特征交互来缓解塌缩。该架构引入了三个核心组件:
可学习谱软化(Learnable Spectral Softening): 在进行注意力计算之前,输入 Token 嵌入通过幂律软化变换对其奇异值进行处理。一个可学习参数 τ \tau τ (其中 τ < 1 \tau < 1 τ < 1 )比小奇异值更激进地压缩大奇异值。这种方式动态地平坦化了奇异值分布,将表示能量重新分配,从而振兴尾部特征并抑制主成分的主导地位。
谱软化注意力(Spectrum-softened Attention): 模型使用软化后的嵌入来计算查询矩阵(Q Q Q )和键矩阵(K K K )的注意力权重,同时保留原始(未软化)的嵌入用于值矩阵(V V V )。这种设计确保了特征交互是在更均匀的谱空间中建模,防止单一成分主导注意力得分,同时在输出聚合中保留原始信息。
谱残差位置编码(Spectral Residual Position Encoding): 为了防止谱软化无意中惩罚高信息量的主导成分,作者引入了一个基于奇异值泰勒展开推导出的可学习偏置项。该项作为一个结构化残差,将交互锚定在最大奇异值(σ 1 2 \sigma_1^2 σ 1 2 )上,并保留主要的推荐模式。此外,还添加了一个由未软化嵌入计算的空间残差项,以稳定训练并保留原始空间信号。
核心贡献
理论洞察: 论文系统地揭示了 Transformer 在推荐系统中失效的根本原因,并为由数据异质性和长尾分布引起的嵌入塌缩与注意力塌缩之间的恶性循环提供了理论证明。
新颖架构: SpecFormer 是首个从谱视角出发,通过可学习谱软化、谱软化注意力和谱残差位置编码来本质上解决塌缩瓶颈的 Transformer 架构。
扩展能力: 不同于标准 Transformer 在增加深度时性能会下降,SpecFormer 展示了有效的扩展能力,即堆叠层数可以主动提升注意力矩阵的有效秩和推荐性能。
实验结果 作者在一个工业数据集(来自领先的电子商务平台)和两个公开基准数据集(Critex 和 Avazu)上对 SpecFormer 进行了评估。
离线性能: SpecFormer 显著优于现有的先进基线模型,包括传统模型(DeepFM、AutoInt)、基于 Transformer 的模型(OneTrans、RankMixer)以及基于谱的方法(WhitenRec、FEDIN)。它在所有数据集上均取得了最高的 AUC 和 GAUC 分数。
消融实验: 移除谱软化模块会导致性能大幅下降,验证了平坦化奇异值分布的必要性。同样,移除残差偏置或使用替代的值矩阵设计会导致结果欠佳,证实了所提组件之间的协同作用。
扩展分析: 改变层数(3 到 9 层)的实验表明,虽然标准 Transformer(OneTrans)随着深度的增加会出现严重的性能下降和注意力秩塌缩,但 SpecFormer 在 AUC 和分数有效秩方面保持了稳步上升的趋势。
在线部署: SpecFormer 被部署在一个真实的商业广告平台中。在涉及 10% 流量的大规模 A/B 测试中,与高度优化的 DLRM 基线相比,它实现了 +1.34% 的点击率(CTR)提升 和 +16.72% 的订单增长 ,而推理延迟仅增加了 5ms 。
意义 该论文声称,SpecFormer 通过解决推荐数据固有的谱塌缩问题,从根本上打破了 Transformer 在推荐领域的性能瓶颈。通过将特征交互建模转向动态软化的谱域,SpecFormer 不仅实现了最先进的性能,还释放了 Transformer 在推荐系统中的深度扩展潜力——而这一能力此前一直受到异质、长尾数据环境下注意力机制快速塌缩的限制。成功的工业部署证明了其在实际业务中的可行性和商业价值。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。