← 最新论文
🤖 machine learning

SpecFormer: Mitigating Embedding and Attention Collapse via Spectral-Aware Transformer for Recommendation

本文介绍了 SpecFormer,一种频谱感知 Transformer 架构,该架构通过采用可学习的频谱软化、频谱软化注意力以及频谱残差位置编码,缓解了推荐系统中特有的嵌入与注意力塌陷问题,从而在公开基准测试和实际商业部署中均实现了卓越的性能与可扩展性。

原作者: Yu Cui, Yi Xu, Jiahao Wang, Hao Zhang, Yu Zhang, Xiaoyi Zeng, Can Wang, Jinxin Hu, Jiawei Chen

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Yu Cui, Yi Xu, Jiahao Wang, Hao Zhang, Yu Zhang, Xiaoyi Zeng, Can Wang, Jinxin Hu, Jiawei Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人去猜你下次想买什么。这个机器人是一个“推荐系统”,是那些你最喜欢的购物应用中“你可能还喜欢”列表背后的数字大脑。长期以来,构建这类机器人的最佳方法是使用一种特殊的数学工具,叫做“Transformer”。你可以把 Transformer 想象成一位非常严谨的图书管理员,他观察你点击过的所有内容,并试图找出它们之间的联系。在处理像写作或图像识别这样信息平滑且流动自然领域时,这位管理员的表现极其出色。但当科学家们尝试让这位管理员去经营一家规模巨大的在线商店时,事情出了差错。机器人开始变得混乱,它忽略了你可能喜爱的那些稀有或独特的商品,而只关注那些最热门、最乏味的商品。这就像是那位管理员被海量的书籍搞得晕头转向,于是不再阅读那些有趣的藏书,而是只会一遍又一遍地大声喊出畅销书的名字。这篇论文探讨的是:为什么在购物场景下会发生这种情况?我们又该如何修复它,好让机器人能够真正学习整个商店的精髓,而不只是盯着顶层货架?

由来自浙江大学和阿里巴巴的崔宇及其同事领导的研究团队发现,问题不在于图书管理员的智力,而在于数据中的“噪声”。在图书馆里,书籍之间具有一定的相似性;但在购物应用中,数据是狂野且杂乱的。有些商品每天被购买数百万次(即“头部”商品),而有些商品一年才会被购买几次(即“尾部”商品)。研究人员发现,这种杂乱的长尾分布会导致“谱坍缩”(spectral collapse)。想象一下机器人的大脑是一束手电筒的光束。正常情况下,光束应该向四周扩散以照亮整个房间。但在这些购物应用中,光束被挤压成了一个极小且极其刺眼的亮点。机器人只能看到那些最明亮的、最热门的商品,从而对其他一切都变得“失明”了。更糟糕的是,他们增加的脑层数越多,使机器人变得越聪明,这种失明现象就越严重。这是一个恶性循环:机器人忽略了稀有商品,无法学到新知识,然后在下一步中变得更加看不见它们。

为了解决这个问题,团队构建了一种新型的机器人大脑,称为 SpecFormer。SpecFormer 不再让手电筒的光束挤压成一个点,而是使用了一种特殊的“谱软化”(spectral softening)透镜。你可以把它想象成一个神奇的扩散器,它能将那束强烈集中的光线温柔地扩散开来,确保房间阴暗的角落也能被照亮。这使得机器人能够像关注热门商品一样,关注那些稀有的长尾商品。他们不仅限于此,还添加了一个“残差位置编码”(residual position encoding),这就像是给了机器人一张地图,提醒它:“嘿,也不要完全忘记那些热门的东西,只要平衡好即可。”

结果令人印象深刻。当他们在来自大型电子商务平台的真实世界数据上测试 SpecFormer 时,它不仅表现得更好,而且随着模型变得更深,它变得更聪明了。当其他模型在变得过于复杂时崩溃时,SpecFormer 却在持续提升。在一次涉及数百万用户的真实测试中,新模型使广告点击量增加了 1.34%,并将实际订单量提升了 16.72%,而这一切仅让网站速度减慢了微小的 5 毫秒。这篇论文表明,通过修复这种“坍缩”问题,我们终于可以构建出既深邃强大,又能理解人类真实需求中那完整、杂乱且精彩多样性的推荐系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →