WHALE: A Scalable Unified Model for Recommendation with Wukong-HSTU Architecture
本文介绍了 WHALE,这是一种可扩展的统一推荐架构,它通过一种新颖的融合机制将 Wukong 和 HSTU 骨干网络集成在一起,以联合建模非序列和序列特征,并在工业生产系统中实现了显著的离线和在线性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正漫步在一座宏大而繁忙的数字城市中,数以百万计的人们在这里不断地滚动、点击和观看。这就是在线推荐系统的世界,它们是隐藏在你社交媒体动态、视频建议和购物清单背后的无形引擎。它们的任务是猜测你接下来想看什么。为了做到这一点,它们通常会寻找两种截然不同的线索。首先是你的“静态”细节:你是谁、你喜欢什么、现在是什么时间,以及正在展示的具体物品。这就像一名侦探在查看嫌疑人的档案和犯罪现场。其次是你的“动态”行为:你过去点击、观看或购买过的所有内容的漫长且杂乱的足迹。这就像一名侦探正在实时观察一名嫌疑人完整的人生故事。
长期以来,推荐系统一直将这两类线索分开处理。一些超级智能的模型擅长混合静态细节(比如“这个用户喜欢科幻片”+“现在是周五晚上”),而另一些模型则是阅读你过去行为的长篇故事方面的专家(比如“你连续看了三部太空电影,所以你可能想看第四部”)。一个大问题是:我们能否构建一个同样精通这两者的超级模型,且不会变得过于缓慢或运行成本过高?如果我们能做到,这意味着你看到的内容可能会感觉像是根据你究竟是谁,以及你最近一直在做什么,进行了完美的定制。
于是,WHALE 出现了——这是由 Meta 研究人员开发的一种试图解决这一难题的新型架构。把 WHALE 想象成一个巨大的、多层协作的侦探团队。它并没有让一名侦探读档案,而让另一名侦探看视频,而是让 WHALE 把他们放在同一个房间里,逐层进行协作。在模型的每一个层级中,都有一个“Wukong”团队(擅长混合静态细节的专家)和一个“HSTU”团队(擅长阅读用户长期历史行为的专家)。但神奇之处在于:他们不仅仅是并肩工作,他们还在不断地交流。Wukong 团队会询问 HSTU 团队:“嘿,基于我目前正在看的这个特定物品,用户漫长历史中的哪一部分在此时此刻最重要?”随后,HSTU 团队会锁定那个特定的记忆并将其反馈回来。这种情况随着数据在模型中的流动而反复发生,使得系统能够不断精炼其理解。
论文指出,这种“渐进式交换”是一个游戏规则的改变者。当研究人员在来自社交媒体平台的海量真实世界数据上测试 WHALE 时,他们发现,随着模型规模的扩大以及它所能阅读的历史长度的增加,它在预测用户点击行为方面表现得越来越出色。具体来说,当增加模型可以查看的用户历史长度时,推荐质量也随之提高。他们还发现,增加模型的深度(更多层)和宽度(更多处理能力)能持续带来更好的结果,这表明该系统具有良好的扩展性。
然而,研究人员也测试了一种更简单的结合这两类模型的方法,他们称之为“浅层混合”(shallow-hybrid)方法。在这种旧方法中,历史记录在与静态细节混合之前会被压缩成一个微小的摘要。论文认为这是一种错误,因为这会丢弃细粒度的细节。他们的实验表明,WHALE 那种深层的、逐层进行的“聊天”明显优于这种浅层方法,证明了让这两个团队保持持续沟通至关重要。
当然,构建这样一个复杂的系统造价不菲。团队必须发明特殊的自定义计算机代码(使用所谓的“Triton 内核”)来确保 WHALE 能够运行得足够快,从而能够同时为数百万人提供服务。在现实世界的测试中,WHALE 确实提升了用户参与度的主要指标,但也带来了一个小小的代价:与旧系统相比,该系统每秒能处理的请求数减少了约 5%。尽管存在这种轻微的减速,但推荐质量的提升被视为一次胜利,并且该系统已经投入生产环境使用。论文总结道,虽然我们不能仅仅通过让模型无限变大来解决所有问题,但将这两种不同的数据思考方式——静态细节和动态历史——统一到一个相互作用的架构中,是通往推荐系统未来的一种强大且实用的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。