DiffGRM: Diffusion-based Generative Recommendation Model
本文介绍了 DiffGRM,这是一种基于扩散的生成式推荐模型,它通过采用具有专门分词、训练和推理策略的掩码离散扩散框架,以实现双向上下文和平衡监督,从而克服了自回归方法的局限性,提升了推荐准确度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走在一座巨大且无尽的图书馆里,这里的每一本书都没有标题,取而代之的是一个秘密代码。为了找到下一本你会喜欢的书,计算机必须逐位猜出这个代码。这就是**生成式推荐(Generative Recommendation)**的世界——它是人工智能的一个分支,试图通过从头开始“编写”该物品的秘密代码,来预测你接下来想看的内容,无论是视频、歌曲还是产品。
长期以来,这些计算机的工作方式就像一位严格的老师,从左到右朗读故事。它们猜出代码的第一位数字,然后是第二位,接着是第三位,从不回头看。但这种方法有一个缺陷:它将代码的每一个部分都视为同样重要且同样难以猜测。实际上,有些部分是容易的线索(比如“这是一只鞋”),而有些部分则是复杂的细节(比如“这是一只9码的左脚鞋”)。旧的方法经常在困难的部分卡住,因为它无法预见未来或检查自己的工作,并且在过度练习简单部分上浪费了时间。研究人员一直在问的问题是:我们能否构建一个更聪明的系统,让它能同时观察全局,识别出哪些部分很棘手,并更高效地填补空白?
于是,来自快手研究人员的 DiffGRM 登场了。它摒弃了旧有的“从左到右”的阅读风格,转而采用了一种更像是侦探们共同破解谜题的方式。DiffGRM 不再是一个接一个地猜测数字,而是使用了一种叫做**离散扩散(discrete diffusion)**的技术。想象这样一个游戏:你面前有一页被黑墨水(掩码)完全覆盖的文字,你的任务是找出原本的单词是什么。计算机开始尝试同时猜测所有被墨水遮盖的内容。它不仅仅是盲目地猜测,而是会观察整个句子,以判断哪些词最有可能是正确的。
这篇论文介绍了三个巧妙的技巧,使这一过程比旧方法更出色。首先,他们改变了制作“秘密代码”的方式。他们不再使用一种一个数字依赖于前一个数字的链式结构,而是使用了一种叫做**并行语义编码(Parallel Semantic Encoding)**的方法。你可以把它想象成给每位侦探一张独立的线索卡。这样一来,没有任何一个线索会被困在等待另一个线索的状态中,计算机也可以同时猜测所有的数字,而不会被序列中前面的错误猜测所干扰。
其次,团队意识到并非所有的猜测都是平等的。有些部分的编码很容易推导,而有些部分则是一个真正的难题。旧的方法对它们一视同仁,在简单内容上浪费精力。DiffGRM 使用了一种名为**策略内一致加噪(On-policy Coherent Noising)**的策略。想象一位深知哪些学生正在挣扎的老师:他不会向全班同学提同样简单的题目,而是将练习时间专门集中在那些遇到困难的学生身上。计算机也是如此:它识别出代码中“困难”的数字,并将学习能力集中在那里,忽略掉它已经掌握的简单部分。
最后,当进行最终推荐时,计算机需要为你提供一个选项列表,而不仅仅是一个。旧的方法会选出唯一的最佳猜测然后停止。DiffGRM 则使用置信度引导的并行去噪(Confidence-guided Parallel Denoising)。这就像是一群侦探同时大声喊出他们各自的最佳猜测。领队先挑选出那些最有把握的猜测并将其填入,然后利用这些新信息来解决剩余的谜题。这使得系统能够快速且准确地生成多样化的顶级推荐列表。
研究人员在来自亚马逊(Amazon)的真实数据上测试了这个新系统,涵盖了运动、美容和玩具等类别。他们发现,DiffGRM 的表现显著优于以往的方法。在测试中,与现有的最强模型相比,它将推荐的准确度提升了 6.9% 到 15.5%。论文表明,通过让计算机同时观察整个代码,并将其能量集中在困难部分,我们可以构建出更懂我们、并能提供更相关选择的推荐系统。这不仅仅是一个微小的改进,更是我们在教计算机如何预测用户需求方面的一次根本性转变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。