← 最新论文
🤖 machine learning

GOD: Enhancing Generalization via Deep Grafting for Sequential Recommendation

本文提出了 GOD(基于嫁接的定向蒸馏),一种组件级知识蒸馏框架,通过通过嫁接构建混合模型,以解耦并对学生模型的嵌入和编码器提供精确反馈,从而增强序列推荐的泛化能力,在不增加推理成本的情况下超越了最先进的基准模型。

原作者: WooJoo Kim, JunYoung Kim, JaeHyung Lim, HwanJo Yu

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: WooJoo Kim, JunYoung Kim, JaeHyung Lim, HwanJo Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字时代,算法不断试图猜测我们下一步想要什么。无论是歌曲、电影还是产品,这些系统通过学习我们过去的行为来预测未来的选择。这一领域被称为序列化推荐(sequential recommendation),它基于这样一个理念:我们的历史记录中蕴含着我们下一步行动的关键。然而,真实的人类行为是混乱的。我们的交互历史往往很短,充满了间隙,有时还包含一些无法反映真实兴趣的随机点击。当算法试图从这种稀疏且充满噪声的数据中学习时,它往往难以泛化,这意味着在遇到新情况或异常情况时,它无法做出良好的预测。为了解决这个问题,研究人员转向了一种称为“知识蒸馏”(knowledge distillation)的技术。想象一下,一位大师正在教导学徒;大师了解复杂的风味和技巧,目标是将这种深刻的理解传递给学生,使学生能够独立烹饪。在机器学习中,一个庞大且强大的模型充当“老师”,而一个较小且更快的模型则充当“学生”。学生通过观察老师的最终答案或内在思维来进行学习,希望能模仿这种专业能力。

尽管这种教学方法具有前景,但一项新的研究表明,传统的做法存在盲点。在标准实践中,老师和学生是分开工作的。老师处理数据并产生结果,而学生尝试复制该结果。问题在于,当数据很混乱时,很难判断学生到底在哪里失败了。是学生误解了原材料?是它未能正确组合这些原料?还是它仅仅是在过度努力地模仿一个恰好错误的特定答案?由于老师和学生在各自独立的轨道上运行,它们的错误会纠缠在一起,导致难以提供精确的指导。来自韩国浦项科技大学的研究人员提出了一种不同的方法来解开这些错误。他们将这种方法称为 GOD,即“嫁接导向蒸馏”(Graft-Oriented Distillation)。这种方法不再让老师和学生完全分离,而是在训练过程中,将学生的某些部分临时“缝合”进老师的大脑中。

研究人员通过建立混合模型来测试这一想法。他们采用一个冻结的、预训练好的老师模型,并将其核心组件之一替换为学生模型中对应的部分。例如,他们可能会用学生的版本替换老师的物品名称记忆库,同时保持老师的逻辑引擎不变。这创造了一个“嫁接”模型,它可以使用学生的记忆进行数据处理,但使用老师的推理逻辑。他们也进行了相反的操作,即使用老师的记忆配合学生的逻辑引擎。通过运行这些混合模型,研究人员可以清楚地看到,在老师逻辑的引导下,学生的记忆表现如何;以及在被喂入老师的数据时,学生的逻辑表现如何。这提供了一个清晰的视角,让他们能看清学生到底在哪些方面遇到了困难,从而实现标准的分离式教学法无法提供的针对性纠正。

为了使这一过程顺利进行,研究人员引入了一种技术,让老师和学生组件在处理信息时能够相互观察。这种“相互注意力”(mutual attention)有助于稳定学习过程,尤其是在学生的各个部分尚未完全训练成熟时。随后,他们使用了一种专门的学习规则,该规则比较了所有这些不同混合视图之间的关系,而不仅仅是匹配最终得分。这一规则确保了学生学习的是数据的底层结构,而非仅仅是表层答案。结果显示,该系统即使面对非常短或充满噪声的历史记录,也能学习到稳健的模式。在涉及在线购物、餐厅评论和电影评分的三个真实世界数据集上的测试中,这种新方法始终优于现有的先进技术。在某些情况下,与之前最好的方法相比,它将推荐准确度提高了近 14%。

最重要的发现之一是,这种方法在数据稀疏的情况下表现尤为出色。在用户交互极少的情况下,新方法帮助学生模型实现了比以往更好的泛化能力。此外,当输入数据带有噪声或被破坏时,它也表现出更强的鲁棒性,即使在很大一部分历史记录被随机项目替换的情况下,仍能保持高性能。研究人员发现,即使老师并非完美训练,该方法依然有效,这表明嫁接技术可以从不完美的来源中提取有用的知识。至关重要的是,所有这些复杂的混合模型仅在训练阶段使用。一旦学生模型训练完成,系统就会丢弃老师和嫁接部分,仅使用精简的学生模型进行实际预测。这意味着,虽然训练过程更为复杂,但最终的应用不需要额外的计算能力或时间,这使其成为现实世界推荐系统中一个实用的解决方案。

研究还探讨了当学生和老师规模相近时,该方法表现如何——这通常是测试自我提升技术的场景。即使没有大型老师来引导小型学生,嫁接法依然优于其他方法,这表明其优势来自于组件之间的耦合和检查方式,而不仅仅是模型之间的规模差异。研究人员得出结论,通过隔离并监督学习过程中的特定组件,他们可以克服传统蒸馏法的局限性。这种组件级的反馈使系统能够从不完美的数据中学习到更可靠的模式,为机器理解复杂且往往混乱的世界提供了一条更清晰的路径。这项工作证明,有时为了更好地教导机器,你必须让它在学会独立思考之前,先借用你的大脑思考片刻。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →