← 最新论文
🤖 AI

Difficulty-Aware Semantic-ID Optimization for Generative Recommendation

本文提出了难度感知语义 ID 优化(Difficulty-Aware Semantic-ID Optimization, DASO),这是一种基于树结构的后训练方法,它通过根据前缀匹配深度和瓶颈水平动态重新分配展开组(rollout groups),旨在解决原生 GRPO 在基于层级化语义 ID 的生成式推荐中的局限性,并在多个基准测试中实现了最先进的性能。

原作者: Xin Yu, Stephen Li, Sina Aghaei, Zifan Zhu, Jiamu Bai, Guanjie Huang, Bo Peng, Yiyao Liu, Lingzhou Xue

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Xin Yu, Stephen Li, Sina Aghaei, Zifan Zhu, Jiamu Bai, Guanjie Huang, Bo Peng, Yiyao Liu, Lingzhou Xue

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代世界的浩瀚数字图书馆中,从数百万个选项中寻找合适的项目是一项依赖复杂计算机系统的任务。几十年来,这些系统一直通过先收集一个可能的候选短名单,然后对其进行排序以决定向用户展示哪一个来运作。一种被称为生成式推荐的新方法试图完全跳过第一步。该模型不再是从列表中搜索,而是像作家一样,直接根据用户的上下文进行创作。为了使之成为可能,研究人员开发了一种方法,将每一件产品或项目转化为由一系列离散短步骤组成的唯一代码,就像一套引导从大类走向特定对象的指令集。这种结构创建了一个树状地图,代码的开头指向一个大组,随后的每一步都不断缩小范围,直到到达精确的项目。

挑战在于,当这些计算机模型尝试从自身的错误中学习时。在标准的训练过程中,模型会对同一个问题生成几个可能的答案,并进行比较以判断哪一个更好。然而,研究人员发现,当这种方法应用于这些项目代码时存在一个显著缺陷。通常,模型最好的猜测与正确答案相差甚远,甚至连前几个步骤都无法共享。在这种情况下,计算机无法区分一个“稍微出错”的猜测和一个“完全错误”的猜测,因为两者得到的评分都很差。这种缺乏清晰反馈的情况导致学习过程停滞不前,使得模型无法在它最挣扎的问题上取得进步。

为了解决这个问题,来自 Meta 和宾夕法尼亚州立大学的研究团队开发了一种名为“难度感知语义 ID 优化”(Difficulty-Aware Semantic-ID Optimization)的新型训练方法。他们的方法认识到并非所有的错误都是一样的,且计算机需要根据其猜测偏离程度的不同而获得不同类型的帮助。该系统不再平等地对待每一次失败的尝试,而是首先分析模型刚刚做出的那一组猜测,以观察它们究竟在哪里出了错。它会寻找代码中猜测开始偏离正确路径的具体点。如果模型无法正确开始代码,系统会在起始阶段提供少量的引导;如果模型起始正确但在后期失败,则会在后续阶段应用引导。

这种方法通过仔细选择模型表现最差的几个猜测,并将它们替换为经过修正的版本——这些版本会在正确路径上遵循几步,然后再让模型自行完成剩余部分。这在同一组猜测中创造了原始、无辅助尝试与引导式尝试的混合。通过比较这两类猜测,计算机终于能够看清局部成功与彻底失败之间的明确区别,从而学习如何纠正其特定的错误。为了确保模型不会忘记已经掌握的简单问题,研究人员还增加了一个安全机制,温和地提醒模型它已经掌握的正确答案。

这种新方法的成果在来自在线购物类别和公司内部数据集的真实世界数据上进行了测试。研究人员发现,这种针对性的引导显著提高了模型推荐正确项目的能力。在涉及两种不同规模的计算机模型和两个主要购物类别的测试中,新方法在几乎所有的衡量指标上都优于之前的标准方法。改进最为显著的情况是那些模型此前最挣扎的案例——即初始猜测完全脱轨的困难问题。通过修复模型迷失方向的那一点,该系统学会了如何更有效地在复杂的项目代码树中导航,从而为用户提供更准确的推荐。这项研究证实,通过理解错误的具体性质并在正确的时刻提供恰到好处的帮助,人工智能可以学会解决曾经认为不可能解决的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →