← 最新论文
💻 computer science

SAPO: Step-Aligned Policy Optimization for Reasoning-Based Generative Recommendation

SAPO(步长对齐策略优化)通过将全局结果奖励替换为步长对齐的组内相对优势,将信用分配给单个推理步骤及其对应的语义标识符令牌,从而在精确匹配反馈不足的庞大目录场景中稳定训练并提升性能,以此增强生成式推荐。

原作者: Zaiyi Zheng, Guanghui Min, Yaochen Zhu, Liang Wu, Liangjie Hong, Chen Chen, Jundong Li

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Zaiyi Zheng, Guanghui Min, Yaochen Zhu, Liang Wu, Liangjie Hong, Chen Chen, Jundong Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教导一个非常聪明但略显笨拙的机器人,为购物者推荐完美的下一个商品。在“生成式推荐”的世界里,机器人不仅仅是从列表中挑选一个商品;它必须像解谜一样,逐字(或逐词元)地写出该商品的名称。

为了使这一过程可行,商品不再被赋予像“鞋子”这样简单的名称,而是被赋予语义标识符(SIDs),这就像是一个三部分组成的地址代码:

  1. 大类(例如:“电子产品”)
  2. 具体类型(例如:“耳机”)
  3. 确切型号(例如:"Sony WH-1000XM5")

该机器人被训练为逐步思考,在写出代码的每个部分之前,先写出针对该部分的少量推理。

问题:“全有或全无”的评分

论文指出了这些机器人以往训练方法中的一个主要缺陷。

想象一名学生参加一场包含三个问题的考试:

  • 问题 1: 法国的首都是什么?(答案:巴黎)
  • 问题 2: 德国的首都是什么?(答案:柏林)
  • 问题 3: 意大利的首都是什么?(答案:罗马)

如果学生答对了问题 1 和问题 2,但搞错了问题 3(将“罗马”写成了“伦敦”),一位使用结果奖励(Outcome-Reward)的老派教师会查看整份试卷并说:“你得零分。你考试不及格。”

随后,教师告诉学生:“你需要改变你写下的所有内容。”

  • 学生心想:“哦不,我肯定连巴黎和柏林也答错了!”
  • 于是,学生因为搞错了罗马,而忘记了巴黎和柏林的正确答案。

用论文中的术语来说,这被称为动作粒度不匹配(Action-Granularity Mismatch)。即使机器人完美地写出了代码的前两部分,它仍然会因为整个商品代码而得到一个单一的“通过/失败”分数。这会让机器人感到困惑,导致其训练不稳定,并使其仅仅因为末尾的一个小错误而忘记正确的推理。

解决方案:SAPO(步长对齐策略优化)

作者提出了一种名为SAPO的新方法。SAPO 不像传统方法那样一次性给整份试卷评分,而是像一位严格但公正的导师,对每一步单独评分

以下是 SAPO 如何运作,沿用我们的类比:

  1. “步长”概念:机器人的工作被分解为三个 distinct 的“步长”。

    • 步长 1: 思考大类 + 写出代码的第一部分。
    • 步长 2: 思考具体类型 + 写出代码的第二部分。
    • 步长 3: 思考确切型号 + 写出代码的第三部分。
  2. 公正评分:如果机器人做对了步长 1 和步长 2,但搞砸了步长 3,SAPO 会说:

    • “步长 1 做得很好!继续保持。”(正向奖励)
    • “步长 2 做得很好!继续保持。”(正向奖励)
    • “步长 3 搞砸了。再试一次。”(负向奖励)
  3. 结果:机器人了解到,它对前两部分进行的推理实际上是正确的。它只需要修正最后一部分,而无需忘记已经掌握的好内容。

为何这很重要

论文在真实世界数据上测试了该方法(例如亚马逊上关于办公用品、视频游戏和工业工具的评论)。他们发现:

  • 稳定性:机器人在训练过程中不再出现疯狂震荡。它不会忘记已经掌握的知识。
  • 更优的推荐:因为机器人是从其具体的错误中学习,而不是因整个答案而受罚,所以它在挑选正确商品方面变得更为出色。
  • 效率:当“完美匹配”很罕见时,该方法尤其有效。在旧方法中,如果机器人 99% 正确,它却得不到任何认可。而使用 SAPO,它能获得那 99% 的肯定,并从那 1% 的错误中学习。

宏观视角

论文认为,当一项任务是分层构建的(如分层代码或逐步推理过程)时,训练方法应当尊重这些层级。如果学生的论点陈述非常精彩,你不应该因为结论中的一个拼写错误而惩罚他。

SAPO 仅仅是一种确保机器人因其正确的部分获得认可的方法,从而使其能够将精力集中在修正错误的部分上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →