Owen-Shapley Policy Optimization: A Principled RL Algorithm for Generative Search LLMs
本文介绍了 Owen-Shapley 策略优化(OSPO),这是一种 principled 的强化学习框架,它通过利用 Shapley-Owen 归因将序列级奖励重新分配给语义连贯的 token,从而解决生成式搜索大语言模型中的信用分配差距,进而在无需参数化价值模型的情况下提升性能与鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗易懂的语言和日常类比对论文《Owen-Shapley 策略优化》(OSPO)的解释。
核心问题:“小组评分”的误区
想象你是一位老师,正在批改学生的作文。在旧式的 AI 训练方法(特别是称为GRPO的方法)中,老师只在作文结束时给出一个单一的分数。
- 场景:学生写了一段长文。老师读完后说:“做得好!加 10 分。”
- 缺陷:老师没有告诉学生是哪些句子赢得了这些分数。是开头的句子挽救了局面?是中间的段落?还是结尾?
- 结果:学生认为他们写的每一个词都同样精彩。他们可能会继续写那些无助于得分的冗长、啰嗦的句子,或者可能会意外删除他们写出的唯一完美句子,认为那不重要。他们是在“猜测”什么起了作用,因为他们只得到了整个小组的分数,而不是各个部分的分数。
在 AI 购物助手的领域,这意味着 AI 不知道其搜索查询中具体哪些词语真正帮助找到了正确的商品。它只知道整个查询得到了“好”或“坏”的评分。
解决方案:OSPO(“公平份额”计算器)
作者引入了一种名为OSPO的新方法。OSPO 不像旧方法那样给整篇作文打一个总分,而是像一个超级公平的会计师,精确地分解出每一句话对最终分数的贡献。
他们使用了博弈论中的一个数学概念,称为Owen-Shapley 值。以下是类比:
想象一群朋友(AI 句子中的单词或短语)正试图赢得奖品(找到正确的商品)。
- 实验:AI 尝试这些朋友的不同组合。有时它只发送第一个朋友。有时发送前两个。有时发送整个团队。
- 测量:每当一个新朋友加入团队时,AI 就会检查:“因为这个特定朋友的加入,奖品变得更好了吗?”
- 计算:如果短语“蓝色连衣裙”让搜索结果从“一般”跃升为“完美”,那么该短语将获得巨大的功劳份额。如果短语“嗯,也许”没有任何改变,它就得不到任何功劳。
这就像一场百家宴。如果你带了一道美味的砂锅菜,让整场派对大获成功,你会得到最多的赞誉。如果你带了一碗没人注意的普通饼干,你不会被责怪,但也得不到功劳。OSPO 能精确算出是谁带来了那道砂锅菜。
现实生活中的运作方式(购物)
假设你告诉 AI:“我需要一件冬天的黑色外套。”
- 旧方法(GRPO):AI 生成一个很长、很华丽的句子。因为它找到了一件外套,所以得到了高分。AI 心想:“我很擅长写长句子!”于是继续这样做,即使长度并无帮助。
- 新方法(OSPO):AI 将其句子拆分成块:“黑色”、“外套”、“冬天”、“暖和”、“夹克”。
- 它测试:“如果我只说‘黑色’会怎样?”(结果糟糕)。
- 它测试:“如果我说‘黑色外套’会怎样?”(结果良好)。
- 它测试:“如果我说‘黑色外套冬天’会怎样?”(结果极佳)。
- 结论:OSPO 意识到“冬天”增加了很大价值,但“夹克”只是多余的噪音。它给“获胜”的单词更多的“分数”(梯度更新),并告诉 AI 专注于更好地学习使用“冬天”,同时忽略那些废话。
为什么这很重要
- 更快的学习:因为 AI 确切知道哪些词语起了作用,所以它学习速度快得多。论文显示,它达到高性能所需的时间约为旧方法的一半。
- 没有“作弊码”:有时 AI 会以一种糟糕的方式变“聪明”。它可能会学会写一个非常长、令人困惑的段落来欺骗系统获得高分(这被称为“奖励黑客”)。OSPO 能防止这种情况,因为它检查每一个小部分。如果额外的词语实际上没有帮助找到商品,它们就得不到功劳,因此 AI 会停止写它们。
- 无需“评论员”:通常,为了提供详细的反馈,你需要第二个 AI(一个“评论员”)来观察第一个 AI。OSPO 很巧妙,因为它利用搜索结果本身来推算功劳分配,因此不需要那个额外且昂贵的第二个 AI。
“团队合作”的转折(联盟)
论文提到,当词语处于连续联盟(相邻的词语)中时,它们的效果最好。
想象一下接力赛。
- 好:接力棒从跑者 1 顺畅地传给跑者 2,再传给跑者 3。他们作为一个团队工作。
- 坏:如果你跳过跑者 2,直接把接力棒从 1 传给 3,团队就会分崩离析。
OSPO 只查看相邻的词语(如“黑色外套”),而不是句子中分散的随机词语。这保持了含义的清晰,并确保 AI 学会构建连贯、合乎逻辑的短语。
总结
OSPO 是一种更智能的训练 AI 执行购物推荐等任务的方法。它不像旧方法那样给 AI 的整个答案打一个单一分数,而是像侦探一样,精确找出哪些词语赢得了奖励。这有助于 AI 更快地学习,避免为了得分而胡言乱语,并使其在理解你真正想买什么方面变得更好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。