Progressive Alignment of Recommender Foundation Model through Multi-Phase Post-Training
本文提出了一种三阶段渐进式后训练框架(线性探测、全量微调和强化学习微调),该框架通过将任务适配与基于奖励的优化解耦,有效地将推荐基础模型与业务指标对齐,并在离线实验和大规模在线 A/B 测试中均展示了卓越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走进一座宏伟且充满魔力的图书馆,这里的书竟然会说话。这不仅仅是一座普通的图书馆,这是一座“基础模型”(Foundation Model)图书馆。你可以把这位模型想象成一位超级聪明、阅历丰富的图书管理员,他读过数十亿个故事,深谙人们在浏览书籍时的行为模式。这位管理员已经掌握了通用的叙事规则和人类的好奇心规律。但棘手的地方在于,尽管管理员知道如何找书,但他并不一定知道图书馆“老板”真正想要什么。老板可能更看重人们在图书馆停留的时长,或者有多少人购买了会员资格,而不仅仅是看有多少人从书架上拿走了书。
在计算机科学领域,特别是在**推荐系统(Recommender Systems)**中,这就是日常面临的挣扎。我们拥有这些庞大的、预训练好的 AI 模型(即图书管理员),它们非常擅长预测你下一步可能会点击什么。但业务方想要的不仅仅是点击量;他们想要的是深度参与,比如看完一整部漫画系列,或者为优质内容付费。问题的关键在于,“点击”的信号随处可见且易于捕捉,而“深度满意度”的信号却非常稀缺且难以寻觅。如果你试图直接教这个管理员去追逐那些稀有的信号,他们往往会感到困惑,甚至会忘掉原本已经掌握的所有知识,并开始推荐一些古怪的东西。这篇论文探讨了一种巧妙的、循序渐进的方法,来训练这些数字图书管理员,使他们不仅能猜中你会点击什么,还能真正帮助你找到那些能让你长久沉浸其中的好故事。
三步舞步:如何训练一位推荐图书管理员
来自 NAVER WEBTOON(一家大型数字漫画平台)的研究人员意识到,试图一次性教会 AI 所有事情注定会失败。他们提出了一个“渐进式对齐”(Progressive Alignment)框架,这本质上是一个三阶段的训练营,旨在将一个通用的 AI 转变为精通业务的推荐专家,同时又不至于让它的“大脑”崩溃。
第一阶段:热身(线性探测 - Linear Probing)
想象你有一位大师级厨师(预训练的基础模型),他精通各种烹饪技巧。你想让他为一家新餐厅制作一道特定的新菜,但你不希望他因此忘记如何烹饪其他所有食物。如果你直接递给他一套全新的、随机配备的刀具和锅具(即“下游模块”),并命令他立即开始烹饪,他可能会陷入恐慌并毁掉原有的技能。
因此,第一步是线性探测(LP)。在这个阶段,大师级厨师的大脑是“冻结”状态——他不能改变其基本的烹饪风格。你只允许他在新的刀具和锅具下进行练习。这有助于让新工具在厨师手中变得顺手,而不会破坏核心食谱。这就像是让一名新员工在被允许接触炉灶之前,先跟随老板观察学习一周一样。这稳定了 AI 庞大的知识储备与特定漫画推荐任务之间的连接。
第二阶段:全面练习(全参数微调 - Full Fine-Tuning)
一旦新工具变得稳定,就可以让厨师获得完全的自由进行烹饪了。这就是全参数微调(FFT)。现在,整个模型都被解锁了。厨师可以调整自己的整个烹饪风格,以专门适应这家餐厅的菜单。由于这些新工具已经在第一阶段完成了“热身”,厨师不会感到不知所措。他们可以在保持扎实的通用知识基础的同时,学习客户的特定口味(即“下游任务”)。研究人员发现,通过这两个步骤(先 LP 后 FFT)来进行训练,效果远好于尝试一步到位,因为后者往往会导致“灾难性遗忘”——即 AI 因为过于忙于追求特定目标,反而失去了原有的智能。
第三阶段:奖励游戏(强化学习微调 - Reinforcement Fine-Tuning)
这里是见证奇迹的地方。厨师现在已经擅长制作菜单上的菜肴了,但他们做出的菜真的符合“老板”的期望吗?老板关心的是深度满意度(例如用户购买了一整季的漫画),而不仅仅是快速消费(单次点击)。但深度满意度是非常罕见的;大多数人只是随便看看。
如果你试图教厨师只为了那些罕见的“深度满意度”胜利而烹饪,他们可能会开始胡乱猜测。相反,研究人员使用了一个奖励模型(Reward Model)。你可以把它想象成一位拥有特殊评分表的“试吃员”。这位试吃员观察那些罕见的、深度的交互行为,并为它们分配一个“奖励分数”。
在第三阶段,**强化学习微调(RFT)**中,厨师不再仅仅是为了取悦大众而烹饪,而是为了取悦那位“试吃员”的分数。AI 生成一系列推荐,试吃员(奖励模型)根据这些推荐产生深度参与的可能性给出评分,然后 AI 学习通过调整策略来获得更高的分数。至关重要的一点是,AI 仍然利用在第二阶段学到的“稠密”信号(如点击量)来了解“该推荐什么”,但“奖励”信号则引导它如何进行“排序”,从而实现长期幸福感的最大化。
他们的发现(以及他们对哪些做法说了“不”)
团队在 Webtoon 平台上庞大的真实用户交互数据集上测试了这种三步法。他们将这种新方法与传统的做法进行了对比。
“不要这样做”清单:
论文明确反对了两种常见的捷径:
- 不要直接针对稀有的业务目标进行训练。 如果你试图从一开始就教 AI 去优化“付费内容完成率”,它会无法泛化。这就像是在还没学会乘法之前,就试图教一个学生解高等微积分题目。这些信号太稀疏了,会导致模型迷失方向。
- 不要直接将“奖励模型”作为最终的推荐器。 研究人员曾尝试直接使用那位“试吃员”(奖励模型)来分发推荐。虽然这个模型很擅长识别深度参与,但在从海量漫画中进行排序时表现得很差。它缺乏在庞大列表中挑选出最佳项所需的“辨别力”。论文指出,奖励模型最适合担任“教练”,而不是“选手”。
制胜策略:
“渐进式对齐”(LP → FFT → RFT)的效果最好。
- 离线测试: 当他们在历史数据上进行模拟运行时,这个三阶段模型击败了单阶段模型。具体而言,使用 GRPO(一种特定的强化学习算法)结合学习到的奖励模型的版本取得了最高分。它在保持高点击率(Rank NDCG)的同时,也成功推动了用户进入更深的消费环节(Funnel NDCG)。
- 现实世界证明: 他们并没有止步于模拟。他们在真实的在线平台上进行了大规模的 A/B 测试。他们将这种新的 AI 与标准的非基础模型进行了对比。结果显示,这一新框架持续提升了用户参与度。其中,“使用 GRPO + 奖励模型”的版本在引导用户阅读更深层内容并触达付费章节方面表现尤为出色,而“DPO”(另一种算法)版本在获取初始点击方面略胜一筹。
总结
论文表明,让 AI 推荐系统变得强大的秘诀,并不在于单纯地向它们投喂更多数据,也不在于试图立即优化最难的目标。其核心在于阶段性。首先,稳定新的工具;其次,使模型专业化;最后,利用学习到的“奖励”信号,在不丧失做出良好即时选择能力的前提下,温柔地引导模型走向业务的长期目标。
通过将“学习任务”与“对齐业务目标”分离,研究人员找到了一种方法,使他们的 AI 既聪明又具备盈利能力。这提醒我们,有时为了获得最好的结果,必须循序渐进,而不是试图直接冲向终点线。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。