PageLLM: A Multi-Grained Reward Framework for Whole-Page Optimization with Large Language Models
本文介绍了 PageLLM,这是一种多粒度奖励框架,它利用隐式用户反馈,同时优化整体页面搜索与推荐中的粗粒度页面级连贯性和细粒度项目级布局,在无需昂贵人工标注的情况下显著提升了排名指标和生产业务关键绩效指标。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一家庞大而繁忙的数字化百货公司的经理。每当顾客走进来,你都有一个巨大的产品仓库供他们挑选。你的工作不仅仅是挑选几件好商品;你还得为他们安排整整一个购物页面。
这就是**全页优化(WPO)**所面临的挑战。仅仅找到合适的鞋子是不够的;你还得决定:
- 把鞋子放在页面的什么位置?
- 应该把它们放在袜子旁边,还是帐篷旁边?
- 你是否展示了太多红色的鞋子,而蓝色的太少?
- 页面是否过于杂乱,还是枯燥地重复?
长期以来,计算机在处理这个问题时显得力不从心,因为它们太“笨”了,无法理解整体图景,或者需要昂贵的人工经理来手动评估每一个页面布局。
于是,PageLLM出现了。这是一个新系统,利用“超级智能助手”(大型语言模型)来自动设计这些页面。但这里有个陷阱:作者发现,简单地告诉人工智能“做一个好页面”效果并不好。这就像告诉一位厨师“做一顿美味的饭菜”,却没有指明他们是应该专注于牛排的味道(单个商品),还是整个菜单的平衡(页面布局)。
以下是 PageLLM 如何利用简单的类比来解决这个问题:
1. 问题:“盲”厨师
此前尝试利用人工智能解决此问题存在两大难题:
- “人工评分”瓶颈:要训练人工智能,通常需要人类查看两个不同的页面,然后说“我更喜欢 A 页面而不是 B 页面”。为数百万用户做这件事既昂贵又缓慢。
- “单粒度”错误:大多数人工智能系统只从一种角度看待问题。
- 有些只关注单个商品(例如,“用户点击了这个特定的鞋子吗?”)。这就像一位只关心牛排是否煮熟,却忽略了汤是冷的、沙拉已枯萎的厨师。
- 另一些只关注整个页面(例如,“这个页面看起来多样吗?”)。这就像一位只关心菜单平衡,却没注意到牛排已经烧焦的厨师。
2. 解决方案:“双重视角”奖励系统
作者意识到,要训练人工智能,你需要两种不同类型的反馈协同工作,就像一位拥有两只眼睛的厨师:一只眼关注细节,一只眼关注大局。
他们构建了一个名为PageLLM的系统,该系统利用“隐式反馈”(用户的实际行为,如点击和购买),而不是要求人类对页面进行评分。他们将这些杂乱的数据转化为四种“训练场景”:
- 相关性:展示用户肯定不想要的商品。
- 排序:交换商品的顺序,以观察用户是否在意谁排在第一位。
- 多样性:展示一个只包含一种类型商品(例如,全是红色鞋子)的页面,以此教导人工智能多样性是好的。
- 冗余性:展示过多相似的商品聚集在一起,以此教导人工智能要分散布局。
3. 魔法技巧:“粗粒度”与“细粒度”奖励
这是核心创新所在。PageLLM 在同一数据上训练两个独立的奖励头(可以想象为两位不同的评委):
- 评委 A(页面级教练):这位评委一次性审视整个购物页面。他们会问:“这是一个平衡、连贯的列表吗?它是否涵盖了不同的类别?”他们非常擅长发现整个菜单是否无聊或重复。
- 评委 B(商品级教练):这位评委审视单个商品及其位置。他们会问:“将这个商品从第 5 位移动到第 2 位,是否让用户点击更多?”他们非常擅长发现大局所忽略的微小但关键的细节。
为什么要两者兼备?
论文发现,如果只使用评委 A,人工智能会生成一个外观不错的页面,但会错过用户真正想买的特定商品。如果只使用评委 B,人工智能会挑选出很好的商品,但将它们排列得杂乱无章、令人困惑。
- 结果:当你结合两位评委时,人工智能在正确排序商品方面的表现比仅使用一位评委提高了46.8%。这就像有一位指挥(评委 A)确保整个乐团协同演奏,同时有一位独奏家教练(评委 B)确保每位小提琴手都拉准了音符。
4. 现实世界的证明
该团队不仅是在实验室里测试,他们还在一个拥有1000 万用户的真实电商网站上进行了尝试。
- 结果:该系统使商店的总销售额(GMV)增加了0.44%,点击量增加了0.14%。
- 为何重要:在拥有数百万客户的业务中,如此微小的百分比意味着数万次额外的销售。
5. “懒惰”部署的额外红利
该系统的一个巧妙副作用是它易于部署。因为“页面级教练”(评委 A)非常擅长审视整个列表,公司可以在其现有的、较慢的计算机服务器(CPU)上仅使用这一部分,同时慢慢升级其强大的服务器(GPU)以运行完整的人工智能。这就像在准备好完整的高清照片之前,就能先使用菜单的草图。
总结
PageLLM是一种组织在线购物页面的新方法。它不再要求人类对每个页面进行评分,而是通过向人工智能展示页面布局的“糟糕示例”(过于重复、顺序错误、缺乏多样性)来训练它。它利用两个不同的反馈循环——一个关注大局,一个关注微小细节——以确保人工智能创建的页面既在逻辑上平衡,又能完美契合用户想要点击的内容。其结果是,无需人工评分团队,就能提供更智能、更盈利的购物体验。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。