Fine-Tuned LLM as a Complementary Predictor Improving Ads System
本文介绍了一个生产级广告系统,该系统将微调后的开源大语言模型作为补充辅助预测器,用于根据用户画像预测潜在广告主,从而增强候选生成并为下游排序提供信息先验,以实现显著的离线和在线业务提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在运营一个庞大而繁忙的数字市场(类似于 Pinterest)。你有数百万访客,你的任务是向他们展示完美的广告——那些他们真正想购买的产品广告。
传统上,你的系统就像一位庞大而高效的图书管理员。它会查看用户昨天点击了什么,然后在书架上找到相似的书籍(广告)。它速度快,擅长找到“更多同类”。但有时它会失准,因为它并不真正理解用户的深层欲望,或者其浏览习惯与特定品牌之间微妙的联系。
这篇论文介绍了一种新工具:一位博学且智能的助手(经过微调的大型语言模型,即 LLM),它不会取代图书管理员,而是与其并肩工作,以做出更好的预测。
以下是该系统的运作方式,分解为简单步骤:
1. 问题:图书管理员需要提示
传统系统擅长数学,但在“世界知识”方面却力不从心。它知道用户点击了一双徒步靴,但除非它之前见过完全相同的组合,否则它可能无法直观地将这与特定品牌的能量棒或当地的户外装备店联系起来。
2. 解决方案:“广告预测”助手
团队没有要求 AI 撰写整个广告或为每个单项进行排序(这太慢且成本太高),而是向 AI 提出了一个非常具体的问题:
“基于此人的个人资料及其浏览内容,他们接下来最有可能从哪些特定广告主那里购买?”
将这位 AI 想象成一位品牌预言家。它阅读用户的历史记录(搜索、点击、站外购物),并预测一份包含 20 家特定公司(如“耐克”、“丝芙兰”或“家得宝”)的简短清单,这些是用户准备与之互动的公司。
3. 他们如何训练这位助手
你不能只是让一个通用的 AI 来做这件事;它需要学习你市场的特定规则。
- 家庭作业(SFT): 首先,他们教导 AI 查看用户的历史记录,并猜测一个用户可能购买的品牌。这就像教学生正确回答一道数学题。
- 实战演练(GRPO): 然后,他们增加了难度。他们要求 AI 列出 20 个品牌和 5 个用户兴趣,但给它提供了一张“记分卡”。如果 AI 猜对了品牌并将其排在列表顶部附近,它就会获得高分。如果它猜错了或列出了太多项目,它就会受到惩罚。这教会了 AI 要精确并遵守规则。
- 秘密代码(语义 ID): 为了使其更加敏锐,他们教导 AI 一种特殊的“速记”语言(语义 ID)来表示图像和产品。这就像教导助手不仅通过“红裙子”这个词,而是通过一个独特的代码来识别红裙子的图片,该代码将其与其他红裙子和时尚趋势联系起来。
4. 投入应用:两种辅助方式
一旦 AI 经过训练,他们并没有让它全权负责整个流程。相反,他们在两个特定方面使用了它的预测:
方式 A:过滤器(检索)
想象图书管理员正在一个拥有数十亿件物品的仓库中搜索。AI 说:“嘿,对于这位用户,只查看属于这 20 个特定品牌的货架。”这立即缩小了搜索范围,确保系统不会浪费时间展示不相关的广告。这就像给图书管理员一份 VIP 商店清单,让他们优先检查。方式 B:线索(排序)
当系统决定首先展示哪个广告时,它会将 AI 的预测交给最终决策者。这就像对法官耳语:“这位用户非常喜欢 X 品牌,所以给该广告更高的分数。”
5. 结果:它奏效了吗?
团队在现实世界(Pinterest 的实际流量)中测试了这一点。
- 离线测试: 与旧系统或未针对此特定任务进行训练的“零样本”AI 相比,AI 在猜测正确品牌方面表现更好。
- 在线测试: 当他们为真实用户启用它时,结果显而易见。展示的广告更加相关,广告支出回报率(RoAS) 提高了近 5% 到 6%。这意味着广告主获得了更多价值,因为广告是展示给真正感兴趣的人的。
核心要点
该论文认为,你不需要用庞大而缓慢的 AI 完全取代整个推荐系统。相反,你可以使用一个经过微调的专用 AI 作为“互补预测器”。
把它想象成一支运动队:你拥有明星球员(传统算法),他们速度快且可靠。现在,你添加了一位战术教练(LLM),他研究对手的历史并告诉球员:“专注于这些特定策略。”教练并不上场打球,但他的建议帮助球队更频繁地获胜。
简而言之: 他们利用智能 AI 预测用户喜欢哪些品牌,利用这些预测来过滤和排序广告,并成功增加了广告主赚取的金额。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。