Building a User Foundation Model for the Open Web
本文介绍了一种面向开放网络的用户基础模型,该模型通过在浏览历史记录上利用自监督学习以及大语言模型(LLM)在环优化流水线,克服了用户身份碎片化和隐私限制的问题,最终在生产环境中的竞价胜率、点击率以及单次点击成本指标上实现了显著提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一座规模宏大、繁忙喧嚣的城市,每个人在从一家店走到另一家店的过程中都会留下数字足迹。多年来,那些向我们展示广告的公司一直试图根据这些足迹为每个人建立一个“画像”,以猜测他们下一步可能想买什么。这就是推荐系统的世界——它是计算机科学的一个分支,利用数学来预测人类行为。现代系统中的核心秘诀是机器学习(计算机通过从海量数据中学习模式),以及基础模型(它们就像拥有巨大预训练大脑的模型,在被教授特定任务之前,已经学会了如何理解事件序列)。
但棘手之处在于:在“开放网络”(即你在没有登录特定账号的情况下访问的互联网部分)上,这些足迹是凌乱的。你可能在手机上访问了一个网站,稍后又在笔记本电脑上访问,而计算机无法得知这是同一个人。你的历史记录往往是破碎的、片段化的,或者因为隐私设置而完全缺失。这篇论文探讨了一个重大问题:我们能否构建一个智能系统,使其在理解这些凌乱、碎片化的足迹方面,能达到与理解已登录用户清晰、完整历史记录同样高的水平?这个答案至关重要,因为如果我们无法做到这一点,我们就会错失理解互联网巨大组成部分的机遇,导致广告显得随机或无关紧要。
破碎足迹之谜
作者们来自 Teads 的团队面临着一个独特的挑战。在大多数推荐系统(如社交媒体或购物应用)中,你拥有一部关于用户生活的长篇连续电影:他们登录、观看视频、购买鞋子并点赞照片。计算机可以观看整部电影来理解用户。
但在开放网络上,“电影”通常只是几帧零散的画面,有时甚至只有一帧。用户可能是匿名的,他们的历史记录也可能因隐私选择而被切断。处理这种问题的老方法是计数:“该用户点击了 3 次体育广告。”但这就像是试图仅通过了解一个人眨眼的次数来理解其人格一样。它忽略了“故事”——事件的顺序、时机和流动感。
团队提出了疑问:我们能否教会计算机理解这些简短、破碎的故事? 如果我们能做到,是否能帮助预测用户会点击什么,即使我们不知道他们是谁?
“时空旅行者”的大脑
为了解决这个问题,团队构建了一个用户基础模型(UFM)。可以将这个模型想象成一位超级聪明的时空旅行者,他阅读过数百万个关于人们浏览网页的简短、碎片化的故事。
该模型不仅仅是计数点击,它还会观察事件的序列。它将用户的浏览历史视为一个句子。正如一个句子有主语、谓语和宾语一样,用户的历史也有发布者(他们在哪里)、广告商(他们看到了什么)和事件(他们做了什么,比如点击或仅仅是浏览)。
该模型使用一种叫做自监督学习的游戏进行训练。想象一下,你有一个隐藏了部分单词(掩码)的句子,你需要根据上下文猜出这些单词是什么。模型通过观察用户的历史记录,隐藏其中的部分内容,并尝试填补空白来进行练习。它还玩了一个匹配游戏:它提取同一个用户历史记录中两个不同的部分(例如上午和下午),并学习如何让它们属于同一个人,即使它们看起来截然不同。
调整大脑的“机器人教练”
这里是最酷的部分。团队不仅构建了模型,还使用了用 AI 来构建 AI。他们称之为“LLM 即优化器(LLM-as-Optimizer)”。
想象一下,你正在试图制造一辆完美的赛车。你不是在瞎猜哪种引擎或轮胎最好,而是一个“机器人教练”(大语言模型)在阅读科学书籍中 150 种不同的“调优技巧”目录。机器人教练会提出建议:“让我们把引擎稍微加大一点,”或者“让我们改变燃料混合比例。”团队测试这些变化,如果某个变化让赛车变得更快,机器人教练就会记住它,并尝试在此基础上进行改进。
在这篇论文中,机器人教练通过改变模型的思考层数、处理时间的方式以及学习方式来微调“用户基础模型”。这个过程被称为神经架构搜索(NAS),它找到了一个比原始模型显著更好的版本。
结果:从“也许”到“确定”
团队通过两种方式测试了他们的新型机器人教练模型:首先是在模拟环境(离线)中,然后在现实世界(在线)中。
1. 模拟环境(离线):
他们在海量的真实广告请求数据集上测试了该模型。他们将其与 Teads 正在使用的系统进行了对比。
- 好消息: 新模型的预测点击率提升了 +1.354%。在广告领域,这是一个巨大的飞跃。
- “破碎足迹”测试: 他们专门测试了那些历史记录极短或缺失的用户。即使对于几乎没有任何历史记录的用户,模型的预测能力也提升了 +0.99%。这证明了即使在“电影”只有单帧的情况下,该模型依然有效。
- 泛化能力测试: 他们将模型应用于不同的预测任务(例如预测广告是否会赢得竞价,而不只是是否会被点击)。它在这些任务上也表现出色,将预测准确度提升了 +1.197%。这表明该模型学习到了对人类行为的深度理解,而不仅仅是一个针对特定任务的技巧。
2. 现实世界(在线):
团队进行了为期 7 天的实测,将新模型展示给一半的用户,将旧模型展示给另一半用户。
- 结果: 使用新模型的组别,其广告点击率提升了 2.13%。
- 成本: 由于广告更具相关性,单次点击成本下降了 1.13%。
- 信心: 团队对这些数字非常有信心。他们计算了 80% 的置信区间,这意味着他们在统计学上确信这种提升是真实的,而非偶然。
为什么这很重要
这篇论文表明,我们不需要完美的、长期的历史记录来理解用户。即使面对碎片化、简短且匿名的数据,一个智能模型也能拼凑出完整的故事。
作者指出,这种方法开启了一个“新的维度”进行提升。这不仅仅是让现有的数学模型变得稍微好一点,而是引入了一种看待用户数据的全新思维方式。通过将浏览历史视为需要被理解的序列,而非仅仅是一份计数清单,他们找到了一种方法,即使是对于那些不登录账号的互联网“幽灵”,也能提供更具相关性的广告。
团队也承认存在局限性。他们仅测试了一种特定的模型架构和一组特定的数据。他们还指出,他们的“机器人教练”可能找到了一个很好的解决方案,但我们并不知道这是否是绝对最优的解决方案。然而,实测结果证实了这种方法在现实世界中是行之有效的,它将一个理论构想转化为了实用的工具,让开放网络感觉不再那么混乱,也变得更加个性化。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。