CADET: Context-Conditioned Ads CTR Prediction With a Decoder-Only Transformer
本文介绍了部署在 LinkedIn 上的 CADET,这是一种上下文条件约束的仅解码器 Transformer,它通过多塔后评分建模和自门控注意力等创新技术,克服了广告 CTR 预测中的关键挑战,实现了相比生产基线 11.04% 的 CTR 提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走在一个巨大且繁忙的数字市场中。每一秒钟,都有成千上上的数字标牌闪烁出现,试图吸引你的目光。有些标牌是关于鞋子的,有些是关于职位发布的,还有些是关于咖啡的。经营这个市场的运营者们面临着一项棘手的任务:他们需要预测你会停下来看哪个标牌,甚至要在你看到它之前就做出判断。这种猜谜游戏被称为“点击率”(CTR)预测。长期以来,最好的预测者就像是超级精明的会计师,他们通过查看你的过往习惯列表和标牌的细节来进行计算。但最近,一种新型的“生成式”人工智能开始出现在推荐电影或歌曲等领域。这些新的 AI 就像是讲故事的人;它们不再仅仅是处理数字,而是阅读你过去行为的一段完整“故事”,并预测接下来的发展。对于市场运营者来说,一个大问题是:即使在预测之后规则发生了变化,我们能否使用这种新型的“讲故事”AI 来预测你会点击哪些广告?
这正是 LinkedIn 的团队致力于用他们的新系统——名为 CADET 的系统来解决的问题。他们构建了一个“仅解码器 Transformer”(decoder-only transformer),这是一种高级说法,意指他们创建了一个能够读取一系列事件(例如你过去的点击和浏览记录)并在一次平滑传递中预测未来的 AI。但广告非常复杂。与推荐电影不同,广告的成功往往取决于那些在 AI 做出预测之后才会被知晓的事物——比如广告在屏幕上的确切位置。如果 AI 因为不知道广告会出现在页面底部而不是顶部而导致预测错误,整个系统就会变得混乱。
研究人员发现,通过赋予他们的 AI 一套特殊的工具,他们可以解决这个难题。他们教会模型去想象关于广告可能落点位置的不同“假设”场景,并构建了一个“自门控”(self-gating)机制,这个机制就像一个保镖,阻止 AI 被嘈杂或混乱的信息所干扰。他们还赋予了 AI 一种特殊的“时间感”,使其能够理解五分钟前的点击与五个月前的点击是不同的。最重要的是,他们确保 AI 在训练期间不会使用在现实世界中无法获取的信息。当他们在真实的 LinkedIn 市场中测试这个新系统时,它不仅有效,而且表现得比他们所取代的旧有复杂系统要出色得多。新的 AI 建议用户点击广告的可能性提高了 11.04%,这证明了统一的“讲故事”方法可以超越旧的多部分机器。
CADET 的故事:广告界的讲故事者
那么,他们是如何构建它的呢?让我们用简单、日常的概念来拆解 CADadia 的奥秘(即上下文调节广告仅解码器 Transformer)。
“鸡生蛋”问题
想象你是一位厨师,正试图猜测一位顾客会对一顿饭有多满意。但问题在于:你必须在知道餐桌位置之前就预测这种满意度。如果餐桌就在厨房旁边,顾客可能会感到饥饿且兴奋;如果是在一个阴暗的角落,他们可能会心情烦躁。在广告的世界里,“餐桌”就是广告在屏幕上的位置。AI 必须预测你是否会点击广告,但它还不知道那个广告最终会出现在屏幕的最顶端,还是在最底端。这就是“鸡生蛋”问题:预测取决于位置,而位置又取决于预测。
CADET 通过成为“假设场景”的高手解决了这个问题。它不是做一个单一的猜测,而是拥有多个“预测头”(可以想象成厨房里的不同厨师)。一位厨师猜测:“如果这个广告在顶部,你会点击吗?”另一位厨师猜测:“如果它在底部,你会点击吗?”模型学习同时产生所有这些答案。当广告实际被放置好后,系统只需从那位对位置判断正确的厨师那里提取答案即可。通过这种方式,AI 永远不会被“广告最终会出现在哪里”这个谜团所困扰。
保镖(自门控注意力机制)
在拥挤的房间里,有时一个大嗓门的人会淹没其他所有人。在 AI 中,这被称为“注意力汇聚”(attention sink),即模型过度关注某一个 token(数据片段)而忽略了其他部分,从而导致错误的预测。研究人员为 CADET 配备了一个被称为自门控注意力机制的“保镖”。
把 AI 的大脑想象成一条繁忙的走廊。每当有一条信息试图通过时,保镖都会进行检查。如果信息是嘈杂或无用的,保镖会调暗其灯光(将其门控降低),以免分散模型的注意力。如果信息很重要,保镖则会让它闪耀。这个过程发生两次:一次是在信息初次到达时(表示层),另一次是在 AI 尝试连接不同信息片段时(交互层)。这保持了训练的平滑与稳定,防止 AI 变得疯狂或陷入错误的模式。
时光机(时间戳 RoPE)
大多数 AI 模型通过计数步骤来工作:“第 1 步,第 2 步,第 3 步。”但在现实世界中,时间不仅仅是关于步骤,更是关于事情发生的“何时”。十秒钟前的点击与十个月前的点击是完全不同的。
CADET 使用了一种特殊的“时光机”,即基于时间戳的旋转位置嵌入(Timestamp-based RoPE)。它不再只是计数步骤,而是查看每个事件的实际时钟时间(Unix 时间戳)。它可以理解两个事件之间的间隔是很短(如几秒钟)还是很长(如几个月)。这有助于模型意识到你的行为会随时间而变化。如果你昨天点击了一个职位广告,你今天可能仍然感兴趣;但如果你是六个月前点击的,你可能就不再感兴趣了。这种“时间感”让 AI 能够学习跨越不同规模的模式,从即时时刻到长期趋势。
“禁止作弊”规则(会话掩码)
当你训练一个 AI 时,你希望它像学生一样学习,而不是像作弊者。在现实世界中,当一个广告展示时,系统并不会立即知道你是否点击了它;在数据传输过程中会有微小的延迟(如几秒或几分钟)。如果 AI 在训练时能“看到”它本不该看到的点击结果,它就会学会利用这些信息。它会认为:“哦,我知道你点击了,因为我看到了结果!”但在现实世界中,它并没有这些信息。
为了防止这种情况,研究人员使用了会话掩码(session masking)。想象一位老师在考试时遮住了答案解析。在训练期间,AI 被迫只能观察在那个精确时刻原本就能获取的信息。如果一个点击发生在 30 秒后,那么在当前时刻的训练过程中,AI 对此是“盲视”的。这确保了当 AI 进入现实世界(在线投放)时,不会因为依赖于它实际上无法获取的信息而感到困惑或做出错误的预测。
速度提升(生产工程)
最后,构建一个聪明的 AI 是一回事,让它足够快以处理每天数十亿次的广告展示则是另一回事。团队使用了一些巧妙的工程技巧。他们对数据进行了紧凑的“打包”,就像整理行李箱一样确保没有浪费空间,这使训练速度大大加快。他们还构建了定制的“FlashAttention”引擎(专门的软件组件),让 AI 能够通过一次极速的传递,同时对数百个广告进行评分,而不是一个一个地检查。
结果:LinkedIn 的重大胜利
当团队在 LinkedIn 的主信息流中对 CADET 进行测试时,结果令人印象深刻。他们将其与旧有的、高度优化的系统(由多个不同模型协同工作的系统)进行了对比。新的 CADET 模型不仅跟上了节奏,而且彻底碾压了竞争对手。
在一次大规模在线测试中,CADET 比旧系统实现了 11.04% 的点击率增长。这意味着对于展示的每 100 个广告,会有显著更多的人停下来观看。有趣的是,由于 LinkedIn 上的广告主通常会自动花完其预算,因此总支出并没有太大变化,但点击的“价值”提升了。每次点击的成本下降了 10.9%,这意味着广告主获得了更高的投资回报。
论文指出,这一成功归功于将统一的“讲故事”AI 与针对广告特定问题(如位置和时间)的智能修复相结合。它表明,一个设计良好的单一模型可以击败一个复杂的旧模型团队。虽然研究人员指出仍有许多工作要做——例如处理更多类型的“假设”场景——但他们的工作证明了,仅解码器 Transformer 已经准备好在在线广告领域占据主导地位。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。