想象一下,互联网是一个巨大且繁忙的市场。在这个市场中,发布商(如新闻网站)希望向你展示广告以赚取利润,而广告商则希望向你展示符合你兴趣的广告。
长期以来,这种运作方式就像一场间谍游戏:为了向你展示合适的广告,网站必须将你的个人日记(你的浏览历史、你点击了什么、你在页面停留了多久)发送到一个中央办公室。这引发了隐私警报,导致了新的法律(如 GDPR)出台,规定:“未经许可,禁止随意发送人们的日记。”
AdFL 是一项解决这一问题的发明。它就像是在你的浏览器内部发生的一个移动教室。
以下是它的工作原理,使用简单的类比进行说明:
1. “无间谍”教室(联邦学习)
与其将你的日记发送到中央办公室,不如把老师送到你家。
- 旧方式: 你把日记寄给学校校长。校长阅读了日记,了解了你的喜好,然后告诉了所有的老师。
- AdFL 的方式: 老师(AI 模型)来到你家(你的浏览器)。它就在那里阅读你的日记,学习你的喜好,然后仅发送它所学到的总结(例如“喜欢汽车的学生也喜欢运动”)。它会立即销毁日记。老师从未见过你的原始数据,你的数据也从未离开过你的电脑。
2. “浏览器内”工作坊
论文将 AdFL 描述为一个完全运行在你的 Web 浏览器(如 Chrome 或 Safari)中的系统。你不需要安装任何特殊的应用程序或软件。
- 隐喻: 把你的浏览器想象成一个工作坊。当你访问一个网站时,AdFL 系统会在那个工作坊内悄悄地搭建起一个小小的实验台。
- 工具: 它使用每个现代浏览器已经具备的标准工具(例如 “MutationObserver”,这只是一个描述“观察事物何时发生变化”的华丽说法)。
- 任务: 这个实验台会观察广告是如何加载的。它会测量以下内容:
- 广告是否真的出现在了你的屏幕上?(可见性)
- 你是否看了它?(停留时间)
- 你是否点击了它?
3. “全球大脑”
一旦老师(AI)从你的本地工作坊中学习,它就会将它的“教学笔记”(模型更新)发回给发布商的服务器。
- 聚合: 发布商收集来自成千上万个不同学生(用户)的教学笔记,并将它们混合在一起,从而创造出一个超级教师(全局模型)。
- 结果: 这个超级教师随后会被发回到每个人的浏览器中。现在,每个浏览器都拥有了一个更聪明的老师,它知道如何为所有人挑选更好的广告,而无需任何人分享他们的私人日记。
4. 为什么这很重要(“可见性”测试)
研究人员构建了一个特定的测试模型来观察这是否奏效。他们问道:“这个系统能否预测用户是否真的会看到广告?”
- 类比: 想象一块广告牌。如果它被树木遮挡住了,没有人能看到它,广告商就是在浪费钱。AdFL 试图预测是否会有“树木”(你的屏幕尺寸、滚动速度等)会挡住广告。
- 速度: 该系统运行得极其迅速。它在毫秒级(比眨眼还快)内完成计算。它不会减慢你的电脑速度,也不会耗尽你的电池。
- 隐私护盾: 他们甚至测试了一种名为**差分隐私(Differential Privacy)**的“隐私盔甲”。这种技术在教学笔记中加入了一点点“静态噪声”,这样即使有人试图通过笔记进行逆向工程,也无法确定具体是你做了什么。论文发现,这种盔甲效果很好,只会导致老师变得稍微没那么聪明一点点。
核心结论
论文声称 AdFL 是一个有效的原型,它:
- 保护隐私: 你的个人数据保留在你的设备上。
- 为发布商节省成本: 它有助于展示人们真正能看到的广告,这意味着发布商能赚取更多利润。
- 运行迅速: 它在后台运行,不会让你的浏览器变慢。
- 无需安装: 它利用了你的浏览器已有的工具。
简而言之,AdFL 是一种让你既能享受(精准投放的广告)又能(保持浏览历史完全私密)的方式。
技术摘要:AdFL —— 用于在线广告的浏览器内联邦学习
问题陈述
在线发布生态系统正面临着广告收入需求与日益严格的用户隐私法规(如 GDPR、CCPA)之间的严重冲突。传统的数据共享实践(即将用户行为数据发送给外部广告代理机构)正受到越来越多的限制,迫使发布商不得不依赖效果较低的上下文广告。现有的用于广告领域的联邦学习(FL)方案面临着显著的集成障碍:
- 架构复杂性: 一些提议需要分层服务器结构,无法与现有的依赖键值竞价结构而非嵌入向量(embeddings)的广告服务器(如 Google Ads Manager)实现无缝集成。
- 数据依赖性: 纵向联邦学习(Vertical FL)方法通常需要与广告商合作,并需要获取浏览器内无法获取的外部转化数据。
- 浏览器限制: 现有的浏览器内联邦学习框架通常缺乏对广告指标的特定支持,无法进行实时数据采集,或者计算成本过高,无法满足用户访问期间极短的时间约束。
核心挑战在于:如何在尊重用户隐私(将原始数据保留在用户设备上)的同时,实现能够支持实时广告投放所需的低延迟和高效率的定向广告。
方法论:AdFL 框架
AdFL 是一个水平联邦学习框架,旨在完全在用户的 Web 浏览器中运行。它能够在数据永不离开浏览器的前提下,利用本地用户数据训练全局模型。
系统架构
该系统由两个主要实体组成:
- AdFL 服务器(发布商侧): 托管全局模型并协调学习过程。它负责管理模型版本控制并聚合本地更新。
- AdFL 客户端(浏览器侧): 一个基于 JavaScript 的客户端,与在线广告异步运行。它负责处理数据采集、预处理、本地模型训练和推理。
客户端组件
AdFL 客户端由五个使用标准浏览器 API(如 MutationObserver、IndexedDB、TensorFlow.js)实现的模块化组件组成:
- 会话管理器 (SM): 管理客户端的生命周期,处理组件的加载/卸载,并监督浏览器存储(IndexedDB)。
- 数据采集器 (DC): 捕获上下文数据(用户代理、操作系统、URL、页面内容)和会话历史。它聚合当前及过去会话的特征,以构建完整的“用户-页面”模式。
- 广告效用模块 (AdU): 专门设计用于在广告加载时实时捕获广告特定指标。它追踪可见性(viewability)、点击率(click-through)和注意力指标。它通过触发模型推理来调整广告行为(例如,根据预测修改刷新频率)。
- 数据预处理与存储 (DPS): 使用 MinMax 缩放和哈希编码等技术对原始数据进行预处理。它确保跨客户端的特征表示一致性,并管理处理后的数据样本存储。
- 模型效用模块 (MU): 处理模型的加载、训练和推理。它管理配置参数,针对设备约束(内存、电池)进行优化,并执行训练循环。
工作流
- 初始化: 页面加载时,SM 下载 AdFL 脚本并初始化存储。
- 数据采集: DC 和 AdU 分别收集上下文数据和广告特定数据。
- 预处理: DPS 将原始数据处理为特征向量。
- 推理: 对于每次广告加载,MU 执行推理以预测指标(如可见性)。AdU 利用这些预测来动态调整广告展示参数(例如,延长或缩短广告持续时间)。
- 训练: 定期,MU 在累积的数据上训练本地模型。
- 聚合: 本地模型参数被上传至 AdFL 服务器。服务器使用 FedAvg(按数据集大小加权)聚合这些参数以更新全局模型,随后将更新后的模型重新分发给客户端。
隐私与安全
- 数据本地化: 原始用户数据绝不离开浏览器。
- 威胁模型: 假设服务器是“诚实但好奇”(honest-but-curious)的,即遵循协议但可能试图从模型更新中推断用户行为。
- 缓解措施: 该框架支持 差分隐私 (DP),通过向本地模型更新中添加噪声,以抵御基于梯度的推理攻击。
核心贡献
- AdFL 框架: 一种全新的、端到端的联邦学习系统,专为浏览器环境设计,无需安装客户端软件即可实现无缝的本地数据采集、预处理和在线广告模型训练。
- 广告可见性预测模型: 基于 AdFL 构建的一个概念验证模型,用于预测广告可见性。它利用轻量级神经网络架构,能够处理动态输入特征并在资源受限的设备上高效运行。
- 原型实现: 一个功能完备的原型,展示了如何利用标准浏览器 API(TensorFlow.js、IndexedDB)和第一方 Cookie 实现实时的广告数据采集和有效的联邦学习训练,从而避免了对第三方 Cookie 的依赖。
实验结果
作者使用来自一个日访客量约为 40,000 人的发布商网站的两个非重叠数据集(10 天和 30 天周期)对 AdFL 进行了评估。
性能与延迟
- 延迟: 系统运行具有低延迟,适用于实时广告投放。
- 推理: 桌面端 < 3ms,移动端 < 7ms。
- 预处理: 桌面端 ~40ms,移动端 ~50ms。
- 训练: 桌面端每轮 ~378ms,移动端 ~469ms。
- 内存开销: 系统初始消耗约 50MB JavaScript 内存,在经过训练和推理后上升至约 230MB(桌面端)和 198MB(移动端),这在现代设备上是可行的。
模型准确度
- 可见性预测: 在 30 天数据集上,FL 模型实现的曲线下面积 (AUC) 高达 92.59%。
- FL 与集中式学习 (CL) 对比: FL 模型的表现与集中式模型相当,仅有轻微下降(例如,在 50 个用户的设置下,FL 为 87.36% AUC,而 CL 为 89.19% AUC)。
- 差分隐私: 应用 DP(噪声 ϵ 范围从 0.1 到 1.0)后,与非 DP 版本相比,性能仅出现轻微下降,证明了可以在接受的权衡下实施隐私保护措施。
特征重要性
通过 SHAP 分析,研究确定了广告特定特征(如广告尺寸、位置)和定制化指标是模型性能最重要的贡献因素,这验证了 AdFL 客户端特定数据采集能力的重要性。
意义与主张
本文将 AdFL 定位为解决在线广告中“隐私 vs 收入”困境的切实解决方案。其意义在于:
- 可行性: 证明了复杂的联邦学习流水线可以在浏览器约束内高效运行,且无需用户安装软件。
- 隐私保护: 为发布商提供了一种机制,使其在保持数据本地化并符合隐私法规的前提下,利用用户数据进行定向广告投放。
- 收入优化: 表明隐私保护模型可以实现高准确度(AUC 高达 92.59%),从而使发布商能够维持接近于非隐私保护的集中式系统的收入水平。
作者总结道,AdFL 代表了平衡用户隐私与发布商收入的一个充满前景的步骤,为当前的各种数据共享实践和广告拦截绕过手段提供了一个可行的替代方案。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。