A Scoping Review of Methods to Measure the Energy and Carbon Footprint of Web Tracking and Advertising
本范围综述综合了15项研究,旨在确定衡量网络追踪与广告的能量及碳足迹的五种不同方法论路径,以期为广告技术生态系统未来的环境核算建立结构化基础。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每当你访问一个网站时,后台都在进行着一场隐形的数据交换经济。当你阅读文章或观看视频时,隐藏的脚本正在运行,以追踪你的行为、构建你的兴趣画像并投放定向广告。这个通常被称为广告技术(ad-tech)生态系统的系统,是许多免费在线服务盈利的主要方式。然而,捕捉、存储和处理这些海量用户数据需要巨大的计算能力。这种动力来自于电力,而发电过程往往会产生碳排放。随着互联网的增长,其环境足迹也在扩大,这向研究人员提出了一个难题:在试图让你看到的实际内容之外,究竟有多少能量是真正消耗在广告和追踪上的?
多伦多大学的一个研究小组致力于通过回顾现有的科学文献来回答这个问题。他们并非在进行新的实验,而是在绘制其他科学家如何尝试衡量这一特定环境成本的图景。他们发现,该领域仍处于起步阶段且呈现碎片化状态。他们审查的研究研究分布在不同的学科中,使用不同的术语来描述相同的过程,并使用不同的工具来测量相同的事物。为了理清现状,作者从最初的 46 项候选研究中筛选出 15 项关键研究,并将它们归纳为五种不同的方法,研究人员利用这些方法来分离网络追踪和广告的能量成本。
最常用的方法在大多数研究中被采用,被称为“广告拦截”(ad blocking)。在这种方法中,研究人员两次访问一系列热门网站:一次使用标准浏览器,另一次开启广告拦截器。通过比较两种场景下的能量使用情况,他们可以计算出由广告和追踪器引起的特定差异。一些研究人员使用浏览器扩展程序来拦截广告,另一些则使用内置的浏览器功能,甚至在网络层面拦截请求。为了获取这些数据,他们通常使用能够读取计算机处理器占用率或电池消耗情况的软件,或者在某些情况下,连接物理电压表到设备上,以测量流入硬件的电流。这种方法非常实用,因为可以在普通计算机上完成,但它依赖于一个假设,即两次访问之间唯一的变量就是广告的存在与否。
第二组研究人员采取了更受控的方法,即在实验室环境中重建网站。他们不是在开放的互联网上访问实时网站,而是下载页面并自行剥离广告和追踪脚本,从而创建一个干净的版本。然后,他们在自己控制的服务器上本地提供这些版本,确保没有任何外部变量干扰测试。在其中一种变体方法中,研究人员从头开始构建了一个网站,并添加了不同数量的追踪工具,观察能量消耗如何随着每一次添加而上升。这种方法提供了极高的实验控制度,使科学家能够精确观察单个追踪器消耗了多少能量,尽管它可能无法完美反映真实网络中混乱的现实。
第三种更为特殊的方法涉及重放单个广告。一项研究收集了来自网络的海量广告,并创建了一个系统,将它们逐一显示在一个空白浏览器页面上。通过测量加载单个广告所需的能量与空白页面的基准值之间的差异,研究人员可以确定渲染该特定广告的成本。随后,他们利用这些数据训练了一个计算机模型,该模型可以根据广告的特征预测其他广告的能量成本。这种技术可以对单个广告单元的成本进行细粒度的观察,但需要大量的手动数据收集工作来建立初始的广告库。
第四种方法关注的是数据流本身,而不是展示数据的设备。这些研究人员不再测量计算机屏幕,而是分析用户与互联网之间移动的网络流量。他们检查发送和接收的数据包,试图识别数据流中哪些部分属于广告和追踪 Cookie。通过汇总这一特定流量的总量,他们可以估算在互联网上传输这些数据所需的能量。然而,该综述的作者指出,这种方法存在一个显著缺陷:仅仅知道传输了多少数据并不自动意味着你知道了处理这些数据消耗了多少能量,因为数据大小与能量消耗之间的关系非常复杂,且尚未被完全理解。
最后一种方法完全依赖于现有的数字,而非新的测量。使用这种方法的研究人员从其他已发表的研究中提取数据和系数——例如移动一千兆字节(GB)数据所需的平均能量成本,或电网的碳强度——并将其应用于广告产生的估计数据量。这使得进行大规模的粗略计算成为可能,而无需进行任何实验或收集新数据。虽然这是获取大致估算值最便捷的方式,但其准确性完全取决于其引用的原始数据的质量和相关性。
综述显示,该领域才刚刚站稳脚跟。在他们分析的研究中,有 80% 是在过去五年内发表的,这表明随着环境危机加剧,研究兴趣正在迅速激增。尽管有所增长,研究人员发现这些研究很少进行交流。不同的团队对同一概念使用不同的术语,并且往往未能建立在彼此的研究成果之上。例如,一项研究发现,传输广告的数据量并不一定能预测显示它所需的能量,这一发现挑战了其他依赖数据量来估算能量使用的研究所持有的假设。
目前,还没有一个所有人都认可的单一标准方法。大多数研究都集中在用户的设备上,这导致我们在理解存储和处理这些信息的庞大数据库所消耗的能量方面存在巨大的认知空白。由于这些企业基础设施是不透明且难以触及的,研究人员不得不依赖间接方法或受控模拟。作者建议,未来的工作需要开发更好的方法来测量这些数据中心使用的能量,并创造一种共同的语言,以便不同领域的科学家能够准确地比较他们的结果。在此之前,我们只能依靠一系列零散的方法来窥见数字经济的环境成本,却无法获得完整的图景。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。