Measuring the Prevalence of Policy Violating Content with ML Assisted Sampling and LLM Labeling
本文提出了一种基于设计的测量系统,该系统将机器学习辅助的概率抽样与大语言模型标注相结合,旨在高效且准确地估算各类用户群体中违规内容的流行率,同时保持统计上的无偏性和成本效益。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数十亿人每天分享照片、想法和故事的广阔数字景观中,一个静默但至关重要的挑战依然存在:你如何知道你的用户究竟看到了什么?多年来,平台一直依赖用户举报来标记有害内容,但这种方法就像是通过计算只有那些呼救的人的数量来测量河流的深度。许多危险之所以未被举报,是因为用户没有注意到它们、不知道如何举报它们,或者仅仅是不想参与其中。为了真正了解平台的安全性,团队需要衡量“流行率”(prevalence)——即用户遇到违规内容的实际比例。这需要观察整个内容流,而不仅仅是那些已经被标记出来的部分。问题在于,有害内容通常很稀少,而每天手动检查每一项内容既太慢又太贵。
Pinterest 的研究团队开发了一种新方法来解决这个问题,他们创建了一个结合了智能采样与先进人工智能的系统,以空前的速度和准确度来衡量安全性。他们不再等待投诉,而是每天对展示给用户的所有内容进行一次具有代表性的快照。他们使用一种统计方法,将有限的检查预算集中在最有可能发生违规的候选对象上,从而确保在不检查所有内容的情况下,也能找到足够的样本以确保数据的可靠性。然后,他们使用一个大型语言模型(一种经过训练可以理解文本和图像的 AI)来标注这些样本,充当一名不知疲倦、始终如一的审核员。通过结合这些技术,他们可以生成一份关于用户看到有害内容频率的每日报告,并附带关于该数值精确度的度量。这使得安全团队能够立即发现新兴问题,测试修复方案是否奏效,并准确了解风险出现的时间和地点,而无需等待数周让人工审核人员赶上进度。
该系统的核心在于一种巧妙的选择待检查内容的方案。在数十亿次的每日浏览中,寻找一个罕见的违规行为就像是在森林中寻找一种特定的叶子。如果你随机挑选叶子,你可能会走过数英里却一无所获。研究人员改用了一种“加权”方法。他们观察两个主要线索:一件内容被展示给人们的次数,以及由平台现有安全模型生成的风险评分。他们结合这些线索创建一个列表,其中既受欢迎又具有风险的内容更有可能被选中进行审查。这并不意味着他们只检查高风险项目;他们仍然从整体人群中进行选择,但稍微倾斜概率,以确保获得足够的违规样本来进行可靠的统计估计。这种方法使他们能够使用每天固定的检查次数,即使在违规情况极其罕见时,仍能获得整个平台的清晰图景。
一旦系统选择了每日样本,就会进入标注阶段。在这里,研究人员用多模态大语言模型取代了传统的人工审核过程。这种 AI 可以观察图像、阅读文本并理解上下文,就像人类审核员一样。然而,研究人员并没有简单地让 AI 做决定;他们在它周围构建了一个严密的质量控制系统。在 AI 被允许对每日样本进行标注之前,必须针对一组经过人类专家仔细审查的“金标准集”(gold set)内容进行测试。AI 必须在非常小的误差范围内达到与人类专家的决策一致,才能正式启用。一旦投入运行,系统会通过将每日标签中的随机选择部分发回给人类专家进行验证,来持续检查 AI 的工作。这确保了 AI 不会随着时间的推移而产生偏差或系统性错误。结果显示,该标注过程比纯人工审核快约 15 倍,成本降低了 10 倍以上,同时保持了相似的准确度。
这种方法的威力在于其能够提供一个可以进行多种维度拆解和分析的统一视图。由于研究人员每天抽取一个全局样本,他们可以立即回答有关安全性如何随地区、内容类型或内容时长变化的问题,而无需为每个问题单独运行一项研究。他们可以通过对比变化前后的数据,观察新的政策更新是否奏效,或者查看特定类型的有害内容是否在某个国家出现激增。系统还会为生成的每个数字计算置信区间,告诉安全团队应对该结果投入多少信任。如果该数字是基于极少数的罕见违规案例,置信区间将会很宽,这向团队发出信号,提示他们在做出重大决策前应等待更多数据。
研究人员在模拟环境以及他们在 Pinterest 的实际生产环境中对该系统进行了广泛测试,该系统已在实际环境中每日运行了一年多。他们发现,通过使用这种基于机器学习辅助的采样方法,他们可以在每日样本中发现比标准随机采样方法多 6 到 11 倍的违规行为。这种效率意味着他们可以用更少的检查次数达到相同的统计精度,或者在投入相同工作量的情况下获得更紧密、更可靠的数据。他们还证明了,即使用于引导采样的底层风险评分发生变化或随着时间推移变得不再准确,系统的最终估计值仍然是无偏的。误差会表现为更宽的置信区间,而不是错误的答案,对于需要区分趋势是真实存在的还是仅仅是噪声的决策者来说,这是一个至关重要的区别。
最重要的发现之一是系统如何处理自动化标注带来的必然错误。研究人员发现,对于非常罕见的违规行为,最大的风险不是漏掉违规行为,而是将安全内容错误地标记为有害。在大量的安全内容中,一个误报(false positive)就可能让情况看起来比实际严重十倍。为了管理这一点,系统不断监控 AI 的误报率。如果误报率过高,系统可以应用数学修正来调整最终数值,或者触发对导致此类激增的具体项目的专家人工审查。这确保了每日报告反映的是现实,而非 AI 模型的特性。团队还发现,数据的日间波动通常是由发布内容类型的变化或 AI 理解规则方式的微妙转变驱动的,而非实际安全水平的变化。通过平滑这些短期波动并专注于每周趋势,他们可以区分正常的噪声与真正的潜在威胁。
这项工作代表了数字平台监测安全性的方式转变:从基于用户投诉的被动响应模式,转向主动的、数据驱动的方法。通过将安全性测量视为一门统计科学而非仅仅是一项执行任务,研究人员创建了一个能够检测到问题刚出现时的工具。该系统设计灵活,允许团队在在线内容格局变化时快速添加新政策或调整参数。它依赖于采样、AI 标注、人工验证和统计分析的持续循环,建立了一个足以跟上互联网速度的反馈回路。研究人员强调,该系统并非人类判断或政策执行的替代品,而是一个互补工具,提供了进行有效决策所需的清晰度。它将不可见变为可见,为安全团队提供了理解平台真实状态并以更高的精度和速度保护用户的“眼睛”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。