← 最新论文
📊 statistics

Calibrate Globally, Measure Everywhere: Scaling LLM-Based Prevalence Measurement Across A/B Experiments

本文提出了一种针对 Pinterest 实验平台的具有成本效益的系统级解决方案,通过实现单一且持续更新的全局机器学习评分分桶校准,在相同的预算内,使基于大语言模型(LLM)的内容流行度测量规模扩展至数百个并发 A/B 测试,从而实现了比传统的每项实验单独进行 LLM 标注高出 20 倍以上的实验分支的每日高保真追踪。

原作者: Zehao Xu, Tony Paek, Kevin O'Sullivan, Attila Dobi

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Zehao Xu, Tony Paek, Kevin O'Sullivan, Attila Dobi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在经营一座规模宏大、繁忙的城市,每天都有数百万人穿梭在街道上。在这座城市里,有成千上万种不同的商店、公园和广告牌,而城市规划者想要准确知道人们在特定类型事物(比如“园艺工具”或“AI 生成艺术”)上花费了多少时间——这就是流行度测量(prevalence measurement):计算属于某一特定类别的“曝光量”(或瞥见次数)占总量的比例。

为了对这座城市做出决策,规划者经常进行 A/B 测试(A/B experiments)。这就像是在测试两个不同版本的路标:一半的人看到版本 A,另一半的人看到版本 B,以此观察哪个版本能让人们更开心或参与度更高。通常,要了解一个路标是否奏效,你需要统计结果。但问题在于:有时你想统计的东西很难测量。你无法询问每一个路人他们看到了什么,否则既费时又费钱。在数字世界中,处理这种“难以测量”的任务通常由**大语言模型(LLMs)**来完成——这些超级智能的 AI 计算机可以阅读一张图片或一条帖子,并告诉你:“是的,这是关于园艺的,”或者“不,这不是。”虽然这些 AI 裁判非常准确,但要求它们去查看每天拥有数十亿访客的城市中的每一个项目,对于每一次实验来说都太昂贵且太慢了。

这就是 Zehao Xu 及其在 Pinterest 团队的研究成果所解决的问题。他们面临一个挑战:他们每天都在运行数百个实验,并且需要知道每个实验组中特定内容类型(如 AI 或安全问题相关内容)的“流行度”。他们负担不起为每一个新实验中的每一个项目都支付 AI 标注费用。因此,他们构建了一个聪明的系统,充当一个“全球翻译官”。他们不再要求昂贵的 AI 去检查每个新实验中的每一个项目,而是要求 AI 每天检查一次整个城市的代表性样本。他们利用这个样本来教一个更便宜、更快的模型如何预测流行度。然后,他们使用这个快速模型来即时测量其他所有内容。其结果是?他们可以追踪数百个实验中内容曝光度的微小变化——即使是那些单次昂贵检查会错过的细微变化——而且无需额外花费 AI 标注的成本。

问题所在:“金标准”成本过高

在在线媒体的世界里,像 Pinterest 这样的公司需要在保持用户参与度的同时,确保用户不会看到过多特定类型的(如不安全图像或低质量垃圾信息)内容。为此,他们会进行 A/B 测试。在这些测试中,他们会调整算法,以观察它是否改变了用户看到特定类型内容的程度。

为了衡量这一点,“金标准”是使用 AI(即 LLM)来观察样本内容并进行完美标注。这就像是聘请一支专业的艺术评论家团队来检查画廊里的每一幅画,以统计其中有多少是风景画。这很准确,但速度极慢且极其昂贵。如果你同时运行着数百个实验,并且需要为每一个实验中的每一个组检查内容,那么成本将是天文数字。你根本无法负担每天雇佣这些“专家”去查看所有内容。

此外,公司所关注的变化往往非常微小。如果一种新算法将用户看到的“AI 生成艺术”减少了仅 2% 或 5%,单次的、昂贵的检查可能并不足够精确,无法判断这种变化是真实的还是仅仅是随机噪声。这就像试图用一个昂贵的麦克风在嘈杂的房间里听取一声耳语;你可能会完全错过它。

解决方案:全局校准图谱

Pinterest 的团队意识到,他们不需要让昂贵的 AI 为每一个实验标注所有内容。相反,他们需要一种方法,利用昂贵 AI 的智慧来“校准”一个更便宜、更快速的方法。

可以这样理解:想象你有一个极其准确但反应迟钝的温度计(LLM)和一个廉价、快速的温度计(ML 模型评分)。廉价温度计给出的数值虽然不是完全准确,但如果你每天使用昂贵的温度计去检查几个特定的点,你就可以创建一张地图,告诉你在任何位置如何修正廉价温度计的读数。

该论文描述的系统正是这样运作的:

  1. 全局校准(Global Calibration): 他们没有为每个实验分别进行标注,而是进行每日的全局采样过程。他们使用昂贵的 LLM 来标注整个平台流量的代表性样本。
  2. 分桶(Bucketing): 他们获取来自廉价、快速模型的分数(该模型预测一个项目属于“AI 生成”类别的可能性),并将它们分组到“桶”中(例如 0–10%、10–20% 等)。
  3. 转换(The Translation): 利用每日的 LLM 标签,他们计算出每个桶中实际属于“AI 生成”的项目的确切百分比。这创建了一个查找表:“如果廉价模型显示一个项目处于 80–90% 的桶中,那么它实际上是 AI 生成的概率为 95%。”
  4. 即时测量(Instant Measurement): 现在,对于任何新的实验,他们都不需要调用昂贵的 AI。他们只需查看实验中项目的廉价模型分数,看它们落入哪些桶中,然后使用预先计算好的地图,即可瞬间得知流行度。

结果:捕捉耳语

该团队在现实世界的实验中,将该系统与“金标准”LLM 测量进行了对比测试。结果令人印象深刻:

  • 规模: 该系统目前每天服务约 100 个实验250 个不同的组(臂)
  • 效率: 与旧有的、为每个实验进行单次昂贵检查的方法相比,这个新系统在使用相同的标注预算下,提供的每日测量量增加了 20 倍以上
  • 准确性: 在大约 300 次生产审计中,该系统的 95% 置信区间(统计确定性范围)在 92% 的时间内包含了昂贵 LLM 的答案。这意味着这种廉价、快速的方法几乎与昂贵的方法一样可靠。
  • 灵敏度: 最令人兴奋的发现是关于检测微小变化的能力。在一个实验中,新系统检测到了某种特定内容类型 4.2% 的相对减少,尽管这一变化很小但具有持续性。如果对同一个实验进行单次的、昂贵的 LLM 检查,由于噪声过高,会完全错过这一变化。通过汇总每日数据,新系统能够听到那个昂贵麦克风错过的“耳语”。

为什么这很重要

这不仅仅是为了节省资金,更是为了做出更好的决策。在此系统出现之前,由于成本过高,团队可能不得不跳过对许多实验进行内容流行度测量。或者,他们可能会基于一个带有噪声的单一数据点做出决策,从而忽略了微小但重要的趋势。

通过“全局校准,到处测量”,团队创建了一个这样的系统:昂贵 AI 的成本被支付了一次(或被摊薄),然后被重复使用了数千次。它将一个缓慢、昂贵的过程变成了一个快速、每日进行的常规流程。这使得产品团队能够看到其变化如何影响内容曝光的全貌,确保平台在保持高质量和吸引力的同时,依然安全且不会造成沉重的财务负担。

论文强调,这是一个系统级的成就,而不仅仅是一个新的数学公式。它是关于构建一个流水线,将一个重复性的、昂贵的任务转化为一个可重复使用的资产。虽然论文指出,随着未来 LLM 成本的下降,直接标注可能会变得更便宜,但该系统的逻辑——即利用全局校准来扩展测量规模——在今天管理复杂的大规模实验方面,仍然是一个强大的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →