← 最新论文
🤖 AI

AutoRelAnnotator: Calibrated Model Cascades for Cost-Efficient Relevance Evaluation in Sponsored Search

该论文提出了 AutoRelAnnotator,这是一个结合了领域特定微调、级联架构和逐类保序校准的高效系统,旨在为赞助搜索大规模生成高质量的相关性标注,成功处理了超过 1.5 亿个查询,并显著降低了人工标注成本和计算开销。

原作者: Md Omar Faruk Rokon, Shasvat Desai, Hong Yao, Kuang-chih Lee

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Md Omar Faruk Rokon, Shasvat Desai, Hong Yao, Kuang-chih Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你经营着一家像沃尔玛那样规模巨大的在线商店。每当顾客输入一个搜索查询(比如“跑步鞋”)时,你的计算机都必须决定哪些产品是最相关的并展示给他们。为了做出这个决定,计算机需要从示例中学习。但谁来教计算机呢?是人类。

问题在于,雇佣人类来标注数百万条搜索结果既缓慢(需要数天时间)又昂贵(成本高达数十万美元)。另一方面,使用高级、昂贵的 AI 模型(如 GPT-4)来进行标注虽然更快,但它们并不擅长理解你特定商店的产品,从而会导致错误。

来自沃尔玛全球技术团队(Walmart Global Tech)的论文作者们构建了一个名为 AutoRelAnnotator 的智能系统来解决这个问题。你可以把它想象成一个用于标注搜索结果的高效**“分诊系统”**。

以下是其工作原理,通过简单的概念进行拆解:

1. “一刀切”式 AI 的问题

想象你有一支专家团队。如果你要求一位世界闻名的教授(一个巨大的 AI 模型)去做一件简单的工作,比如“这是一个红苹果吗?”,他们可能会想太多,耗费很长时间,甚至因为他们不是水果专家而判断错误。
论文发现,标准的、现成的 AI 模型在判断其特定商店的相关性方面,准确率仅为 68–70%。而他们需要 89% 的准确率才能投入使用。

2. 解决方案:三层“过滤器”(级联结构)

作者并没有让一个庞大、昂贵的 AI 处理所有事情,而是构建了一场由三个跑者组成的接力赛,每个跑者都变得越来越贵,但也越来越聪明。

  • 跑者 1(短跑选手): 一个小型、快速、廉价的模型(交叉编码器/Cross-Encoder)。它观察搜索词和产品标题。它非常快(5 毫秒)。
  • 跑者 2(中距离选手): 一个中等规模的模型(Gemma-2B)。它耗时约 50 毫秒。
  • 跑者 3(马拉松选手): 一个大型、强大的模型(LLaMA-8B)。它耗时 200 毫秒。

比赛是如何进行的:
系统询问跑者 1 进行预测。

  • 如果跑者 1 非常有信心(例如:“我有 95% 的把握这是一个完美匹配!”),系统就会接受答案并停止。没必要再调用昂贵的跑者。
  • 如果跑者 1 不确定(例如:“我觉得它是匹配的,但我只有 60% 的把握”),它会将接力棒交给跑者 2。
  • 如果跑者 2 也不确定,它会传给跑者 3。
  • 如果连跑者 3 也感到困惑,这三个模型将共同投票做出最终决定。

神奇之处: 这种“级联”方法意味着系统只将复杂的难题留给昂贵且缓慢的模型。对于简单的问题(其中大部分都是简单问题),它使用廉价且快速的模型。这使计算成本降低了一半,且没有损失准确性。

3. 秘诀:“校准”(信心教练)

这里有一个陷阱:AI 模型经常会对自己的信心程度撒谎。它们可能会说“我有 90% 的把握”,但实际上只有 60%。如果系统信任了这个谎言,就会过早停止并导致错误。

作者添加了一个 校准教练(具体为“逐类保序校准/per-class isotonic calibration”)。

  • 你可以把这个教练想象成一名裁判,他观察着跑者并说:“嘿,当你说你在‘类别 A’上有 90% 的把握时,实际上你只有 80% 的把握。让我们调整一下你的信心得分。”
  • 论文发现,针对每种特定类型的答案(例如“完美匹配”对比“糟糕匹配”)分别修正这些信心得分,有助于系统更准确地路由查询。这为最终的准确性带来了微小但具有统计学意义的提升。

4. 结果:先对模型进行训练

在接力赛开始之前,作者做了一件至关重要的事:他们对所有三个模型进行了微调(Fine-tuning)

  • 他们没有使用那些了解世界万物但对你的商店一无所知的通用 AI 模型,而是专门针对他们自己的 120 万个搜索数据示例对这些模型进行了训练。
  • 类比: 这就像是将一名全科医生进行专门培训,使其成为“沃尔玛库存”方面的专家。突然之间,他们变成了专科医生。
  • 仅这一步就将准确率从约 68% 提升到了约 89%。

核心总结

通过结合这三个要素,团队找到了一个“甜点位”:

  1. 微调 让模型变得准确(“大脑”)。
  2. 级联 让过程变得便宜且快速(“经济性”)。
  3. 校准 确保模型知道何时停止以及何时寻求帮助(“信任”)。

现实世界的影响:

  • 速度: 原本需要人工团队花费 5 天 时间进行标注的任务,现在仅需 1 到 3 小时
  • 容量: 他们处理了超过 1.5 亿 条标注。
  • 成本: 与对每一个查询都使用大型强大模型相比,他们将计算成本降低了一半。

简而言之,他们构建了一个智能、自我纠正的流水线,能够像专家团队一样标注搜索结果,但成本和时间却极低。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →