← 最新论文
🤖 machine learning

Advancing Relevance Measurement with Vision-Language Models for Web-Scale Search

本文介绍了一种部署在 Pinterest 搜索中的基于视觉-语言模型(VLM)的自动化相关性评估流水线,该流水线与人工标注保持一致,从而显著提高了在线 A/B 测试中的测量效率、扩大了查询覆盖范围并降低了最小可检测效应(MDE)。

原作者: Han Wang, Alex Whitworth, Pak Ming Cheung, Zhenjie Zhang, Krishna Kamath, Xi Chen, Roberto Konow, Kurchi Subhra Hazra

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Han Wang, Alex Whitworth, Pak Ming Cheung, Zhenjie Zhang, Krishna Kamath, Xi Chen, Roberto Konow, Kurchi Subhra Hazra

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走在一座巨大且无止境的图书馆里,书架每秒钟都会根据你的思绪重新排列。这就是现代网络搜索的世界——一个致力于帮助人们在数十亿数字条目中精准找到所需内容的计算机科学领域。长期以来,判断一位图书管理员(或计算机算法)是否称职的唯一方法,是雇佣一支人类读者团队来检查每一条书目推荐。他们会阅读标题、查看图片,然后做出判断:“这真的是用户想要的东西吗?”但人类会疲劳,效率极低,而且雇佣足够多的人来检查所有内容需要耗费巨额成本。最近,科学家们发现了一种新型的“超级读者”,叫做视觉语言模型(VLM)。你可以把它们想象成 AI 侦探,它们可以同时阅读文本并观察图片,像人类一样理解图像背后的故事。现在大家都在问一个大问题:这些 AI 侦探能否被信任去承担人类读者的工作?如果可以,它们的速度是否足够快,能帮助我们构建更好的搜索引擎?

来自 Pinterest 团队的这篇论文讲述了他们如何教导一名 AI 侦探来为搜索结果评分,并证明了这种方法比旧方法更有效。他们构建了一个系统,让 AI 查看用户的搜索问题、物品(称为“Pin”)的图片以及所有描述该物品的文本,然后给出 1 到 5 分的相关性评分。该团队发现,这个 AI 的准确率极高,与人类评判者的匹配度达到了 83%,并且几乎总是在与人类评分的误差一个分值以内。但真正的魔力不仅在于 AI 很出色,还在于它速度极快。人类团队可能需要两天时间才能标注一批搜索结果,而 AI 仅需两小时即可完成。由于 AI 如此快速且廉价,团队得以停止使用小规模的随机样本,转而采用一种更聪明、更有组织性的采样方法。这一转变让他们能够发现此前无法察觉的搜索质量微小提升。通过切换到这种由 AI 驱动的系统,他们将“最小可检测效应”(即我们能够可靠衡量的最小变化量)降低了六倍。这意味着他们现在可以捕捉到搜索引擎表现中细微且具有意义的变化,确保用户能够精准找到所需之物,而无需在缓慢的人工检查上浪费金钱或时间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →