想象一下,你正走在一座巨大且无止境的图书馆里,书架每秒钟都会根据你的思绪重新排列。这就是现代网络搜索的世界——一个致力于帮助人们在数十亿数字条目中精准找到所需内容的计算机科学领域。长期以来,判断一位图书管理员(或计算机算法)是否称职的唯一方法,是雇佣一支人类读者团队来检查每一条书目推荐。他们会阅读标题、查看图片,然后做出判断:“这真的是用户想要的东西吗?”但人类会疲劳,效率极低,而且雇佣足够多的人来检查所有内容需要耗费巨额成本。最近,科学家们发现了一种新型的“超级读者”,叫做视觉语言模型(VLM)。你可以把它们想象成 AI 侦探,它们可以同时阅读文本并观察图片,像人类一样理解图像背后的故事。现在大家都在问一个大问题:这些 AI 侦探能否被信任去承担人类读者的工作?如果可以,它们的速度是否足够快,能帮助我们构建更好的搜索引擎?
来自 Pinterest 团队的这篇论文讲述了他们如何教导一名 AI 侦探来为搜索结果评分,并证明了这种方法比旧方法更有效。他们构建了一个系统,让 AI 查看用户的搜索问题、物品(称为“Pin”)的图片以及所有描述该物品的文本,然后给出 1 到 5 分的相关性评分。该团队发现,这个 AI 的准确率极高,与人类评判者的匹配度达到了 83%,并且几乎总是在与人类评分的误差一个分值以内。但真正的魔力不仅在于 AI 很出色,还在于它速度极快。人类团队可能需要两天时间才能标注一批搜索结果,而 AI 仅需两小时即可完成。由于 AI 如此快速且廉价,团队得以停止使用小规模的随机样本,转而采用一种更聪明、更有组织性的采样方法。这一转变让他们能够发现此前无法察觉的搜索质量微小提升。通过切换到这种由 AI 驱动的系统,他们将“最小可检测效应”(即我们能够可靠衡量的最小变化量)降低了六倍。这意味着他们现在可以捕捉到搜索引擎表现中细微且具有意义的变化,确保用户能够精准找到所需之物,而无需在缓慢的人工检查上浪费金钱或时间。
传统上,相关性评估依赖于人工标注。然而,这种方法受到高成本、长周转时间和有限可扩展性的约束。这些瓶颈导致测量设计只能使用较小的样本量,这只能检测出巨大的指标变动,而无法捕捉异质性处理效应或微小且有意义的改进。本文旨在解决构建一个可扩展、高性价比且可靠的自动化相关性评估系统的需求,使其能够在 Web 规模下运行。