← 最新论文
🤖 AI

Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval

这项研究表明,像 GPT-4.1 和 Claude Sonnet 4.6 这样的前沿大语言模型在 Flickr30k 数据集上的检索性能与谷歌原生的多模态 Gemini Embedding 2 持平,尽管后者由于具有可预计算的嵌入向量,在低延迟应用方面仍保持优势。

原作者: Archan Dutta, Vyanktesh Kanungo

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Archan Dutta, Vyanktesh Kanungo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一堆巨大且混乱的干草堆中寻找一根特定的针。但这里有个转折:这根针不仅仅是一块金属,它还是一张图片,而你正在用文字来描述它。这就是**多模态检索(multimodal retrieval)**的世界,它是计算机科学的一个分支,旨在让机器学会如何将它们所见的(图像)与它们所读的(文本)联系起来。多年来,实现这一目标的标准方法是构建两个独立的“大脑”:一个负责阅读文本并将其转化为一种秘密代码,另一个负责观察图片并将其转化为另一种不同的秘密代码。然后,计算机尝试匹配这些代码,就像试图通过用力眯起眼睛,把方头榫头塞进圆孔里一样。

最近,两件超级工具进入了竞技场。首先是前沿大语言模型(LLM)。把它们想象成极其聪明、无所不知的图书管理员,他们可以看一眼 25 张照片和一句话,然后瞬间读完每张照片,相互比较,并选出最佳匹配项。其次是原生多模态嵌入(Natively Multimodal Embeddings)。它们就像是一个通用的翻译官,从一开始就能流利地使用“图像”和“文本”两种语言,将一切转化为单一且统一的秘密代码,而不需要两个独立的大脑进行交流。大家都在问一个大问题:我们是否需要那位超级聪明的图书管理员去阅读每一张照片并进行比较,还是说这位通用翻译官本身就足够快且准确,足以独自完成这项工作?这至关重要,因为如果那位图书管理员动作太慢,你就无法将他们用于像在街上行走时搜索相册这样的实时应用。

本论文使用一个名为 Flickr30k 的数据集设定了一场高风险的比赛,该数据集包含 31,000 张带有真人编写描述的图像。为了让这场比赛真正公平且具有挑战性,研究人员并没有只是向模型投掷随机照片。他们创建了“硬负样本(hard negatives)”——这些照片看起来与正确答案非常相似,但并不完全正确,旨在迷惑即使是最聪明的系统。他们测试了四位重量级选手:Gemini Embedding 2Amazon Nova 2(通用翻译官)对阵 GPT-4.1Claude Sonnet 4.6(超级聪明的图书管理员)。

结果令速度型选手感到震惊,却让精度追求者感到欣慰。在准确率方面,通用翻译官和超级聪明的图书管理员不相上下。研究发现,Gemini Embedding 2GPT-4.1Claude Sonnet 4.6 的表现从统计学上来看是相同的。它们如此接近,以至于你无法仅凭准确率将它们区分开来;在这些棘手的场景中,它们都能成功选出正确的图像,准确率约为 80%。论文明确排除了“图书管理员在准确率上具有压倒性优势”的观点,表明新的嵌入模型在寻找干草堆中的正确针头方面同样敏锐。然而,其中一个模型 Amazon Nova 2 确实落后了,其正确率低了约 13 个百分点,这可能是因为它被设定用于通用任务,而非这种特定类型的图像搜索。

但真正的故事不仅在于谁赢得了准确率之赛,更在于谁能跑完这场马拉松。在这里,两种方法出现了巨大的分歧。超级聪明的图书管理员(LLM)必须针对每一个问题查看整组照片中的每一张。论文对此进行了测量,发现对 1,000 个查询进行排序时,图书管理员分别耗时超过 6,100 秒(对于 GPT-4.1)和 9,415 秒(对于 Claude Sonnet 4.6)。那是长达数小时的等待。相比之下,通用翻译官(嵌入模型)的工作方式不同。它们可以预先计算所有照片的秘密代码,就像在图书馆开门之前,先为每本书贴上条形码一样。一旦完成这个“预计算”步骤,寻找 1,000 个查询对应的照片,嵌入模型花费的时间不到 2 秒

作者得出结论,虽然超级聪明的图书管理员擅长推理和并排比较图像,但通用翻译官是任何需要即时响应场景的明显赢家。如果你正在开发一款用户需要在眨眼之间搜索大量图像的应用,嵌入模型是更好的选择。如果你的照片集每秒钟都在变化,或者规模非常小,导致预计算步骤变得毫无意义,那么图书管理员仍然有用。但对于速度和规模而言,新的嵌入模型已经证明,它们可以在运行速度比巨头们快一千倍的同时,依然能匹配这些巨头的准确度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →