Training-Free Pseudo-Fusion for Composed Image Retrieval with Diffusion Models and Multimodal Large Language Models
本文介绍了 PeFuse,这是一个无需训练的组合图像检索框架,它利用预训练的扩散模型和多模态大语言模型,通过生成式转换将组合查询转换为单模态检索任务,在无需专门的任务特定训练的情况下实现了具有竞争力的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正漫步在一座巨大的数字图书馆中,这里的每一本书都是一张图像。传统的搜索引擎可以通过展示另一张图片来让你找到某张图片,但当你想说:“给我看那件同样的裙子,但要红色的,并且是长袖的”时,它们就会显得力不从心。这种被称为“组合图像检索”(composed image retrieval)的特定挑战,要求计算机能够理解一个混合了视觉参考和文本指令的请求。多年来,解决这一问题需要构建定制且复杂的软件,这些软件必须在海量的标注数据上进行艰苦的训练。如果数据发生变化或请求变得过于具体,这些系统往往会失效。研究人员长期以来一直在寻求一种无需如此沉重的定制化训练即可实现此类搜索的方法,希望创造出一种能够仅利用其已拥有的强大工具,就能立即理解任何新请求的系统。
卢森堡大学的一个研究小组现在展示了一种无需任何新训练即可实现这一目标的方法。他们开发了一种名为 PeFuse 的方法,它充当了视觉世界与文本世界之间聪明的翻译官。该系统并没有试图从头开始让计算机学习如何将图像和句子融合在一起,而是利用两个现有的、经过预训练的人工智能工具来完全重写请求。其中一个工具是多模态大语言模型,它极其擅长阅读图像并编写描述;另一个是扩散模型,它是一个强大的图像生成器,可以根据文本创建新的图片。研究人员发现,通过使用这些工具将混合请求转换为单一的、纯粹的形式——要么将整个请求转化为一张新图像,要么将其转化为一段详细的文本描述——他们可以将结果接入从未为这项任务设计的标准搜索引擎中。
研究人员在包含时尚单品、开放领域照片和复杂场景的几个标准数据集上测试了这种方法。他们发现,最有效的策略是将混合请求转换为文本描述,然后搜索与该文本相匹配的图像。在这种情况下,语言模型读取参考照片和用户的指令,然后写出一个新的、精确的句子,准确捕捉用户所寻找的内容。这个新句子随后被输入到一个标准的图像搜索引擎中。令人惊讶的是,这种简单的翻译步骤比尝试根据请求生成一张新图像并搜索相似图片的效果更好。虽然图像生成工具可以创建新图片,但这些图像往往包含细微且不自然的缺陷,从而误导搜索引擎。然而,文本描述却能保持清晰且语义准确,从而使搜索引擎能够以高精度找到正确的匹配项。
研究还探讨了当系统尝试进行反向操作时的情况:即将数据库中的目标图像转换为文本,以匹配用户的请求。虽然这比尝试将图像与图像直接进行匹配效果更好,但仍逊色于“文本到图像”的方法。研究人员发现,最终搜索结果的质量很大程度上取决于所选工具的具体类型。例如,使用更大、更强大的语言模型通常会提高结果,尽管提升幅度有时很小。他们还研究了图像生成器的不同设置如何影响结果,发现使用过多的步骤来生成图像,或者试图强迫图像看起来过于像原始参考图,实际上都会损害搜索性能。其中的“甜点位”(最佳平衡点)是采用适中的步骤数和较低的“对原始图像遵循程度”设置,从而给予生成器足够的自由度来融入新的文本指令。
这项工作的意义在于,它不需要任何新数据,也不需要对底层模型进行重新训练。该系统完全是“无需训练的”(training-free),这意味着它可以立即部署在新的数据集或新领域,而无需通常所需的数月准备工作。研究人员表明,通过简单地将这些现有的工具串联起来,他们就可以达到甚至超过专门为该任务训练的复杂系统的性能。这表明,这项技术的未来可能不在于构建更大、更专门的模型,而在于寻找更聪明的方法来利用我们已经拥有的强大通用工具。通过将问题视为一个“翻译任务”而非“融合任务”,研究人员为开发更灵活、更具适应性的图像搜索系统开辟了一条道路,使这些系统能够理解人类意图,而无需从头开始学习。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。