Decoupling Endpoint and Semantic Transition Learning for Zero-Shot Composed Image Retrieval
本文提出了 DeCIR,一种新颖的基于投影的零样本组合图像检索框架,它通过将端点学习与过渡学习解耦为独立的低秩适配器分支,并通过低秩方向合并进行融合,从而解决了语义过渡瓶颈,在不增加推理复杂度的情况下提升了处理复杂语义修改的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你正在玩一个“寻找新图片”的游戏。
你向计算机展示一张参考照片(比如,一只绿鸟停在树枝上的照片)。然后,你给它一条文本指令(例如:“让它变成两只鸟”)。计算机的任务是从一个庞大的图库中找到一张符合你描述的目标照片:它必须展示两只鸟,但它们必须仍然是绿色的,并且停在树枝上,就像原图一样。
这被称为组合图像检索。棘手之处在于,要在没有老师向计算机展示成千上万张“之前”、“指令”和“之后”图片示例的情况下完成这一任务。这被称为零样本学习。
问题:“捷径”陷阱
该论文指出,当前的轻量级计算机模型采取了一种懒惰的捷径。
当你说“让它变成两只鸟”时,标准模型往往会忽略原图中“绿鸟”的部分。它只听到“两只鸟”,然后抓取任何有两只鸟的图片,即使它们是红色的、蓝色的,或者正在天空中飞翔。它将你的指令视为最终结果的简单标签,而不是一组改变原始图像的规则。
作者将这种现象称为**“终点捷径”**。模型看到了目的地(两只鸟),却忘记了旅程(从一只绿鸟开始)。
冲突:试图同时学习两件事
为了解决这个问题,研究人员尝试同时教模型两件事:
- 目的地:“找到有两只鸟的图片。”
- 旅程:“理解如何将一只绿鸟变成两只绿鸟。”
他们试图将这两堂课塞进计算机大脑的同一个狭小部分(称为“文本适配器”)。但这导致了交通堵塞。“寻找目的地”和“学习旅程”的指令将大脑推向相反的方向,使模型感到困惑,并使其在这两项任务上的表现都变得更差。
解决方案:DeCIR(解耦组合图像检索)
作者提出了一种名为DeCIR的新方法。这就像为同一个学生聘请两位专业导师,但让他们分别教授不同的科目,然后再合并他们的笔记。
- “目的地”导师:这位导师专注于完全匹配最终描述(例如,“两只鸟”)。
- “旅程”导师:这位导师专注于变化本身。为了教授这一点,计算机使用一个智能人工智能(大语言模型)来发明自己的练习题。它取一张普通图片和其说明,然后编造一个“正向”指令(如何改变它)和一个“反向”指令(如何撤销该改变)。这教会了模型变化的方向,而不仅仅是结果。
神奇合并(LRDM):
一旦两位导师完成了各自的训练,研究人员就会使用一种称为**低秩方向合并(LRDM)**的特殊技术。
- 想象“目的地”导师有一个结实的背包(主要结构)。
- “旅程”导师有一组带有具体方向说明的便利贴。
- 与其让学生背负两个沉重的背包,不如将“旅程”的笔记贴进“目的地”的背包里。
现在,学生只有一个轻便的背包,既知道要去哪里,也知道如何到达那里,而在实际游戏中不需要两位沉重的导师。
为什么这很重要
- 最终无需重型大语言模型:与其他需要巨型、缓慢的人工智能来思考每个请求的方法不同,DeCIR 将所有繁重的思考工作都在训练阶段完成。当你实际使用时,它既快速又轻量。
- 更好的结果:在时尚、自然和基因图像的测试中,DeCIR 找到正确“已更改”图片的频率远高于以往的方法。它在添加第二只鸟的同时,成功保留了“绿鸟”中的“绿色”。
简而言之:DeCIR 阻止计算机走懒惰的捷径。它通过训练两项独立的技能,然后将它们巧妙地合并为一个高效的工具,教会模型理解改变图像的过程,而不仅仅是结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。