SeCo-SBIR: Semantically Consistent Prompt Learning for Zero-Shot Sketch-Based Image Retrieval
SeCo-SBIR 是一个语义一致性的提示学习框架,它通过将文本引导的语义知识注入视觉编码器,并利用基于扰动的约束强制其与冻结的 CLIP 参考保持一致,从而解决了草图检索中领域自适应与零样本泛化之间的张力,并在多个基准测试中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个超级聪明的机器人如何识别事物,但带有一个转折:你只能给它看真实动物的照片,却希望它能理解人类的绘画。这就是**零样本草图检索(Zero-Shot Sketch-Based Image Retrieval)**的世界。这是人工智能的一个分支,其中的计算机必须能够将一个粗略的、涂鸦式的草图(比如一个火柴人形状的狗)与一张高清晰度的真实狗的照片进行匹配,即使它从未见过这种特定类型的狗。
为了理解这个挑战,请把机器人的大脑想象成有两个主要的“感官”:一个是视觉(照片),另一个是阅读(文本)。一个名为 CLIP 的强大工具已经教会了这个机器人理解“狗”这个词和一张狗的照片是相关的。然而,当你让机器人看一张凌乱的黑白草图时,它会感到困惑。草图与照片差异太大。通常的解决方法是“微调”机器人,教它新技能来弥补这一差距。但问题在于:如果你在训练过程中过度教导它关于你展示的那些特定品种的狗,它就会陷入僵局。它会变得如此痴迷于训练样本,以至于忘记了如何识别它尚未见过的“新类型”的狗。这就像一个学生完美地背下了练习题的答案,结果在真正的考试中失败了,因为题目稍有变化。
这正是邮电大学(Posts and Telecommunications Institute of Technology)的研究人员试图解决的问题。他们引入了一种名为 SeCo-SBIR 的新方法,它既像是一个聪明的翻译官,又像是一个严格的老师。他们并没有仅仅强迫机器人去死记硬背草图,而是发现了一种利用机器人现有的语言知识来引导其视觉的方法。同时,他们还增加了一个安全网,以确保机器人不会对自己的新技巧过于自信,从而忘记其原有的、通用的知识。
两部分神奇的魔术技巧
该论文提出了一个框架,通过两个主要概念来解决机器人的困惑,作者称之为“文本引导的提示(text-guided prompting)”和“一致性约束(consistency constraints)”。
1. 语言翻译官(文本引导的提示)
想象一下,机器人有一个关于动物的图书库。当它看到一张照片时,它通常只是观察图像。但在 SeCo-SBIR 中,研究人员告诉机器人:“在你看草图之前,先在你的图书库里读一读‘狗’这个词。”
从技术角度来看,机器人使用其文本编码器(理解文字的部分)来处理一个提示。机器人不再是从头学习新的视觉模式,而是从文本侧提取“狗”这个词的含义,并将其逐层传递到视觉侧。这就像一位导游(文本)在摄影师(视觉编码器)拍摄照片之前,向其低声讲述该地标的历史。因为导游通过阅读数百万本书籍已经了解了“狗”的一般概念,所以摄影师不需要记住他们见过的每一只狗。他们只需要理解“狗”这个概念即可。这有助于机器人识别它从未见过的某种新犬种的草图,因为“导游”知道狗大致长什么样,无论具体的照片是什么。
2. 严格的老师(一致性约束)
现在,想象机器人正在学习这些新技巧。存在一种风险,即它可能会变得过于兴奋,并开始产生幻觉,认为每种四条腿的动物都是“金毛寻回犬”,仅仅是因为它在训练期间见过最多的就是这种狗。为了阻止这种情况,研究人员增加了一位“严格的老师”。
这位老师的工作方式是向机器人展示同一张照片的两个版本:一个是经过轻微处理的(增强后的),一个是干净的。机器人的“冻结”大脑(原始的、未经训练的版本)观察被处理过的照片,而“学习中”的大脑观察干净的照片。老师要求这两个大脑对物体是什么达成共识,即使它们看到的版本不同。如果学习中的大脑开始偏离轨道,仅仅因为在训练中见过一只猫就说:“这是一只猫!”,老师会说:“不,看看原始的大脑,它仍然认为这是一只狗。你需要保持一致。”这让机器人保持在原始的、通用的知识范围内,防止它过度拟合特定的训练数据。
他们的发现
研究人员在三个作为该领域标准的“考试”(数据集)上测试了这一新系统:Sketchy-Ext、TU-Berlin-Ext 和 QuickDraw-Ext。这些测试涉及跨不同类别匹配草图与照片,其中包含了一些机器人从未见过的类别。
结果非常令人印象深刻。在以类别相似度高而著称、难度极大的 TU-Berlin-Ext 测试中,SeCo-SBR 比之前的最佳方法提高了 5.6% 的准确率。在“跨数据集”测试中(即机器人在一组绘图中接受训练,并在完全不同的另一组绘图中进行测试),它将准确率提高了 6.8%。
论文指出,这种方法之所以奏效,是因为它平衡了两个对立的需求:它让机器人能够适应杂乱的草图世界,同时又保持了机器人的通用知识,使其不会忘记如何处理新类别。作者发现,他们系统的每一个部分——语言翻译官、严格的老师以及他们用于结合这些想法的具体数学方法——都为成功做出了贡献。当移除任何一个部分时,机器人的表现都会下降。
简而言之,SeCo-SBIR 表明,通过使用语言来引导视觉,并添加一个“现实检查”来防止过度学习,我们可以构建出能够更好地通过粗略草图来识别世界的 AI,即使它是在第一次见到这些物体。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。