SynCo: Synthetic Hard Negatives for Contrastive Visual Representation Learning
SynCo 引入了一种通过在表示空间上生成多样化的合成硬负样本,来增强自监督对比视觉表示学习的新型框架,其在 ImageNet 分类和下游检测任务上的表现优于 MoCo-v2 和 MoCHI 等最先进的方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人识别猫。你没有老师指着照片说:“那是猫。”相反,你必须让机器人学会自主学习,科学家称之为“自监督学习”。机器人被给予数百万张未标记的照片和一个简单的规则:“如果两张图片看起来像是来自同一个源头,它们在你的大脑中应该靠得很近。如果它们看起来不同,就把它们推开。”这就是“对比学习”(contrastive learning)的核心,这种方法已成为教计算机视觉的明星技术。
但棘手之处在于:机器人通过“受挫”能学得最好。如果你给它看一张猫的照片和一张烤面包机的照片,区分它们很容易。但如果给它看一只猫和一只长得极其像猫的毛茸茸的狗,机器人就必须非常努力地思考才能分辨差异。这些令人困惑、长相相似的例子被称为“硬负样本”(hard negatives)。问题在于,寻找这些棘手的例子对计算机来说是一项艰苦的工作,而且有时机器人会对那些简单的例子感到厌倦并停止学习。这篇论文提出了一个简单的问题:如果我们能在机器人需要的时候,即时发明出属于我们自己的“难题”呢?
论文的作者,来自伦敦帝国理工学院的 Nikolaos Giakoumoglou 和 Tania Stathaki,引入了一种名为 SynCo(代表 Synthetic Contrastive learning,即合成对比学习)的新方法。把机器人的记忆想象成一个巨大的“非猫”图书馆(负面示例),里面存放着它见过的所有东西。通常,机器人只是从这个图书馆中随机挑选书籍来与新图片进行对比。SynCo 则改变了游戏规则,它扮演着一位创意厨师的角色。它不再仅仅是挑选一本书,而是从图书馆中选取最令人困惑的书籍,并将它们混合在一起,创造出一本全新的、甚至更加令人困惑的“假书”。
他们并不只是随机混合,而是使用了六种不同的“食谱”来创造这些合成的硬负样本:
- 插值法 (Interpolation): 将一张“猫”的照片与一张“令人困惑的狗”的照片进行融合,创造出一个位于两者中间的新奇怪异的混合体。
- 外推法 (Extrapolation): 将上述融合过程进一步向“令人困惑的狗”的方向延伸,从而推向机器人认为“非猫”定义的边界。
- 混合法 (Mixup): 将两只不同的“令人困惑的狗”揉捏在一起,看看机器人是否仍能分辨出它们不是猫。
- 噪声注入 (Noise Injection): 在那张“令人困惑的狗”的照片中加入一些静电或“雪花”噪声,使其看起来模糊不清,增加难度。
- 扰动法 (Perturbation): 微调那张“令人困淆的狗”的照片,使其向更像猫的方向移动一点点,以此测试机器人的极限。
- 对抗法 (Adversarial): 对那张“令人困惑的狗”进行一次非常具体且经过计算的微调,使其看起来尽可能像猫,但实际上又不是猫。
通过向机器人喂养这些定制的、极具挑战性的例子,SynCo 让机器人比以前更快地磨练了感官。论文显示,这种方法效果显著。在著名的 ImageNet 数据集(一个包含 120 万张图像的海量集合)上进行测试时,经过 SynCo 训练的机器人识别物体的能力优于之前的顶尖方法。在 200 轮标准训练后,它的准确率达到了 67.9%,超过了之前的最佳方法 (MoCo-v2) 0.4%,也超过了另一种硬负样本方法 (MoCHI) 1.0%。
神奇之处不仅止于识别图片。作者还检查了这些更聪明的机器人是否能帮助处理更难的任务,比如在杂乱的场景中寻找物体(检测)。在 PASCAL VOC 数据集上,SynCo 达到了 57.2% 的准确率;而在更难的 COCO 数据集上,它将定位边界框的能力提升了 1.0%,将分割物体的能力提升了 0.8%。
研究人员谨慎地指出,虽然这是一个显著的进步,但它并不是解决一切问题的“魔杖”。他们发现,如果你训练时间过长(800 轮),这种优势会缩小,这表明任务的“难度”需要恰到好处——既不能太容易,也不能变得无法完成。他们还指出,虽然他们使用了一个特定的框架 (MoCo) 来进行测试,但这种混合并创造合成挑战的思想可以应用于许多其他的学习方法。
简而言之,SynCo 表明,通过发挥一点创造力并制造我们自己的“困惑”示例,我们可以让计算机更清晰、更快速、更高效地看清世界。这提醒我们,有时为了学习真相,你需要用最好的“伪造品”来进行练习。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。