Unsupervised Training of Vision Transformers with Synthetic Negatives
本文表明,将合成硬负样本集成到自监督学习中,能够显著增强 DeiT-S 和 Swin-T 等视觉 Transformer 架构的判别能力与性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
机器中看不见的老师
想象一下,你正试图教一个机器人识别猫。在过去,你必须向它展示数千张照片,并手动将每一张标注为“是猫”或“不是猫”。这就像是为每一节课都聘请一位人类导师。但最近,科学家们发现了一种让机器人能够自主学习的方法,而无需人类在屏幕前指指点点。这被称为自监督学习(self-supervised learning)。机器人观察一张图片,创建两个略有不同的版本(例如裁剪或改变色彩),然后尝试弄清楚这两个版本实际上是同一个物体。它通过比较“朋友”(相似的图像)与“陌生人”(不同的图像)来进行学习。
然而,这里有一个陷阱。如果“陌生人”太容易辨认——比如在猫的旁边放一张烤面包机的照片——机器人就学不到任何新东西。这就像是一场答案过于简单的测验;你不会因此变得更聪明。为了进行深度学习,机器人需要“困难”的陌生人:那些看起来几乎像猫但其实并不是猫的图像。这就是**视觉 Transformer(Vision Transformers)**发挥作用的地方。这些是计算机的一种新型大脑架构,它们在识别图像模式方面表现得极其出色,有点像我们的眼睛如何在拥挤的房间里聚焦于特定细节。研究人员提出的重大问题是:我们如何通过给它们提供正确类型的“高难度练习”,让这些强大的机器学得更好?
论文的核心思想:制造完美的“伪反派”
这篇题为《使用合成负样本进行视觉 Transformer 的无监督训练》(Unsupervised Training of Vision Transformers with Synthetic Negatives)的论文并没有发明一种全新的构建机器人大脑的方法。相反,来自帝国理工学院的研究人员决定关注一个被所有人忽视的学习过程中的特定部分:即“负样本”(negative examples)。
在机器学习领域,“负样本”仅仅是指一个不是目标对象的例子。如果你正在教模型识别狗,那么一张猫的照片就是一个负样本。通常,计算机只是从一堆其他图像中随机抓取负样本。但作者意识到,这些随机的负样本往往太容易了。这就像是从人群中随机选一个人来与某位名人进行对比;显而易见他们不是同一个人。
作者提出了疑问:如果我们能创造出“合成困难负样本”呢?这些并不是来自摄像机的真实照片。相反,它们是经过数学精心构造的“伪造”示例,恰好处于令人困惑的边缘。它们看起来几乎像目标对象,迫使计算机不得不眯起眼睛,去分辨那些细微的差别。
把这想象成参加一场武术锦标赛。如果你只练习对抗比你弱很多的对手,你永远不会变得强大。但如果你对着一个仅比你稍强一点、或者能完美模仿你动作的搭档进行练习,你的进步速度会快得多。作者的方法被称为 SynBY,它扮演了一个聪明的训练伙伴的角色。它提取计算机正在观察的“陌生人”图像,找到其中最令人困惑的(即“最难”的)负样本,然后将它们混合在一起,创造出一个全新的、极具挑战性的示例。这个新示例随后被反馈回系统中,使学习过程变得更加艰苦且高效。
他们如何测试以及发现了什么
团队使用两种流行的视觉 Transformer 类型——DeiT-S 和 Swin-T 对这一想法进行了测试。他们在包含数百万张图像的海量数据集 ImageNet 上运行了实验。他们将自己的新方法(SynBY)与标准做法(MoBY)进行了对比。
结果令人振奋。当他们使用合成困难负样本时,DeiT-S 和 Swin-T 模型识别图像的能力都有了提升。具体而言,与标准方法相比,模型的准确率提高了 0.2%。虽然这个数字听起来可能很小,但在高水平 AI 领域,这样微小的提升意义重大,因为它意味着模型正在学习更具“判别性”的特征——它们变得更擅长捕捉那些区分猫与狗的微妙细节。
作者还观察了模型的“思考方式”。他们将模型的“注意力”(即计算机关注图像的哪些部分)进行了可视化处理。他们发现,通过使用合成负样本,模型开始关注图像中更具体、更有意义的部分,而不仅仅是整体轮廓。这就像机器人从观察一个模糊的色块并说“那是一个动物”,转变为观察胡须和耳朵并说“那绝对是一只猫”。
他们排除了什么以及仍有哪些未知之处
论文中最有趣的发现之一是作者们不需要做的事情。以往的方法通常需要许多额外的“技巧”来保持学习的稳定性,比如改变计算机处理数据的方式或使用非常特定的设置。作者发现,通过使用合成困难负样本,他们实际上可以舍弃许多这些额外的技巧。这些“伪造”的困难示例本身就足够优秀,足以教会模型,使得系统不需要太多辅助就能保持正轨。这表明合成负样本充当了一种强大的天然调节器,简化了整个过程。
然而,论文也谨慎地避免了过度吹捧结果。作者承认,在某些实验中,他们的详细测试是在较小的图像子集 ImageNet-100 上进行的,并且他们尚未在理解视频或结合图像与文本等更复杂的任务上测试该方法。他们还指出,虽然模型性能有所提升,但仍不如使用人类标签训练的模型(监督学习)。论文认为,这是一个坚实的进步,但它并不是解决一切问题的“万灵药”。
总结
简而言之,这篇论文表明,如果你想让计算机在没有人类帮助的情况下通过图像进行高效学习,你不应该只是向它投喂随机的例子。你应该有目的地给它提供“困难的例子”。通过数学化地创造具有挑战性的“伪造”示例,使其处于困惑的边缘,作者展示了视觉 Transformer 可以学会以更敏锐的焦点观察世界。这是一个简单而有效的改进:让练习变得更难,学生就会变得更聪明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。