Fake & Square: Training Self-Supervised Vision Transformers with Synthetic Data and Synthetic Hard Negatives
本文介绍了 Syn2Co,这是一个通过利用合成数据来增强样本多样性,并利用合成硬负样本来提供挑战性对比,从而增强视觉 Transformer 自监督学习的框架,进而探索通过“造假”来减少对海量真实世界数据集依赖的潜力与局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
无师自通的艺术
想象一下,你正试图教一个机器人识别猫。在过去,你需要一个人盯着成千上万张照片,指着猫说:“这是猫。”这被称为“监督学习”(supervised learning),它效果很好,但速度慢、成本高,且需要大量的人力看护。为了解决这个问题,科学家们发明了“自监督学习”(self-supervised learning)。你可以把它想象成给机器人一堆照片,并对它说:“自己去搞清楚这些图片有什么相似之处或不同之处。”机器人通过比较图片来学习,尝试发现两张同一只狗的照片是“朋友”(正样本),而一张狗的照片和一张烤面包机的照片则是“陌生人”(负样本)。
然而,这里有一个难点。要变得真正厉害,机器人需要一个海量的现实世界照片库,并且需要接受“硬负样本”(hard negatives)的挑战——即那些极其相似但又略有不同的棘手对比,比如金毛寻回犬与拉布拉多犬的区别。如果机器人只看到简单的例子,它就会变得懒惰,无法学习到细微的细节。但如果我们没有足够的真实照片,或者寻找这些棘手的例子太难了怎么办?这就是“伪造”概念介入的地方。如果我们能利用计算机生成假的图片或假的棘手例子来帮助机器人学习,会怎样呢?这就是计算机视觉(computer vision)的游乐场——一个机器尝试观察并理解世界的领域,也是我们即将讲述的故事舞台。
假戏真做:训练 AI 眼睛的新方法
在一篇题为**《Fake & Square: Training Self-Supervised Vision Transformers with Synthetic Data and Synthetic Hard Negatives》**(假作真时:利用合成数据与合成硬负样本训练自监督视觉 Transformer)的论文中,来自伦敦帝国理工学院的研究团队决定测试一个大胆的想法:我们能否通过使用“假”的东西,让 AI 像使用“真”的东西一样看世界?他们的研究方法灵感来源于那句古老的谚语——“假戏真做”(Fake it till you make it)。他们没有等待完美的现实世界数据,而是决定通过合成(或创造)自己的训练材料,来看看是否行得通。
研究人员专注于两种特定的“伪造”方式。首先,他们研究了合成数据(Synthetic Data)。想象一下,你有一本包含 100 种不同动物的照片集。他们并没有去拍摄更多真实的动物照片,而是使用了一种名为“扩散模型”(diffusion model)的特殊计算机程序,为这些动物绘制了 13 万张全新的、虚假的图片。这些不仅仅是模糊的副本,而是看起来与真品无异的全新图像。他们想看看 AI 是否可以通过学习这个“假相册”来识别动物,还是说它仍然需要真实与虚假的混合。
其次,他们解决了硬负样本(Hard Negatives)的问题。在机器人的学习游戏中,“硬负样本”是一个棘手的对比,比如要求机器人分辨两种非常接近的蓝色。通常,在现实生活中寻找这些棘手的配对是很困难的。因此,研究人员发明了一种方法,在机器人的大脑内部(即 AI 存储知识的数学空间中)“伪造”这些棘手的对比。他们提取了 AI 当前的理解,并通过数学手段进行融合,从而创造出全新的、极具挑战性的例子,迫使机器人去分辨。他们将这种结合的方法称为 Syn2Co。
研究发现
团队在两种流行的 AI 大脑设计上测试了他们的“伪造”方法:DeiT-S 和 Swin-T。他们在名为 ImageNet-100 的数据集(包含 100 个图像类别)上进行了实验。
以下是数据告诉我们的信息:
- 混合至关重要: 当他们使用仅由虚假图像训练 AI 时,表现出奇地好,但并不完美。然而,当他们将虚假图像与真实图像混合时,AI 变得更强了。结果表明,合成图像就像一种强大的补充剂;它们能提升学习效果,但目前还不能完全取代对现实世界数据的需求。
- 大脑不同,需求也不同: 这两种 AI 模型对“伪造”的反应不同。DeiT-S 模型非常喜爱“虚假图像”与“虚假棘手对比”的结合,在经过 300 个 epoch(学习周期)的训练后,达到了 82.12% 的顶尖准确率。相比之下,Swin-T 模型似乎更青睐虚假的棘手对比(合成负样本)而非虚假图像。
- “硬”课的教训: 研究人员发现,添加这些合成硬负样本有助于 AI 学习更锐利、更细致的特征。例如,在一次测试中,他们将这些硬负样本的比例从 0% 增加到 40%。随着这些具有挑战性的例子的增加,AI 的性能普遍提高了,这表明这些“虚假”的挣扎实际上让 AI 变得更强大。
结论
这篇论文并不声称虚假数据是一个解决一切问题的魔杖。相反,它表明合成数据是一个极具前景的工具。作者发现,虽然你不能直接扔掉所有的真实照片并 100% 依赖计算机生成的图像,但利用合成数据来“增强”(augment)你的真实数据是非常有效的。它能帮助 AI 学得更快、更稳健,尤其是在难以获取真实数据或当你需要更具挑战性的例子来测试 AI 极限的时候。
简而言之,研究人员证明了在一定程度上,你确实可以“假戏真做”。通过生成合成图像和合成挑战,他们创造了一个有助于 AI 模型更好学习的训练环境,证明了有时,一点人工的帮助可以让学习过程感觉非常真实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。