Breaking Spurious Correlations via Generative Randomization and Cross-Variant Self-Supervised Learning
本文提出了一种名为 GRSSL 的两阶段框架,该框架结合了通过生成式干预来创建上下文偏移的对象变体,以及通过跨变体自监督学习来显式训练背景不变表示,从而在多个基准测试上实现了针对分布偏移的最先进鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一个孩子识别不同类型的鸟类。你向他们展示了水鸟(比如鸭子)和陆鸟(比如麻雀)的照片。
在普通的课堂上,老师可能会不小心犯一个错误:他们只在水面上展示鸭子,在草地上展示麻雀。这个孩子虽然非常聪明但也很“偷懒”,他很快学会了一个捷径:“如果我看到水,那就是鸭子。如果我看到草,那就是麻雀。” 他不再观察鸟类的羽毛或喙,而是停止了对这些特征的观察。
这正是许多 AI 模型发生的情况。它们学习到了伪相关(spurious correlations)——通过观察背景而非主体对象来“作弊”。当稍后你给 AI 展示一只在草地上的鸭子时,AI 会感到困惑并失败,因为它依赖的是水,而不是鸭子本身。
这篇论文提出了一种巧妙的两步走方案,来解决这种“作弊”行为。
第一步:“神奇背景变换器”(生成式随机化)
首先,研究人员使用一种特殊的 AI 工具(扩散模型)来充当数字照片编辑器。
- 他们拍摄一张鸟的照片。
- 他们使用一种“零样本分割”(zero-shot segmentation)工具(可以把它想象成一把超级精准的剪刀),在不伤害鸟的前提下将其从照片中剪切出来。
- 然后,他们利用 AI 在鸟的背后绘制一个完全不同的新背景。他们可能会把湖泊变成森林,或者把沙漠变成雪山,同时保持鸟本身完全不变。
通过这种方式,他们在完全不同的世界里为同一只鸟创造了许多“变体”。
第二步:“同一只鸟,不同的世界”游戏(跨变体自监督学习)
这就是见证奇迹的时刻。通常,当 AI 进行学习时,它只是将这些新图片视为额外的课后作业。但本论文提出:“不,让我们让 AI 玩一个游戏。”
他们告诉 AI:“看这只在湖面上的鸭子,再看这只在山上的‘同一只’鸭子。尽管背景完全不同,但它们是同一只鸟。你的任务是忽略背景,只关注这只鸟。”
他们强迫 AI 学习到,即使场景发生了变化,物体的*身份(identity)*依然保持不变。这被称为跨变体自监督学习(Cross-Variant Self-Supervised Learning)。这就像是在训练一名侦探,无论嫌疑人是戴着帽子、戴着面具,还是站在不同的城市,都要能认出其面容。
最后的润色(微调)
一旦 AI 通过这个“游戏”学会了如何忽略背景,研究人员会进行最后一轮训练,以确保它为现实世界做好准备。他们使用了一种叫做 GroupDRO 的技术,它就像一位严厉的教练,会说:“我不在乎你是否答对了 99% 的简单问题;我更在乎你是否也能答对那些最难、最罕见的题目。”
实验结果
论文在三个 AI 通常会因为背景陷阱而失败的困难挑战中测试了该方法:
- 水鸟(Waterbirds): 区分水面上与陆地上的鸟类。
- MetaShift: 一个关于环境变化的通用测试。
- NICO++: 另一个复杂的环境测试。
结果:
通过使用这个“神奇背景变换器”和“同一只鸟”游戏,AI 在无论将物体放置在何处时,识别物体的能力都变得更强了。
- 在水鸟测试中,它在最难的案例中达到了 92.5% 的正确率(相比之下,标准方法的得分要低得多)。
- 它同时也保持了在“简单”案例中的高分,证明它并没有丢失通用的知识。
总结
这篇论文认为,仅仅向数据集中添加更多图片是不够的。相反,你需要通过在许多人工创造的不同世界中展示同一个物体,来主动教会 AI 忽略背景。通过强迫 AI 专注于物体本身而非场景,它停止了“作弊”,并在现实世界发生变化时变得更加可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。