From Fake to Real: Pretraining on Balanced Synthetic Images to Prevent Spurious Correlations in Image Recognition
该论文提出了“从假到真”(From Fake to Real, FFR),一种两阶段训练流水线,通过在平衡的合成数据上进行预训练以学习鲁棒的子组表示,随后在真实数据上进行微调,从而防止由混合真实与合成分布所导致的伪相关,并显著提高最差组准确率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一个机器人识别动物。你向它展示了数千张照片,但出现了一个狡猾的问题:几乎每一张“大狗”的照片都是在温馨的客厅里拍摄的,而几乎每一张“小狗”的照片都是在公园户外拍摄的。这个机器人很聪明,但它也有点“投机取巧”。它并没有学习狗到底长什么样,而是学会了一个捷径:“如果我看到沙发,那就是大狗;如果我看到草地,那就是小狗。”在计算机科学领域,这被称为“伪相关”(spurious correlation)。机器人学会了依赖背景而不是主体。这是一个大问题,因为当机器人户外遇到一只大狗时,它会感到困惑并失败。科学家们正试图修复这个问题,以便人工智能能够清晰地观察世界,而不仅仅是依赖它被误导看到的模式。
为了解决这个问题,研究人员尝试了一个聪明的技巧:他们使用“生成式人工智能”(像是一个数字艺术家)来创造新的、虚假的图片以平衡数据。如果缺乏大狗在户外的照片,电脑就会画一些。其想法是通过将这些新的虚假照片与真实照片混合在一起,让机器人最终学会忽略背景。但事实证明,这种“混搭”的方法存在一个隐藏的缺陷。新的论文《从假到真》(From Fake to Real)指出,仅仅将真实和虚假的照片混合在一起实际上创造了一种新的依赖。机器人开始注意到虚假照片看起来与真实照片略有不同——也许虚假的狗纹理很奇怪,或者光影效果有一点点偏差。于是,机器人学会了一个更隐蔽、更狡猾的捷径:“如果照片看起来像真实的,它就是小狗;如果照片看起来像画出来的,它就是大狗。”它根本不是在看狗,而是在看图像是真实的还是合成的。
这篇论文的作者 Maan Qraitem、Kate Saenko 和 Bryan A. Plummer 意识到,试图同时用真实和虚假的照片来教机器人才是问题的所在。他们提出了一种新的两步训练方法,称为“从假到真”(FFR)。把这想象成在教学生准备数学考试。首先,你给他们一叠平衡且易于理解的练习题,这样他们就能在没有困惑的情况下学习核心概念。这就是“假”阶段:机器人仅在完美平衡的、由计算机生成的图像上进行训练。它学习狗的样子,而不受杂乱背景的干扰。一旦机器人有了坚实的基础,你就进入第二步:“真”阶段。现在,你向它展示那些混乱的、现实世界的照片。因为机器人在第一步中已经知道该寻找什么,所以它不会被背景或图像是否真实所迷惑。它只是应用它所学到的知识。
研究人员在三个不同的数据集上测试了这个想法,包括人脸和动物的照片,偏见程度从中度到极度严重(高达 99.9% 的某一类群体处于特定环境中)。他们发现,这种两步法是一个游戏规则的改变者。虽然以前那种将真实和虚假数据混合在一起的方法在偏见加剧时表现挣扎,但“从假到真”的方法依然保持强劲。事实上,与现有的最佳方法相比,该方法在处理最难的情况(“最差组”)时,准确率提高了多达 20%。当他们仔细观察机器人实际在关注什么时,他们发现旧的方法仍然会被背景或图像的“虚假感”所干扰,而新方法则精准地聚焦在狗或人的脸上。
论文还进行了模拟实验,以证明为什么旧的方法行不通。他们展示了只要混合使用真实和合成数据,机器人几乎总能找到利用两者之间的差异作为区分特征的方法。通过将训练分为两个截然不同的阶段,他们有效地阻止了机器人将“真实”与“虚假”之间的差异作为线索。作者指出,这种方法即使与其他技术结合使用也效果良好,但他们也指出了一个局限性:它依赖于“电脑艺术家”能够画出一套完美平衡的虚假图像。如果艺术家在第一步中把平衡搞错了,整个系统都会受到影响。然而,目前来看,这种“先假后真”的策略提供了一种极其简单且有效的方法,可以阻止人工智能学习错误的教训,确保当它看向一只狗时,它看到的是狗,而不是它所处的房间。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。