Rethinking Pretraining for Specialized Design Data: Evidence from the JONES-19 Cultural Design Dataset
本文表明,对于像 JONES-19 文化数据集这样的专业设计领域,从头开始使用局部采样策略训练卷积神经网络可以有效地达到与 ImageNet 预训练模型相当的性能,这表明精心策划的、捕捉了特定设计原则的小型数据集可能比依赖大规模通用预训练更为有效。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人如何识别事物。通常情况下,我们会通过向机器人展示数百万张现实世界的照片来教它——猫、汽车、树木和咖啡杯。这就像是给机器人一个庞大的通用知识库,让它学习“视觉常识”。它知道客厅里的“椅子”长什么样,或者“狗”在公园里奔跑的样子。这被称为预训练(pretraining),也是当今构建智能计算机视觉系统的标准方法。但如果你想让机器人学习一些非常特殊且奇特的东西,比如那些看起来不像现实世界物体的古代装饰图案,该怎么办?你仍然需要那个庞大的通用知识库吗?还是说,只要通过向它展示几百个特定事物的例子,就能教会机器人?这个问题处于机器学习(教计算机从数据中学习)与设计(研究人类如何创造艺术与建筑)的交汇点。这之所以重要,是因为如果我们能教会机器人理解专门的设计领域,而不需要依赖数百万张通用的照片,我们就能更快、更准确地揭开历史、艺术和文化的奥秘。
这篇题为《重新思考专门设计数据的预训练》(Rethink Pretraining for Specialized Design Data)的论文,正是利用一个名为 JONES-19 的微型“宝库”数据集来探讨这个问题的。该数据集包含了仅有 1,901 张来自 19 种不同文化的装饰图案图像,这些图像取自一本著名的 1857 年著作《装饰语法》(The Grammar of Ornament)。这些不是现实生活的照片,而是由线条、色彩和几何形状构成的复杂手绘图案。研究人员想要观察:计算机模型是否需要来自数百万张现实世界图像(ImageNet)的“视觉常识”才能理解这些抽象设计,或者只要以正确的方式展示这些图案,它是否仅靠盯着这些装饰品本身就能学得一样好。
为了测试这一点,研究人员利用两种不同类型的 AI 大脑(称为 ResNet-18 和 ResNet-50),设置了一场友好的竞争,对比了两种训练策略。第一种策略是“大图书馆”法:他们采用了一个已经记住了数百万张现实世界图像的模型,并尝试用这些装饰品来教导它。第二种策略是“深潜”法:他们从一个对世界一无所知的空白模型开始,仅针对这 1,901 个装饰品进行训练。然而,他们在“深潜”法中加入了一个巧妙的转折。由于图片很少,他们使用了一种叫做**多尺度裁剪(multi-crop)**的技术。想象一下,将一张图案的照片切割成七个不同的部分,在不同的部分进行缩放,然后将这些碎片当作七张不同的图片展示给机器人。这个技巧有效地将他们那 1,901 张图片的少量集合转化为了大约 13,300 个视角。
结果令人惊讶,并改变了常规的游戏规则。当研究人员使用带有标准训练的“大图书馆”模型时,表现得非常好,准确率达到了约 77% 到 79%。这证实了拥有通用知识确实有所帮助。但剧情反转来了:当他们使用带有多尺度裁剪技巧的“深潜”模型时,它几乎追平了!从头开始训练且使用多尺度裁剪采样的模型达到了约 75% 到 78% 的准确率,这与拥有通用知识起步优势的模型非常接近。事实上,对于较小的 AI 大脑(ResNet-18)来说,“深潜”法的效果几乎与“大图书馆”法不相上下。
论文指出,对于像这些装饰品一样具有高度结构化、抽象化的设计,其“局部”细节比“全局”常识更为重要。这就像是机器人不需要知道“树”是什么样子的就能理解“叶片图案”;它只需要从各种可能的角度和缩放级别去观察那个叶片图案即可。作者发现,虽然“大图书馆”带来的通用知识仍然具有微弱优势(尤其是在较大的 AI 大脑 ResNet-50 上),但这种增益比预期的要小得多。“深潜”法通过更具创造性地观察数据,找回了大部分失去的差距。
然而,论文也谨慎地指出,这并不是解决所有问题的万灵药。即使使用了最好的技巧,模型在面对样本极少的某些文化或外观非常相似的设计(例如不同国家之间借鉴的风格)时仍然会感到吃力。研究人员通过运行 10 次实验来仔细测量这些结果,以确保数字是真实的,而非偶然。他们发现,“深潜”法表明,对于专门的设计领域,我们可能不需要去追求数以十亿计的庞大数据集。相反,通过精心策划规模较小、质量较高的集合,并教 AI 从各个角度观察它们,我们可能会获得更好的结果。论文总结道,对于这些特定的、人类创造的图案,一种专注的、局部的理解可以与广泛的、通用的理解一样强大,这挑战了“我们必须喂给机器人整个世界的照片库才能教它们了解艺术”的观点。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。