Harnessing Self-Supervised Features for Art Classification
本文表明,自监督骨干网络,尤其是 DINO 和 CLIP 模型,在艺术品分类与检索方面始终优于监督式方法,为虚拟现实博物馆导航等现实应用提供了宝贵见解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你走进一座巨大的艺术博物馆。你看到成千上万幅画作,却不知道哪些是“印象派”,哪些是“巴洛克”,或者哪些仅仅是“风景画”。传统上,教计算机对这些画作进行分类,就像试图通过向孩子展示一百万张背面写有答案的闪卡来教他们识别艺术。计算机记住了答案,但它并没有真正理解艺术。如果它看到一幅从未见过的画作,它就会感到困惑。
本文介绍了一种更聪明的方法,让计算机在不需要那些闪卡的情况下理解艺术。
问题:艺术是抽象的
艺术不像把苹果和橙子分开那样简单。你不能仅仅寻找特定的形状或颜色。“风格”(如立体主义)和“流派”(如肖像画)是抽象的概念。它们依赖于微妙的细节、笔触以及画作的“氛围”。由于这些标签如此主观,标准的计算机训练往往会失败,或者陷入死记硬背具体示例的困境,而无法学习艺术的普遍规律。
解决方案:“艺术侦探”与“艺术学生”
研究人员比较了两种训练人工智能的方法:
- 艺术学生(监督学习): 这是旧方法。你向人工智能展示一幅画,并说:“这是一幅文艺复兴时期的肖像画。”你重复成千上万次,直到人工智能记住了这种模式。本文使用了一种名为EfficientNet的模型进行此操作。它是个勤奋的工人,但需要大量的具体作业。
- 艺术侦探(自监督学习): 这是新的、令人兴奋的方法。与其给人工智能带有答案的闪卡,不如让它观看数百万张图像,并自行找出模式。它在没有被告知具体艺术史标签的情况下,学会了“视觉结构”是什么样子的。本文测试了两位著名的“侦探”:DINO和CLIP。
使用侦探的三种方式
一旦人工智能(侦探)学会了识别模式,研究人员就尝试了三种不同的方法来利用它对画作进行分类:
- “猜测提示”方法(零样本): 想象人工智能有一张写有艺术风格的卡片列表(例如,“一幅立体主义风格的画作”)。你向它展示一幅新画,人工智能会问:“哪张卡片的描述与这幅画最匹配?”它没有学习任何新东西;它只是根据已有的知识进行猜测。
- 结果: 这是最弱的方法。人工智能难以将文本描述与复杂的视觉艺术相匹配。
- “寻找相似”方法(KNN): 想象你有一本巨大的相册,里面装着你已经看过的画作。你向人工智能展示一幅新画,它会说:“这看起来完全像我相册中标记为‘巴洛克’的那 5 幅画。”它会找到最接近的匹配项。
- 结果: 这出乎意料地好!即使没有做额外的作业,人工智能对画作的分类能力几乎与勤奋的“艺术学生”一样好。
- “简单翻译器”方法(线性分类): 这是获胜者。人工智能(侦探)观察画作,并为其创建一个复杂的“指纹”。然后,一个非常简单的微小代码层充当翻译器,将该指纹转换为“印象派”之类的标签。
- 结果: 这击败了其他所有方法。结合了简单翻译器的“艺术侦探”在艺术分类方面优于死记硬背成千上万张闪卡的“艺术学生”。
他们的发现
最大的惊喜是CLIP模型(侦探)在理解艺术方面表现最佳。
- 优于基线: 当与简单翻译器配对时,CLIP 模型对画作的分类准确度高于传统的、经过大量训练的模型。
- 视觉胜过文字: 研究人员发现,对于艺术而言,眼见为实。人工智能不需要阅读文本描述来理解风格;它只需要观察视觉模式。
- 无需额外训练: “寻找相似”方法表明,人工智能已经掌握了如此多的艺术知识,以至于它只需通过寻找相似画作即可对新画作进行分类,而无需重新训练。
现实世界的应用
本文指出,这项技术非常适合虚拟现实(VR)和增强现实(AR)博物馆导览。想象一下在博物馆戴上 VR 眼镜。系统可以立即识别你正在观看的画作,告诉你其风格和流派,然后向你展示附近的其他相似画作,而无需人类先手动标记数据库中的每一件艺术品。
简而言之:本文证明,如果你赋予人工智能一种广泛的、自我习得的关于世界外观的理解,它就会成为一个比被迫死记硬背具体艺术史事实的艺术评论家更出色的存在。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。