想象一下你是一名正在试图教机器人识别不同音乐流派的侦探。你给机器人展示了数千首歌曲,并要求它将它们分类为“爵士乐”、“摇滚乐”或“古典乐”。如果机器人变得非常擅长这项任务,你可能会想:“哇,它真的理解了爵士乐的‘声音’!”但问题在于:如果机器人其实并没有在听萨克斯风或鼓点呢?如果它只是记住了“这个特定的歌手总是唱爵士乐”呢?如果你只用机器人已经听过的同一歌手的歌曲来测试它,它看起来会像个天才。但如果你给它一位它从未见过的全新歌手,它可能会表现得一败涂涂。这正是科学家在尝试教计算机识别艺术风格时面临的准确问题。他们使用强大的 AI 模型(称为“冻结视觉嵌入”),这些模型已经在互联网上看过数百万张图像。这些模型擅长发现模式,但研究人员想知道:它们是真的理解了绘画的“风格”,还是仅仅通过识别那位画作的“著名艺术家”来走捷径?
这篇题为《风格还是签名?》(Style or Signature?)的论文深入探讨了这个谜团。作者选取了一个流行的 AI 模型(CLIP)和一个包含四个著名 20 世纪艺术运动(印象派、立体主义、抽象表现主义和超现实主义)共 320 幅画作的集合。在测试这些模型的标准方式中,研究人员会将所有画作随机混合。这意味着,一幅由萨尔瓦多·达利创作的测试画作可能会被拿来与其他模型已经见过的达利画作进行比较。作者认为这是一个糟糕的测试,因为模型可能只是在说:“我认识这个人,他是超现实主义者”,而不是理解了什么是使超现实主义独特的特质。因此,他们发明了一种更严格的测试,称为“艺术家不相交评估”(artist-disjoint evaluation)。想象一个游戏,你必须猜出一种音乐流派,但规则禁止你听任何由同一位歌手演唱的其他歌曲。你必须纯粹根据音乐本身来进行判断。
当作者运行这项更严格的测试时,结果令人震惊。模型的整体准确率下降了,但下降得并不均匀。对于印象派和立体主义,模型几乎没有踉跄;即使在没有两次看到同一个艺术家的情况下,它仍然能够分辨出这些风格。这表明这些运动拥有强大的、共享的视觉“指纹”,而 AI 确实学习到了这一点。然而,超现实主义却彻底崩溃了。模型的超现实主义准确率大幅下降了 20 个百分点,从高分跌落到了几乎是随机猜测的水平。作者发现,对于超现实主义,模型并没有真正学习风格;它只是记住了像达利这样著名的特定画家。当这些画家被从测试中移除时,模型完全不知道超现实主义看起来是什么样的。他们用四种不同的 AI 模型(包括一个只“看”图像而不阅读文本的模型)进行了测试,结果也是一样的:模型在超现实主义上依赖的是艺术家的签名,而非艺术风格。该论文得出结论:要真正了解 AI 是否理解艺术,我们必须停止让它通过识别艺术家来走捷径,而是开始测试它从未见过的风格。