Detecting Cross-Medium Stylistic Signals in Sketches and Paintings with Pretrained Visual Encoders
这项研究表明,像 CLIP 和 SigLIP 这样的预训练视觉编码器在检测素描与绘画中持久的风格信号方面比手工设计的描述符更有效,但它们在面对视觉相似的负样本时表现出的脆弱性表明,与其作为可靠的鉴别机制,它们更适合作为分析人工智能对艺术风格感知的工具。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图弄清楚两幅不同的画作是否出自同一人之手。一幅是铅笔勾勒的粗略、快速的素描,另一幅则是完成度极高的彩色油画。通常情况下,它们看起来完全不同。素描只有骨架;而油画则充满了纹理和色彩。
这篇论文提出了一个简单的问题:即便这两件作品看起来如此迥异,计算机能否在粗略的素描和完成的油画中,“看见”同一种艺术指纹?
以下是研究人员如何开展这项工作的,我们使用了一些有趣的类比:
“味觉测试”实验
研究人员收集了来自 10 位著名历史艺术家(如达芬奇和拉斐尔)的 666 件艺术品“品鉴菜单”。对于每位艺术家,他们都同时拥有其素描和完成的油画。
他们想看看计算机能否扮演一名侦探。他们会给计算机展示一张素稿和一幅油画,并问道:“这两件作品是同一个人创作的吗?”
三种类型的侦探
为了破解这个谜团,研究人员测试了三种不同类型的“侦探”(计算机模型):
- “大局观”侦探 (CLIP 和 SigLIP): 这些是强大的 AI 模型,经过了数百万张图像和文本描述的训练。它们就像是见多识广的侦探,几乎见过世界上的一切。它们不仅观察颜色,还能理解图像的“氛围”或“风格”。
- “纯视觉”侦探 (DINOv2): 这个模型只看图像,从不阅读文字。它就像是一个对文字盲目但对形状和模式有着极其敏锐观察力的侦探。
- “规则手册”侦探 (手工特征描述符): 这是较旧的传统方法,由人类编写特定的规则让计算机遵循,例如“计算线条数量”、“测量阴影”或“检查纹理”。这就像是给侦探一份死板的清单,让他们去寻找特定的特征。
结果:谁破解了真相?
获胜者:
“大局观”侦探(CLIP 和 SigLIP)的表现出奇地好。它们能正确猜出素描和油画出自同一位艺术家,准确率达到了 76% 到 77%。甚至连“纯视觉”侦探(DINOv2)也比随机猜测要好,准确率约为 61%。
失败者:
“规则手册”侦探彻底失败了。它们无法在素描和油画之间找到任何联系,表现得并不比随机猜测更好。这表明,连接这两者的“指纹”并非简单的线条计数或阴影形状,而是某种更复杂、更抽象的东西,而先进的 AI 模型直觉性地捕捉到了这一点。
“陷阱”测试(现实检验)
这是故事中最关键的部分。研究人员随后让测试变得更加困难。他们向计算机展示了一张素描和一幅完成的油画,这两者在视觉上非常相似,但却是由不同的艺术家创作的。
突然间,“大局观”侦探们也感到困惑了。它们的准确率骤降至随机猜测的水平(甚至更糟)。
这意味着什么?
想象一下你在辨认朋友的笔迹。你会通过快速写的购物清单(素描)和正式信件(油画)来识别朋友的笔迹,因为你了解他们的整体风格。但如果有人给你看一封由笔迹非常相似的人写的信,你可能会被误导。
研究发现,AI 可以捕捉到一种“风格信号”,但这种信号是脆弱的。当差异明显时,它很有效;但当视觉线索变得棘手时,它就会失效。
总结
论文得出结论,虽然这些 AI 模型可以检测出从素描到完成油画中传递的隐藏“风格信号”,但它们还不足以胜任艺术品鉴定师的工作。
你不应该使用这项技术来断言:“是的,这绝对是达芬奇的作品!”因为 AI 很容易被欺骗。相反,这项研究的价值在于理解 AI 是如何看待艺术的。它表明,AI 已经学会了识别关于艺术家风格的深层本质,而人类尚未找到如何用简单的规则来衡量这种本质的方法;但它同时也警告我们,这种 AI 的“直觉”并不完美,也不足以用于像证明大师杰作归属这样高风险的决策。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。