← 最新论文
💻 computer science

Learning visual representations for compositional analysis of artworks and photographs

本文将一种基于知觉分组的、受人类启发且具有可解释性的方法,与用于组合分析的微调基础模型进行了比较,结果发现,虽然后者在数据充足时表现出更优越的性能,但前者在编码器冻结时,能以更强的可解释性和泛化能力提供具有竞争力的结果。

原作者: Fatemeh Behrad, Tinne Tuytelaars, Johan Wagemans

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Fatemeh Behrad, Tinne Tuytelaars, Johan Wagemans

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在看一幅画或一张照片。你的大脑并不仅仅看到一堵平面的色彩墙;它会瞬间将场景组织成一个故事。它将事物组合在一起,注意到一个人是如何站在一棵树旁边的,并感受到一种平衡感或张力。这种视觉中的“叙事”部分被称为构图(composition)。它是让图像显得美丽、戏剧化或恰到好处的“秘密配方”。长期以来,计算机在理解这一点方面表现得很糟糕。它们擅长识别图像中有什么(一只狗、一辆车、一场日落),但很难理解这些事物是如何排列以创造意义的。这篇论文深入探讨了这一差距,提出了一个宏大的问题:要教会计算机像艺术家一样去“看”,我们是需要构建一个像人类一样思考的大脑,还是只需给一台超级聪明的计算机喂入足够的例子,让它自己悟出其中的规律?

研究人员,来自比利时鲁汶大学(KU Leuven)的 Fatemeh Behrad、Tinne Tuytelaars 和 Johan Wagemans,致力于测试两种截然不同的教学方式。把这想象成教学生解谜题。

两种方法

第一种方法是“人类风格”法。这种方法不再将图像视为一团模糊的像素,而是尝试将图像分解为不同的、有意义的块——就像将照片中的天空、山脉和人分开一样。它使用一种称为**以物体为中心学习(Object-Centric Learning)的特殊技术来自动寻找这些块——就像一个智能分类器,会说:“这个色块是一个人,那个色块是一艘船。”然后,它使用图注意力网络(Graph Attention Network)在这些块之间绘制隐形的线条,分析它们如何相互关联。这就像一名侦探在观察犯罪现场,注意到枪就在受害者附近*,而窗户在桌子*上方。这种方法旨在实现透明化;我们可以清楚地看到计算机正在观察图像的哪些部分,以及它是如何连接它们的。

第二种方法是“大数据”法。这种方法使用已经看过数百万张图像的海量预训练 AI 模型(称为基础模型)。研究人员只需将这些“巨头”在特定的照片和绘画数据集上进行“微调(fine-tune)”,希望通过大量的练习,让计算机能够自行领悟构图的规则。这就像把一名学生扔进一座藏有所有艺术史书籍的图书馆,并告诉他们“自己去悟吧”。这种方法很强大,但它也是一个“黑盒”——我们并不真正了解计算机是如何做出决策的,而且它可能更多是在依赖识别图像中的物体,而不是理解它们的排列方式。

他们的发现

团队在两个大挑战上测试了这两种方法:预测照片的“风格”(如“居中”或“对角线”)以及为图像的构图质量评分。他们还检查了计算机是否能找到图像中最重要的部分(显著性/saliency),以及能否基于布局找到相似的图像。

转折点在于:这取决于你拥有多少数据。

当研究人员保持大型 AI 模型冻结状态(不让它们学习新知识)并仅使用“人类风格”法时,它的表现出奇地好。它能够对物体进行分组并理解它们之间的关系,甚至在很多时候击败了那些被冻结的大型模型。最棒的是,它非常易于理解其决策背后的原因。你完全可以看到它构建的连接“图谱”。

然而,当他们拥有足够的数据来对大型基础模型进行充分的“微调”时,那些“巨头”占据了领先地位。它们在预测评分和类别方面变得显著更好。但有一个问题:这些大模型缺乏可解释性(难以理解),并且在切换不同类型的图像(例如从照片切换到绘画)时表现得更为吃力。它们似乎过度依赖于识别物体(例如,“这是一只猫”),而不是理解排列(例如,“这只猫呈三角形坐着”)。

结论

论文指出,如果你拥有海量的标注数据并且只想要最高的得分,那么“大数据”法胜出。但如果你需要一个高效、能跨越不同艺术类型(从照片到绘画)工作、并且能真正解释为什么它认为一张图像构图良好的系统,那么“人类风格”法则是赢家。

有趣的是,研究人员发现“人类风格”法在捕捉图像中最重要部分方面表现出色。通过观察其图谱中的连接,它可以说:“这个人是最重要的部分,因为他与所有其他元素都相连”,这与人类眼睛实际注视的位置高度吻合。相比之下,虽然大模型功能强大,但在这一方面显得有些晦暗不明。

最终,这篇论文并没有宣布哪一方是绝对的赢家。相反,它表明虽然大型 AI 模型在喂入足够数据时极其强大,但构建一个模仿人类自然分组和关联视觉元素的系统的价值依然独特。这提醒我们,有时为了理解艺术,你需要理解艺术家的观察方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →