← 最新论文
💻 computer science

Visual Distances among Cultural Art Corpora Align with Expert-Coded Historical-Artistic Relatedness

本研究表明,源自大型视觉模型的视觉距离与跨越不同文化单元和时代的专家编码的历史艺术相关性显著相关,这表明互联网规模的视觉训练语料库本身就编码了反映艺术史关系的统计规律。

原作者: Qiurui Wang, Weiqiang Ying, Ziyu Xu, Yousheng Yao, Shirui Wen, Guoying Wu, Cheng Yao, Fangtian Ying, Guanghui Huang

发布于 2026-09-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Qiurui Wang, Weiqiang Ying, Ziyu Xu, Yousheng Yao, Shirui Wen, Guoying Wu, Cheng Yao, Fangtian Ying, Guanghui Huang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,艺术史一直依赖于学者训练有素的眼光,来追踪跨越时空、连接不同文化的无形纽带。专家们花费数个世纪来记录一种衣褶风格是如何从希腊传播到印度的,或者金字塔的概念是如何在埃及和美洲独立出现的。这些联系并不总是显而易见的;它们往往隐藏在数千年的变迁之下,掩藏在装饰、形状和材质的细微细节之中。对于人类而言,识别这些深层的历史联系需要长年的学习以及对大量文献档案的接触。但如果一台机器,在接受了整个互联网视觉历史的训练后,能够在从未读过任何历史书籍的情况下,也能看到这些相同的联系呢?这个问题处于人工智能与文化研究的交汇点,它在追问:计算机视觉系统中隐藏的数学模式,是否在无意中镜像了人类专家理解艺术演进的方式。

一个研究团队致力于在全球范围内测试这一设想,他们不再局限于通常关注的西方艺术,而是将范围扩大到了涵盖五个大洲、跨越五千年的传统。他们收集了一个庞大的图像集,代表了53个不同的文化单元,从古代地中海到原住民大洋洲谱系不等。为了建立一个可靠的比较标准,他们招募了十位盲测专家——包括艺术史、考古学和博物馆研究领域的专家——来评定这些文化群体之间每一对可能的关联程度。专家们寻找的并非简单的视觉相似性(例如两幅画作都使用了蓝色),而是被要求根据已证实的文化接触和共享的视觉传统,来判断历史上的相关性。其结果是一张人类判断的详细地图,即关于哪些文化在历史上存在联系、哪些不存在联系的共识,涵盖了一千三百多个对比对。

随后,研究人员转向了六种不同的视觉大模型,即当今驱动图像识别和生成工具的那类人工智能系统。这些模型在来自互联网的数十亿张图像上进行了训练,学习如何将视觉信息压缩到数学空间中,使得相似的图像彼此靠近,而不同的图像彼此远离。团队测量了这些文化群体在这些数字空间中的距离。如果机器对艺术史一无所知,那么这些群体之间的距离将会是随机的;如果它们学会了模仿人类专家,那么专家认为在历史上相关的群体,在机器的认知中应该比不相关的群体更接近。

研究结果揭示了一种惊人的契合。在测试的所有六种不同类型的人工智能模型中,文化群体之间的数学距离始终与人类专家的判断相匹配。当专家说两种传统在历史上有关联时,模型也会将它们放置得更近;当专家说它们不相关时,模型则将它们放置得更远。即使研究人员控制了地理因素,确保这种联系不仅仅是因为两个文化恰好居住在邻近地区,这一模式依然成立。这种信号非常强烈,甚至可以检测到相隔遥远的文化之间的联系,例如古希腊传统与犍陀罗佛教艺术——这是一个跨越数千公里的跨文化影响的经典案例。

这项研究并未声称这些机器拥有对历史的自觉理解,也并非认为它们可以取代人类学者。研究人员谨慎地指出,模型发现的模式很可能反映了其训练数据中所存在的统计规律性,而这些数据本身正是由几个世纪以来博物馆和档案馆收集及分类艺术品的方式所塑造的。模型并非在课堂上学习艺术史,它们学习的是文化接触的视觉指纹,因为这些指纹已经嵌入在它们所消费的数据之中。然而,六种不同的架构在以不同目标进行训练后,最终都得出了相同的结论,这一事实表明,文化传播的视觉证据是稳健且可检测的。这表明,尽管存在偏差和缺失,但互联网规模的视觉记录包含着一个连贯的结构,能够镜像出由数世纪人类学术研究所记录的关系。

为了确保结果不是特定图像选择所导致的产物,团队还邀请了来自12个国家的4500名普通参与者进行了一项感知检查。他们要求这些没有艺术史背景的普通人去区分广泛的视觉风格类别。参与者能够分辨出这些类别,从而证实研究中所使用的视觉差异是真实存在且能被人眼感知的。这增加了一层验证,表明机器发现的模式不仅是数学上的奇特现象,而且对应着现实世界中清晰可辨的视觉特征。

研究还强调了数据本身的局限性。这53个文化单元的定义方式反映了艺术史作为一门学科所面临的不均衡历史:欧洲传统被细分为许多精细的类别,而其他地区(如非洲和美洲的部分地区)则被归入较宽泛、缺乏细节的单元。研究人员承认,数据中的这种结构性偏差很可能影响了结果,并呼吁未来的工作应引入原住民和非西方合作者,以创建更公平的框架。尽管如此,核心发现依然保持稳定:这些强大的人工智能系统所计算出的视觉距离,与专家编码的历史相关性高度一致。

这项工作为审视全球艺术史提供了一种全新的视角。它表明,当现代人工智能处理互联网上那庞大且杂乱的图像集合时,可以揭示出人类专家花费数世纪才发现的那些深层结构性联系。它并不取代对人类解释或对历史文献细致研究的需求,但它提供了一个强大的工具,用于观察那些通过手工绘图难以完成的大尺度模式。该研究证实,人类文化的视觉语言——伴随着所有的迁徙、交流和独立发明——留下了一种统计学上的签名,即使是训练于互联网的机器也能学会解读这种签名。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →