Ethology of Latent Spaces
本研究采用行为学视角,旨在证明视觉-语言模型中的潜空间并非中立,而是展现出由训练数据驱动的、截然不同的“算法视阈机制”,从而产生对艺术多样且往往相互矛盾的政治与文化阐释,这使得对这些模型在数字艺术史中的应用方式进行批判性重新评估变得势在必行。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有三位不同的艺术评论家。他们正在共同观察同一组由 301 件作品(涵盖从 15 世纪到 1900 年代的绘画和雕塑)组成的藏品。你可能会预期他们在所见之物上达成共识。但在本研究中,这些“评论家”并非人类;它们是三种不同的 AI 模型(OpenAI CLIP、OpenCLIP/LAION 和 SigLIP)。
该论文认为,这些 AI 模型并非中立、空白的白纸。相反,每种模型都发展出了自己独特的“个性”和看待世界的方式,而这完全是由其接受的特定数据及其构建方式所塑造的。作者称之为**“潜空间行为学”(an ethology of latent spaces)**——基本上,就像生物学家研究野生动物的行为一样,去研究这些 AI 大脑的“行为”。
以下是使用简单类比对论文主要观点的拆解:
1. “隐形眼镜”类比
把这些 AI 模型想象成戴着隐形眼镜。
- 数学原理: 在计算机内部,AI 将图像视为巨大多维空间中的一团数字(向量)云。
- 含义: 当我们问 AI,“这张图片具有政治性吗?”它并不会“思考”政治。相反,它会观察自己的数字云,看看哪些“政治”相关的数字与该图像最接近。
- 转折点: 论文表明,每种模型佩戴的“眼镜”各不相同。一个模型可能会将黑白照片视为“阴暗忧郁”,而另一个模型则可能将其视为“高对比度且富有戏剧性”,这仅仅是因为它们的训练方式不同。
2. 三种不同的“人格”
研究对比了三种特定的模型,发现它们表现得像三个截然不同的人:
- OpenAI CLIP(博物馆馆长): 该模型是在经过精心策划的私有数据集上训练的。它的行为像一位传统的艺术史学家。它倾向于仅在著名的、制度化的艺术运动(如立体主义或达达主义)中看到“政治”。如果你给它看一个非洲面具,它会将其视为“艺术”或“文化”,但不一定会将其视为“政治性”的。
- OpenCLIP/LAION(网络冲浪者): 该模型是在从整个互联网抓取的庞大、混乱的数据集上训练的。它的行为像一个混乱的网络用户。它在任何地方都能看到“政治”,但往往是以一种随机、嘈杂的方式。它可能会因为某个词(例如“殖民”)出现在网络上类似图像的说明文字中,就将一幅画作标记为“殖民主义的”,即便这幅画本身并不涉及殖民主义。
- SigLIP(批判理论家): 该模型使用了不同的技术架构。它的行为像一位敏锐的现代评论家。它在几乎所有事物中都能看到“政治”。例如,它将非洲面具标记为高度“政治化”(概率为 59%),而其他模型则认为它们是去政治化的。它似乎习得了非西方艺术本质上与政治斗争相关联,而西方艺术则是“中立”的这一观点。
3. “霓虹灯招牌”的混淆
论文举了一个关于 AI 如何在物理对象与单词之间产生混淆的极佳例子。
- 测试: 研究人员要求模型按“亮度”对图像进行排序。
- 结果: OpenAI CLIP 将约瑟夫·科苏斯(Joseph Kosuth)的霓虹灯艺术(通常是在黑色背景下拍摄的)列为藏品中最“亮”的东西之一。
- 原因: AI 并没有“看到”像素。它看到了训练数据中的单词“neon”(霓虹灯),并将“neon”这个词与“明亮的光线”这一概念联系了起来。它将标签与现实混淆了。
- SigLIP 则不同,它实际上观察了像素,并正确识别出那些照片是很暗的。
4. “涌现偏差” vs. “统计偏差”
通常,当我们谈论 AI 偏差时,我们想到的是“统计偏差”(例如:“数据集中缺乏女性的照片”)。
- 论文的新观点: 本研究引入了**“涌现偏差”(Emergent Bias)**。这是一种像化学反应一样凭空出现的偏差。它并不直接存在于原始数据中;它从 AI 连接单词与图像的复杂方式中“涌现”出来。
- 类比: 想象一个食谱。如果你漏掉了盐,菜肴会很平淡(统计偏差)。但如果你以特定的方式混合面粉、糖和酵母,你会得到发酵的面包(涌现属性)。AI 的“政治”观点就像是正在发酵的面包——它们不是被直接放入碗里的,而是因为食材(数据)混合的方式而“升起”了。
5. “三种视界”(它们如何观察)
作者使用艺术史中的隐喻来描述这些模型如何“观察”世界:
- 熵增视界(Entropic Gaze,针对 LAION): 一种混沌、嘈杂的观察方式,捕捉互联网上的所有言论,往往强化了网络搜索中存在的刻板印象。
- 制度视界(Institutional Gaze,针对 OpenAI): 一种受控的、博物馆式的观察方式,强化了既定的西方艺术史规则。
- 符号学视界(Semiotic Gaze,针对 SigLIP): 一种理论性的观察方式,试图在一切事物中寻找深层的、批判性的意义,有时会在人类仅仅看到形状的地方强加政治解释。
核心结论
论文得出结论:AI 并不是艺术史研究的中立工具。
如果你使用 AI 来分析艺术,你得到的不仅仅是“计算机的意见”。你得到的是该模型训练数据所特有的、隐藏的“人格”。
- 如果你使用模型 A,你可能会看到艺术是“中立且具有美感的”。
- 如果你使用模型 B,你可能会看到同样的艺术是“具有深层政治性和殖民色彩的”。
作者警告说,我们不能在不了解 AI 拥有其自身看不见的规则和偏差的情况下,就简单地将艺术的解释权“委托”给 AI。除非我们将不同的模型进行对比研究,否则我们无法看清这些偏差。AI 所看到的“真相”,完全取决于它戴着什么样的“眼镜”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。