Systematic comparison of color representations between humans and deep neural networks: towards predicting human color perception in a vast color space
本研究利用 Gromov-Wasserstein 最优传输理论,系统地比较了自监督、监督学习以及 CLIP 训练的深度神经网络在颜色表示上的差异,旨在证明尽管所有范式的早期层都与人类感知保持一致,但唯有 CLIP 在输出端维持了这种结构一致性,从而能够对广阔且此前从未被探索的颜色空间中的人类颜色感知进行可靠预测。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,试图绘制出人类如何感知整个色彩世界的图谱。长期以来,科学家们通过让人们比较成对的颜色来完成这项工作,例如:“这个红色更像橙色还是紫色?”但这就像是仅靠走几步路就想绘制出一整块大陆的地图。这既耗时漫长,而且我们仅仅探索了相似颜色的“邻里区域”,却让包含 4,000 多种颜色的广阔全球景观成为了谜团。
为了解决这个问题,研究人员决定使用深度神经网络 (DNN) 作为数字侦探。可以将这些网络想象成拥有“视觉”的学习过的数字大脑。核心问题在于:哪种类型的“人工大脑”看颜色的方式最像人类?
他们测试了三种不同的“训练营”:
- 自监督学习 (SSL): 大脑通过独自观察数百万张照片进行学习,在没有任何帮助的情况下尝试理解其中的模式。
- 监督学习 (SL): 大脑在看照片的同时,由一位老师指着并说:“那是猫”,“那是狗”。
- CLIP: 大脑通过将照片与其文字描述(如“一个红苹果”或“一片蓝天”)进行匹配来进行学习。
为了观察这些数字大脑是否符合人类的视觉,研究人员使用了一种名为格罗莫夫-瓦瑟斯坦最优传输 (GWOT) 的特殊数学工具。你可以把它想象成一个超级精准的“变形器”,试图将数字大脑的颜色地图与人类的颜色地图折叠在一起,看它们是否能完美契合。
以下是他们的发现:
- 早期层级: 当他们观察这三种网络中所有的“早期思考”部分时,它们都表现得非常出色。它们就像是已经学会了像人类一样区分红苹果和绿苹果的学徒。
- 最终裁定: 然而,随着信息向网络深处传递,情况发生了变化。
- 自监督和监督网络在得出最终答案之前,就开始偏离人类的感知。它们发展出了自己独特的、非人类的方式来组织颜色。
- CLIP 是赢家。它是唯一一个直到最后都能保持“类人”颜色图谱的网络。即使在处理完所有信息后,它对颜色的最终看法在结构上仍然与人类的视觉方式一致。
大局观:
随后,研究人员利用这个获胜的网络 (CLIP) 去探索一个包含 4,096 种颜色的巨大领域——这种规模如果要在实验室里进行人工测试,将耗费人类数十年的时间。该网络不仅停留在我们已知的颜色,它还生成了一幅完整的、有结构的地图,展示了这数千种颜色是如何相互关联的。
简而言之,这篇论文表明,通过训练一个让图像与文字相匹配的 AI (CLIP),我们得到了一个看颜色就像我们一样的工具。我们现在可以利用这个工具来预测人类如何感知广阔且未经测试的色彩世界,从而在无需在现实中对真人进行无数次、耗时漫长的实验的情况下,为未来的科学探索提供指南针。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。