Do Vision Encoders Exhibit Human-like Color Thresholds?
这项大规模研究表明,包括卷积网络和 Transformer 在内的 50 多种预训练视觉编码器普遍无法表现出类人的色彩辨别阈值,其中自监督模型表现最好,但与人类感知敏感性的对齐程度仍然较弱。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
我们最聪明机器的“色盲”现象
想象一下你正在看一场日落。在你的眼中,天空不仅仅是一个巨大的橙色色块;它是一个平滑的渐变过程,其中一些细微的色彩变化很容易被察觉,而另一些则完美地融合在一起,让你无法分辨。这就是人类视觉的工作方式:我们的大脑对某些颜色极其敏感,而对另一些颜色则不太敏感,从而创造出一个并不完全均匀的世界“地图”。科学家们几十年来一直了解这种敏感度的不均匀性,并精确地绘制出了色彩需要改变到什么程度,人类才会察觉到变化。
现在,想象一下教一台计算机如何去“看”。我们已经构建了庞大的数字大脑,称为“视觉编码器”,它们通过学习数百万张照片来识别猫、汽车和云朵。这些机器是现代人工智能领域的明星。但这里有一个大问题:这些数字大脑看到的颜色方式和我们一样吗?它们是否拥有属于自己的那套不均匀的“地图”,能够注意到人类能注意到的红苹果的细微变化,还是说它们正通过一个完全不同、甚至可能更加奇特的视角来看待世界?这正是这项新研究试图解决的谜题——测试我们最先进的人工智能是否在无意中学会了像人类一样看色彩,或者它是否在以一种我们从未预料到的方式表现出“色盲”。
伟大的色彩测试:AI 大脑的视觉与我们一致吗?
在这项研究中,一个研究小组决定对 50 多种不同的 AI 视觉模型进行测试。可以将这些模型想象成一个庞大的学生班级,从旧式的经典“卷积”网络,到最新的、极其复杂的“Transformer”,以及通过阅读图像文本描述来学习视觉的模型。研究人员想知道:这些机器是否拥有类人的色彩阈值?
为了找出答案,他们并没有仅仅要求 AI 命名颜色。相反,他们设计了一个“找不同”的游戏。他们选择了 18 种特定的参考色(例如某种特定的蓝色或绿色),并在每种颜色周围环绕着一圈略有差异的颜色。对于人类来说,每种颜色周围都有一个已知的“安全区”——一个形状像拉长的椭圆形的区域(称为麦克亚当椭圆,MacAdam ellipse),在这个椭圆内部的任何色彩变化对人眼来说都是不可见的。一旦跨出这个椭圆哪怕一点点,你就能突然察觉到差异。
研究人员随后将这些颜色输入到 AI 模型中。他们问 AI:“这些周围的颜色中,哪一个看起来与中心颜色最相似?”AI 通过在自己的数字大脑中创建一个“相似性地图”来做出回答。如果 AI 具有类人特性,那么它的“相似颜色”地图应该与人类的“安全区”椭圆完美重叠。
结果:彩虹中的错位
研究结果令人震惊。研究发现,总体而言,这些 AI 模型并不像人类那样感知色彩。
即使是最优秀的模型,也仅在约 25% 的情况下与人类的色彩敏感度相匹配(具体来说,一个被称为 mIoU 的得分低于 0.25)。换句话说,如果你试图完美匹配人类的色彩感知,这些 AI 模型在细节上的准确率还不到四分之一。它们并非对颜色完全盲目,但它们的彩虹“地图”是扭曲的。
以下是研究关于不同类型“AI 学生”的发现:
- “自学成才”的学生表现最佳: 通过观察图片而无需标签进行自我监督学习的模型表现最好。它们是最接近人类视觉的模型,尽管仍远非完美。
- “文本学习者”是变数: 通过将图像与文本进行匹配来学习的模型(如 CLIP)是最难以预测的。它们有的处于班级的顶端,有的则处于底端。它们呈现两极分化,这意味着它们要么做得相当不错,要么做得非常糟糕。
- 规模并不代表更好: 你可能会认为,一个巨大且极其复杂的 AI 模型会比一个小型的旧模型看得更准。但研究表明,扩大模型规模并不能自动解决这个问题。 事实上,一些较旧、较小的模型(如经典的 VGG16)表现得与那些庞大的现代基础模型一样好。这表明,仅仅通过增大“大脑”的大小并不能教会它像人类一样看色彩。
- “蓝色问题”: AI 在蓝色颜色的处理上最为吃力。就像人类很难区分非常相似的蓝色色调一样,AI 在这里也遇到了最大的困难,经常把“安全区”搞得完全错误。
为什么这很重要
研究人员指出,仅仅因为 AI 在海量照片上进行了训练,并不会自然而然地产生类人的色彩敏感度。 目前训练这些模型的方式似乎优先考虑其他事物(如识别物体或理解文本),而不是色彩感知的精细、微妙细节。
研究结论认为,虽然这些 AI 模型已经学会了以一种结构化的方式组织颜色(它们并非随机的噪声),但它们组织色彩的方式与我们不同。如果你将这些模型用于需要完美色彩匹配的任务——例如修复旧画作、检查水果是否成熟或进行数字艺术设计——你可能会遇到问题。AI 可能会认为两种颜色是完全相同的,而人类可以清晰地看到它们之间的差异,反之亦然。
简而言之,我们的数字眼睛在观察“大局”方面变得越来越好,但在观察那些让我们的世界感到真实的细微色彩细节方面,仍然还在学习阶段。机器看待日落的方式与我们看待日落的方式之间,依然存在着巨大的鸿沟。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。