Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies
本文通过色盲检查(Ishihara Test)评估了大规模视觉语言模型(LVLMs),发现尽管这些模型拥有关于色觉缺陷的事实性知识,却无法模拟受影响个体的改变后的感知体验,而是默认采用常态化的色彩感知,从而凸显了它们在支持包容性无障碍方面的能力存在关键差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明、博学多才的机器人助手。你教会了它关于人类眼睛、色盲以及不同视觉类型的人如何看待世界的一切知识。它能写出一篇完美的文章来解释色盲“是什么样”的。
但随后,你给它看一张图片并问它:“如果你是色盲,你会在这张图片中看到什么数字?”
机器人并没有通过一个色盲人士的眼睛去看世界,它只是用自己“完美”的眼睛观察了图片,然后告诉了你一个正常人能看到的答案。它了解关于色盲的“事实”,但它无法真正“感受”或“模拟”那种体验。
这就是这篇论文的核心发现。
“石原氏”测试:机器人的视力检查
为了测试这一点,研究人员使用了一种著名的工具,叫做石原氏测试(Ishihara Test)。你可能见过这些:它们是充满彩色圆点的圆圈。
- 对于视力正常的人: 这些圆点会形成一个清晰的数字,比如“12”或“8”。
- 对于红绿色盲患者: 这些颜色会混在一起,他们可能会看到一个完全不同的数字(比如“3”)或者根本什么也看不见。
研究人员将这些图片视为机器人的诊断工具。他们要求各种大型 AI 模型(即“机器人”)观察这些图片,并假装自己是不同类型的色盲人士。
他们检查机器人的三种方式
研究人员不仅仅是问“你看到了什么数字?”,他们还通过三种不同的方式来检查机器人,就像医生检查病人一样:
“你说什么”检查(生成能力):
他们要求机器人直接说出它看到的数字。- 结果: 即使被告知“你是红绿色盲”,机器人几乎总是给出视力正常的人会给出的答案。它无法“幻觉”出色盲人士实际会看到的那个错误的数字。它被困在了“正常视觉模式”中。
“你有多确定?”检查(置信度):
他们测量了机器人回答问题的信心程度。- 结果: 机器人在回答“正常视觉”时非常有信心。但当被要求模拟色盲人士进行回答时,它变得非常困惑和不确定。它不仅仅是猜错了数字,它甚至不知道该如何以正确的方式表现出“不确定”。这就像一个学生知道数学题的答案,但在被要求倒着解题时就迷失了方向。
“大脑内部”检查(内部表征):
他们深入观察了机器人的“大脑”(其内部数据层),以查看它是否根据指令对图像进行了不同的处理。- 结果: 即使在深层结构中,机器人也没有改变它的视角。无论被告知什么,它都在按照拥有完美视觉的方式处理图像。这就像一个人戴着眼罩,却依然在描述房间里的景象,仿佛他能看得很清楚一样。
“医生”与“模式学习者”
研究人员想知道:“也许这些机器人只需要更多的医学训练?”或者“也许它们只是在记忆这些点阵模式?”
- 他们测试了一个专门接受过医学数据训练的机器人。结果: 它仍然无法模拟色盲现象。
- 他们用成千上万个虚假的点阵模式训练了一个机器人,以观察它是否只是在记忆形状。结果: 它在拥有完美视觉时看数字的能力变强了,但在假装色盲时表现得更差了。
核心结论
论文得出结论:虽然这些 AI 模型非常擅长谈论色盲,但它们非常不擅长体验色盲。
可以这样理解:你可以读一本关于在水下是什么感觉的书,但读这本书并不意味着你能憋气五分钟。这些 AI 模型已经读过了关于色盲的“书”,但它们无法真正做到“憋气”,并透过色盲人士的眼睛去看世界。
这很重要,因为随着我们开始使用这些机器人来帮助人们在现实世界中导航、阅读地图或理解图表,我们需要确保它们不会无意中给出仅对视力正常的人有效的指令,从而把其他人抛在身后。这篇论文表明,目前这些机器人的核心仍然是“视觉正常”的,即便它们试图进行伪装也是如此。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。