Comparing Human Gaze and Vision-Language Model Attention in Safety-Relevant Environments
本研究表明,大型视觉语言模型(尤其是 GPT-4o 和 Gemini Pro)能够在无需眼动追踪训练数据的情况下,在安全相关环境中有效模拟人类视觉注意力模式,这一点已通过模型生成的显著性图与人类注视热力图之间强有力的空间对齐指标得到了证实。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走在一条繁忙的城市街道上。你的目光会自然地转向由于车辆紧急避让而产生的刺耳轮胎摩擦声、人行道上湿滑的一块冰,或是挡住去路的施工障碍物。你不需要思考,你的大脑天生就会优先捕捉潜在的危险。这被称为负面偏差(negativity bias)——我们天生就会关注威胁。
现在,想象一下你想教一个超级聪明的计算机(即人工智能,AI)也做到这一点。你想让它看一张图片并说:“嘿,看这里!这就是人类会注意到风险的地方。”
这篇论文提出了一个简单的问题:现代人工智能是否能在从未通过观察人类眼睛进行学习的情况下,像人类一样“看见”危险?
实验:一场“你在看哪里?”的游戏
研究人员设置了一个由两支队伍组成的比赛:人类队和AI队。
人类队(眼动追踪者):
他们把10名大学生带到一个房间里,并给他们戴上了特殊的眼镜(称为 Pupil Invisible),这些眼镜就像是眼睛的微型摄像机。这些眼镜不仅是在观察学生,还在观察学生的视线落在哪里。
- 学生们观察了33张日常场景的照片(如积水的街道、繁忙的十字路口或安静的公园)。
- 有些照片中有明显的风险(如车祸或暴风雨),而有些则是安全的。
- 眼镜记录了每个学生视线落下的精确位置,从而生成了一张“热力图”。你可以把这张热力图想象成一张热成像照片:颜色越热(越亮)的地方,表示人们注视得越多。
AI队(视觉语言模型):
随后,研究人员将同样的33张照片展示给了一个强大的AI,即 GPT-4o。
- 他们并没有用眼动追踪数据来训练这个AI。他们没有说:“这里是人类注视的地方。”
- 相反,他们只是问AI:“看这张图片。如果一个人盯着这张图看10秒钟,他们的眼睛会看向哪里?请告诉我在哪些最重要的坐标点。”
- AI根据它认为重要的部分,生成了它自己的“热力图”。
对决:对比热力图
研究人员将“人类热力图”和“AI热力图”叠放在一起,观察它们的匹配程度。他们使用了四种不同的“尺子”(数学测试)来衡量重合度:
- “它们相似吗?”测试 (Pearson Correlation): AI强调的区域是否与人类的区域大致相同?
- 结果: 是的,匹配得相当不错。AI和人类在整体布局上有51%的重合度。
- “你看到那里了吗?”测试 (NSS): 当人类注视某个特定点时,AI是否也认为那个点很重要?
- 结果: 是的。对于人类注视的精确位置,AI也给出了高分。
- “形状匹配”测试 (KL Divergence): AI的注意力分布是否与人类的注意力分布一致?
- 结果: 即使其他模型在定位精确位置方面表现略好,但GPT-4o在匹配人类注意力的“形状”方面实际上表现得最好。
- “识别危险”测试 (AUC-Judd): 如果你需要猜测图像中哪些部分具有风险,AI的表现是否比随机猜测更好?
- 结果: 绝对如此。AI的分数达到了0.80(满分为1.0),而随机猜测的分数仅为0.5。
结论
研究发现,GPT-4o 能几乎完全精准地预判人类注视危险的位置,尽管它从未佩戴过眼动追踪眼镜。
- 与“负面偏差”的联系: 这个AI似乎从其庞大的训练数据(它在网上阅读的所有文本和图像)中学习到了人类倾向于关注可怕或危险事物的规律。它自然地模仿了我们的“负面偏差”。
- 并非仅限于一种模型: 研究人员还测试了其他AI(如 Gemini Pro 和 Claude)。它们都比随机猜测的表现要好,但 GPT-4o 在匹配人类注意力的“模式”方面表现最佳,而 Gemini Pro 在精准定位风险位置方面则略胜一筹。
为什么这很重要(根据论文所述)
论文得出结论,我们可能不需要昂贵的眼动追踪眼镜来构建机器人或自动驾驶汽车的安全系统。如果一个大型AI模型仅通过对图像进行“思考”就能预测人类会看向哪里以规避危险,那么我们就可以利用这个AI来帮助机器安全地行驶。
简而言之: AI不需要被教导如何观察;它只需要被提问,它就会明白,就像我们一样,它应该关注那些可怕的事物。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。