Judging the reasons for fixations: A direct experimental method to assess the contribution of saliency and semantic factors to gaze control
通过采用一种让参与者明确识别其注视原因的直接实验方法,本研究证明了语义因素(尤其是新颖性和先验知识)在注视控制中通常主导着低级显著性,并提出了一个区分图像驱动的高亮过程与扫描路径采样策略的框架,以更好地解释如 DeepGaze IIE 等深度学习模型的性能。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你的眼睛就像一台正在城市繁华街道上进行游览的摄像机。多年来,科学家们一直在争论是什么让摄像机停下来并聚焦在某个特定的位置。一组人认为是因为闪烁的灯光和鲜艳的色彩(显著性/saliency),而另一组人则认为是因为有意义的事物,比如“停止”标志或人的脸部(语义/semantics)。
以往研究的问题在于,它们试图通过观察整个城市地图来解决这个问题。这就像是仅仅通过观察整条街道的热力图,就想弄清楚为什么游客会在某个特定角落停下。你无法分辨他们停下是因为一个霓虹灯招牌,还是因为一名街头艺人;原因在这里混淆了。
新的实验:询问游客
与其从远处猜测,这项研究尝试了一种直接的方法。研究人员向人们展示一张图片,并询问他们为什么要看向特定的位置。这就像是在游客拍照后立刻拦住他并问道:“嘿,你为什么拍那张照片?是因为那辆红色的消防车,还是因为那只戴着帽子的有趣的小狗?”
他们的发现
答案表明,我们的眼睛是由这两种因素共同驱动的,但意义通常会胜出。我们不仅仅盯着最亮的东西看;我们盯着的是有意义的东西。
有趣的是,“意义”不仅仅是指识别熟悉的物体。一个巨大的因素是发现那些奇怪、未知或不寻常的事物。事实证明,我们的大脑就像好奇的侦探;如果某样东西不符合我们所知的“规则手册”,我们就会立即放大注视它。
新的框架:聚光灯与导游
为了理解这一点,作者提出了一个看待眼睛如何运作的新方式,使用了两步类比法:
- 聚光灯(显著性/Saliency): 想象一位舞台经理将明亮的聚光灯投射在舞台上有趣或奇特的部分。这突出了看哪里。
- 导游(策略/Strategy): 然后,一位导游决定如何将聚光灯从一个点移动到下一个点,从而创造出一条平滑的路径(扫描路径/scanpath)。
论文指出,旧的计算机模型只擅长担任“舞台经理”(寻找亮点)。它们忽略了“导游”的部分(即我们移动眼睛的策略)。
深度学习的赢家
研究人员将此与计算机模型进行了对比测试。他们发现,旧的模型(如简单的显著性图)在注视原因发生变化时(例如,它们无法很好地处理“怪异感”)表现得非常糟糕。然而,更新、更智能的 AI 模型(如 DeepGaze IIE)则要灵活得多。
把旧模型想象成一个只会寻找红色物体的机器人。如果你给它看一个蓝色的奇怪物体,它就会感到困惑。新的 AI 模型则像是一个既理解红色事物又理解奇怪事物的人,并且知道如何根据注视的具体原因来移动眼睛。因为它理解了“导游”策略,所以无论我们是因为什么原因在注视,它都能更好地预测我们的视线走向。
简而言之
我们不仅看闪亮的东西,我们也看有趣、熟悉或奇特新颖的东西。为了预测我们的眼睛看向哪里,我们需要能够理解的计算机模型——不仅要理解图像中的“闪烁灯光”,还要理解我们注视其背后的“故事”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。