← 最新论文
🤖 machine learning

Consensus Clustering of Free-Viewing Gaze Data: New Insights into Human-Information Interaction

本文介绍了 EnsembleGaze,这是一种将共识聚类应用于自由注视注视数据的新型无监督集成学习系统,该系统揭示了刺激物在环境注视与焦点注视模式下的稳健差异,并证明了用户行为模式具有上下文依赖性,且最适合通过双聚类策略进行捕捉。

原作者: Beryl Gnanaraj, Jaya Sreevalsan-Nair, Saqib Alam Ansari, Maanasa Rajaraman

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Beryl Gnanaraj, Jaya Sreevalsan-Nair, Saqib Alam Ansari, Maanasa Rajaraman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观察一群人注视着墙上的一系列图片。你听不到他们在想什么,但你有一个特殊的相机,可以精确追踪他们的眼睛落在哪里、停留了多久,以及他们的眼睛如何在不同位置之间跳跃。这就是注视数据(gaze data)

长期以来,科学家们一直试图通过观察单个“注视点”(眼睛停顿的地方)或“扫视”(在停顿点之间的跳跃)来理解这些数据。但本文的作者认为,这就像是试图通过只听其中一种乐器来理解一整个管弦乐团。他们想要听到整场交响乐:即人们如何共同与图片进行交互。

以下是他们的新系统 EnsembleGaze 的简单拆解,以及他们的发现。

问题所在:切分饼图的方式太多了

当你试图根据人们看图片的方式对他们进行分组时,有很多种方法。

  • 你可以根据眼睛移动的速度来分组。
  • 你可以根据注视的时长来分组。
  • 你可以根据图片的颜色来分组。

问题在于,如果你只选择一种分组方式,可能会得到有偏差的结果。这就像要求一群朋友对一副扑克牌进行分类。如果你要求他们按颜色分类,你会得到一堆牌;如果你要求他们按数字分类,你会得到另一堆牌。这两种方式都没有“错”,但都没有讲述完整的故事。

解决方案:“超级组合”(共识聚类)

为了解决这个问题,作者构建了一个名为 EnsembleGaze 的系统。把这个系统想象成一个超级评审团

他们没有依赖单一的方法来对数据进行分类,而是让几个不同的“排序算法”(数学方法)独立地完成这项工作。

  1. 评审团: 他们使用了三个不同的“评审员”(算法)来观察数据。
  2. 投票: 每个评审员都会创建自己的分组。然后,系统会查看所有的投票。如果评审员 A、评审员 B 和评审员 C 都一致认为人物 X 和人物 Y 应该属于同一组,那么系统就会非常有信心认为他们确实应该在一起。
  3. 最终决定: 系统根据这些投票创建一个“共识”(最终协议)。这降低了出错的可能性,并能提供一个更可靠的关于谁与谁属于同一类别的图景。

转折点:同时观察两件事(高维聚类)

大多数研究要么研究,要么研究图片

  • 研究 A: “哪些人看图片的方式相同?”
  • 研究 B: “哪些图片吸引了相同类型的注意力?”

作者想要同时完成这两件事。他们将**(人 + 图片)*的组合视为一个单一的单元。想象一个舞池,你正试图寻找舞伴对的配合度。你不仅是在对舞者进行分组,也不仅是在对歌曲进行分组;你是在对特定的人听到特定歌曲时所产生的特定舞步*进行分组。

他们使用了两种先进的技术来实现这一点:

  1. 子空间聚类(Subspace Clustering): 这就像是先按舞姿风格对舞者进行分类,然后在每个风格组内,再按他们跳的舞曲进行分类。这是一种循序渐进的方法。
  2. 双向聚类(Biclustering): 这就像是同时对舞者和歌曲进行分类。它能找到这样一组特定的舞者:他们都热爱某一组特定的歌曲,而忽略其他的。

他们的发现(结果)

他们将该系统应用于两组著名的眼动追踪数据:一组是自然场景(如风景),另一组是情感图像。

1. “环境型”与“聚焦型”的分裂
他们发现,无论使用哪种方法,图片都会自然地分为两大类:

  • “环境型”(Ambient)组: 这些图片中,人们的眼睛会广泛地游走,捕捉整个场景(比如观察风景)。
  • “聚焦型”(Focal)组: 这些图片中,人们会锁定在特定的细节上(比如脸部或汽车)。
  • 结论: 图片本身具有一种“个性”,决定了我们如何观察它们。

2. 人是依赖于情境的
人的分组并不是固定的。一个人在看风景时可能表现为“聚焦型”观察者,但在看情感图像时可能变成“环境型”观察者。

  • 结论: 你不能仅仅把一个人贴上“快速观察者”或“缓慢观察者”的标签。他们的行为会随着所看内容的不同而改变。只有这种先进的“同时观察两者”的方法(双向聚类)才能发现这种复杂的模式。

3. 颜色并没有你想象的那么重要
作者检查了图片的颜色(红 vs 蓝)或亮度(亮 vs 暗)是否决定了人们如何观察。

  • 结论: 出人意料的是,并没有。图片的颜色和亮度并不能强烈地预测人们如何进行分组。

4. 物体更为重要
然而,图片里有什么却非常重要。

  • 如果图片中有很多人或野生动物,它会产生独特的视觉模式。
  • 如果图片中有物体(如汽车或家具),它会产生不同的模式。
  • 结论:内容(物体)驱动了行为,而不仅仅是颜色。

核心总结

作者构建了一个名为 EnsembleGaze 的工具,它像是一个智能的多方投票系统,用以理解人类如何与图像互动。他们发现:

  • 图片自然地分为“宽视角”和“近距离视角”两类。
  • 人并没有一种固定的观察方式;他们会根据图片改变自己的风格。
  • 图片中的内容(物体)比颜色更重要。

这个系统提供了一种可靠且可重复的方法,用于研究人类的注意力,而无需预先猜测“正确答案”。这是一种通过聆听人类注意力的“交响乐”,而非仅仅聆听其中一种乐器的全新方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →