← 最新论文
💻 computer science

Learning Human Visual Attention on 3D Surfaces through Geometry-Queried Semantic Priors

本文介绍了 SemGeo-AttentionNet,这是一种双流架构,它将基于几何条件的扩散语义先验与点云 Transformer 相结合,通过显式地形式化自下而上的几何处理与自上而下的语义识别之间的相互作用,来对 3D 表面上的人类视觉注意力进行建模。

原作者: Soham Pahari, Sandeep C. Kumain

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Soham Pahari, Sandeep C. Kumain

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在博物馆里观察一座 3D 雕像。为什么你的目光会停留在脸上?为什么即使一个纽扣是平的,而外套上有许多褶皱,你的目光仍会流连于一个闪亮的纽扣上?

长期以来,计算机科学家试图通过仅观察物体的**形状(shape)**来回答这个问题。他们认为:“如果它凸起、有锐利的边缘或有凹凸感,那就是人类会注视的地方。”但这种方法效果并不理想。人类经常忽略那些凹凸不平、奇形怪状的形状,转而盯着那些对我们有意义的、平滑且扁平的东西(比如一张脸或一个 Logo)。

这篇论文介绍了一个名为 SemGeo-AttentionNet 的新计算机程序,它终于解开了这个谜题。以下是它的工作原理,通过简单的解释来呈现:

1. 两脑协同作用

作者意识到,人类的注意力是两个不同“大脑”共同协作的结果:

  • “自下而上”的大脑(几何特征/Geometry): 这是你的反射。它在尖叫:“看那个锐利的边缘!看那个奇怪的凸起!”它对物理形状做出反应。
  • “自上而下”的大脑(语义特征/Semantics): 这是你的知识。它在耳语:“等等,那是一张脸。那是一个工具。那很重要。”它对物体的“含义”做出反应,即使该物体本身是完全平坦的。

之前的计算机模型只有“自下而上”的大脑。它们就像一个只注意到运动却不知道人在长什么样的监控摄像头。

2. 新方案:一个聪明的侦探

新模型 SemGeo-AttentionNet 扮演着一个同时使用这两个大脑的侦探角色。它有两个主要部分:

  • 形状扫描器(几何流/Geometry Stream): 它使用一个强大的工具(Point Transformer V3)来绘制出 3D 物体的每一个凸起、曲线和边缘,就像雕塑家触摸黏土一样。
  • 知识库(语义流/Semantic Stream): 这是神奇之处。由于计算机没有人类大脑,作者给了它一个由扩散模型(Diffusion Models)(即生成艺术图像的同类 AI 技术)构成的“水晶球”。
    • 他们对 3D 物体进行处理,从各个角度拍摄 100 张不同的照片,并询问 AI:“这是什么?”
    • AI 会回答:“那是一张脸,”或者“那是一个杯子。”
    • 这给了模型一个“语义先验(semantic prior)”——即一种预加载的、对物体本质的理解,而无需依赖带标签的 3D 数据进行学习。

3. “查询”机制:谁说了算?

这是一个巧妙的技巧。模型不仅仅是将这两个大脑混合在一起;它让它们按特定的顺序进行对话。

形状(Shape)想象成一个搜索查询(Search Query),将知识(Knowledge)想象成一个数据库(Database)

  • 形状说:“我在这里看到一片平坦区域。让我查一下数据库:这是脸吗?是屏幕吗?”
  • 知识回答:“是的,这片平坦区域是一张脸。请关注它!”

这确保了即使一张脸在几何结构上是平坦且乏味的,模型也会因为“知识”部分确认了它的重要性而注视它。然而,形状仍然拥有“否决权”。如果知识部分说“那是张脸”,但形状部分说“那实际上只是一个没有任何特征的平坦墙面”,模型就不会被分散注意力。它需要两者达成一致。

4. “眼动追踪”游戏(强化学习)

到目前为止,模型仅仅是预测你在哪里看。但人类的注视是有序列的(扫描路径/scanpath)。首先眼睛看向鼻子,然后是嘴巴,接着是帽子。

作者教会了模型玩一个模拟这种运动的游戏:

  • 游戏规则: 模型是一个在 3D 物体表面行走的智能体(agent)。
  • 规则如下:
    1. 前往有趣的地点: 向高显著性区域移动(如脸部、工具手柄)。
    2. 不要感到厌倦: 如果你在某个地方看的时间太长,你会受到惩罚(这被称为“抑制回视/Inhibition of Return”)。你必须继续移动。
    3. 探索: 尝试访问你尚未见过的新区域。
  • 结果: 模型学会了如何像人类探索物体一样,在物体表面“行走”其目光,同时遵循了你无法在空中跳跃、必须沿着物体表面移动的限制。

5. 实验结果

团队在三个不同的数据集(包含人类眼动数据的 3D 物体集合)上测试了该模型。

  • 得分: 他们的模型表现显著优于所有之前的方法。它能更准确地预测人类注视的具体位置。
  • 证明: 当研究人员观察结果时,发现该模型正确识别出了人们会盯着石像鬼的眼睛(尽管脸部很平滑)以及磨损工具的手柄,而旧模型只会盯着雕像中那些凹凸不平、充满噪声的部分。

总结

简而言之,这篇论文构建了一个不仅通过其形状,而且通过其含义来理解 3D 物体的计算机视觉系统。通过将几何扫描器与源自 AI 艺术生成器的“知识库”相结合,并教会它像人类一样移动“眼睛”,他们创造了目前最准确的 3D 世界注视点预测模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →