← 最新论文
💻 computer science

MASS-ScanDMM: A Panoramic Image Scanpath Prediction Method Integrating Multiple Attention Mechanisms and Spherical Semantic Enhancement

本文提出了一种名为 MASS-ScanDMM 的全景图像扫描路径预测方法,该方法集成了多重注意力场景感知(MASP)和球面信息增强感知(SIEP)机制,以在多个数据集上实现卓越的准确性和泛化能力。

原作者: Jianwei Li, Yuxin Chen, Hongjue Chen, Sixi Chen

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianwei Li, Yuxin Chen, Hongjue Chen, Sixi Chen

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字时代,我们的屏幕不再是扁平的矩形,而是通往360度世界的沉浸式窗口。虚拟现实头显让我们能够向任何方向观察,将简单的图像转变为一个广阔的球形环境,在那里我们可以转动头部去探索博物馆、公园或客厅。然而,以高分辨率渲染这些完整的世界对计算机算力和网络带宽的要求极高。为了解决这个问题,研究人员转向了人类眼睛的实际工作方式。我们的视觉并非均匀分布;我们只在微小的中心区域看到精细的细节,而其余视野则是模糊的。通过预测一个人下一步会看向哪里,计算机可以仅对那个微小的、清晰的区域进行高分辨率渲染,并保持其余部分为低分辨率,从而节省大量的资源。这种对眼球运动(被称为扫描路径)的预测,是让虚拟现实变得高效且响应迅速的关键。

几十年来,科学家们一直在研究人们如何扫描二维平面图像,但当图像包裹在一个球体上时,规则完全改变了。在平面照片中,眼睛自然会向中心靠拢,但在360度全景图中,观众必须主动转动头部去寻找有趣的细节。现有的计算机模型往往难以应对这一挑战,生成的注视模式要么过于随机,要么无法考虑到球形世界的独特几何结构。它们可能会错过重要的物体,或者建议一些对人类观察者来说感觉不自然的眼球运动。挑战在于如何教会计算机不仅要理解场景中的物体,还要理解这些物体是如何存在于一个弯曲的、全方位的空间之中的。

来自福州大学的一个研究小组通过一种名为MASS-ScanDMM的新方法解决了这一挑战。他们的方法旨在模拟人类大脑在这些沉浸式环境中处理视觉信息的复杂方式。该系统并非依赖单一的图像观察方式,而是结合了多种不同的策略来决定观众的视线走向。它将全景图像视为一个动态场景,其中注意力随时间而转移,就像一个人在探索房间一样。该系统建立在一个追踪视觉状态的基础之上,本质上是在模拟一种工作记忆,这种记忆能保留刚刚看到的内容,从而预测接下来会看到什么。

这种新方法的核心包含两个协同工作的专门组件,以提高准确性。第一个组件充当一个复杂的过滤器,帮助计算机决定图像中哪些部分是最重要的。它通过同时权衡视觉数据的不同方面来实现这一点,例如特定区域的亮度、物体的纹理以及场景中不同部分之间的关系。通过整合这些多层注意力机制,该系统能够更好地识别出那些会吸引人类目光的具体位置,而不是迷失在广袤的360度视野中。

第二个组件专门针对全景图像的独特形状。由于360度照片在计算机处理时通常会被拉伸在平面屏幕上,重要的空间关系可能会发生扭曲。这个新系统通过以尊重球形世界的方式对信息进行分组,纠正了这种扭曲。它通过分别观察水平和垂直方向来分析图像,确保计算机理解建筑物的顶部是如何与底部连接的,即使图像被包裹起来也是如此。这使得模型能够保持场景结构的清晰感,防止其他方法在处理全景视图边缘时经常出现的混乱。

当研究人员使用三个不同的全景图像大型集合对他们的系统进行测试时,结果非常明确。他们测量了计算机预测的眼球运动与真实人类观众实际路径的匹配程度。这种新方法始终优于以往的方法,生成的注视模式更加平滑且更准确。在一次涉及博物馆场景的测试中,该系统成功预测了观众会看向特定的展品,而旧模型往往会将预测分散在空白的墙面上。数据表明,新系统显著降低了预测误差,使计算机的行为更接近于人类探索这些环境的自然方式。

研究人员还发现,该系统可以用于一项相关的任务:创建热图,展示场景中哪些部分最有可能吸引注意力。通过汇总预测的眼球运动,他们可以生成一个视觉指南,突出显示全景图像中最有趣的区域。这一应用证明了该系统不仅能预测运动,而且能够很好地理解场景内容,从而识别出是什么让一个地方具有吸引力。这项研究证实,通过将多种注意力方式与对球形几何结构的深刻理解相结合,计算机终于可以学会像我们一样观察世界,从而为更高效、更真实的虚拟现实体验开启了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →