← 最新论文
💻 computer science

SalFormer360: a transformer-based saliency estimation model for 360-degree videos

本文介绍了 SalFormer360,这是一种新型的基于 Transformer 的模型,它结合了经过微调的 SegFormer 编码器、自定义解码器以及视角中心偏差(Viewing Center Bias),旨在实现跨多个基准数据集的 360 度视频显著性估计的最先进性能。

原作者: Mahmoud Z. A. Wahba, Francesco Barbato, Sara Baldoni, Federica Battisti

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Mahmoud Z. A. Wahba, Francesco Barbato, Sara Baldoni, Federica Battisti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正戴着一个虚拟现实(VR)头显。你站在一个巨大的、360度全景球体的中心。你可以向上、向下、向左、向右看,或者完全旋转。问题在于,要以高画质显示这个球体中“一切”内容的视频文件极其庞大——就像试图向你的头显传输一整个电影院规模的数据量一样。这会非常缓慢,并且会耗尽你所有的互联网带宽。

为了解决这个问题,工程师们使用了名为“视口流媒体”(viewport streaming)的技巧。与其发送整个球体的高清画面,不如只发送你正在注视的部分为高清,而将其余部分设为低清。但为了做到这一点,计算机必须猜测你下一步会看向哪里

这正是这篇论文发挥作用的地方。作者构建了一个名为 SalFormer360 的新型 AI 大脑,来做出这个猜测。

问题所在:“中心偏差”(The "Center Bias")

当你第一次戴上 VR 头显时,你通常是直视前方的。你不会立即开始疯狂旋转。在开始探索之前,你往往会在一段时间内专注于视野的中心。作者们称之为**“注视中心偏差”**。

这就像走进一个新房间。你站在门口,直视着面前的墙壁。你不会立即转动360度。你会先关注中心。

解决方案:一个“Transformer”侦探

团队创建了 SalFormer360。要理解它是如何工作的,请把它想象成一个拥有两种特殊工具的高级训练侦探:

  1. SegFormer 主干网络(物体识别器):
    该模型使用了一个最初设计用于在平面 2D 图片中寻找物体(比如在照片中找猫)的预训练“侦探”。作者意识到,吸引你注意力的事物(如人、球或汽车)通常与“物体识别器”所寻找的事物是一致的。因此,他们采用了这个现有的 2D 侦探,并教会了它如何处理 360 度视频那种奇特的、拉伸后的形状(看起来就像一张世界的平面地图)。

  2. 定制解码器(地图绘制器):
    一旦侦探发现了有趣的物体,这个定制的“地图绘制器”就会将这些位置转化为热力图。这张地图精确地展示了人类很可能会看向哪里。

  3. “中心偏差”调节(记忆功能):
    这是核心秘诀。该模型不仅观察图像,还记住了“人类通常从中心开始注视”这一规则。

    • 在视频开始时: 模型会说:“嘿,用户刚戴上头显。他们很可能正在看向中心。让我们提升对中间区域的预测。”
    • 随着视频进行: 模型意识到:“好吧,他们已经有时间环顾四周了。‘中心规则’的重要性降低了。”它会慢慢调低“中心偏差”的音量,转而更多地关注场景中的实际物体。

它表现如何?

作者通过三个巨大的 360 度视频库(体育、游戏和通用场景)测试了他们的侦探,并将其与许多其他“侦探”(现有的 AI 模型)进行了对比。

  • 结果: SalFormer360 在猜测人类注视点方面表现最佳。与之前的最强模型相比,它的准确率提升了高达 18.6%
  • 效率: 与那些像笨重、缓慢的大卡车一样的其他模型不同,SalFormer360 是一辆轻量级的跑车。它足够小,可以直接在 VR 头显上运行,无需依赖后台的超级计算机。它可以在仅 5 毫秒(比人类眨眼还快)内做出一次预测。

它的短板在哪里(“挑战性”情况)

论文承认该模型并非完美。它在两种特定情况下会遇到困难:

  1. 混乱: 如果场景中充满了剧烈的运动,或者同时有太多有趣的事情发生(比如繁忙的游乐园设施),模型会感到困惑,并仅仅通过猜测“中心”来应对,而不是选出正确的点。
  2. 干扰项: 如果有一个明亮的、闪烁的标志或一个奇怪的物体,即使它并不是视觉焦点,模型也可能会被误导,认为用户正在注视它,即便用户实际上是在看主要动作。

总结

这篇论文将 SalFormer360 呈现为一种聪明、快速且高效的预测 VR 用户视线的方法。通过将强大的物体识别 AI 与对人类行为的简单理解(即我们从中心开始注视)相结合,它有助于更流畅地传输 360 度视频,节省数据,并让体验感觉更加真实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →