想象一下,你正戴着一个虚拟现实(VR)头显。你站在一个巨大的、360度全景球体的中心。你可以向上、向下、向左、向右看,或者完全旋转。问题在于,要以高画质显示这个球体中“一切”内容的视频文件极其庞大——就像试图向你的头显传输一整个电影院规模的数据量一样。这会非常缓慢,并且会耗尽你所有的互联网带宽。
为了解决这个问题,工程师们使用了名为“视口流媒体”(viewport streaming)的技巧。与其发送整个球体的高清画面,不如只发送你正在注视的部分为高清,而将其余部分设为低清。但为了做到这一点,计算机必须猜测你下一步会看向哪里。
这正是这篇论文发挥作用的地方。作者构建了一个名为 SalFormer360 的新型 AI 大脑,来做出这个猜测。
问题所在:“中心偏差”(The "Center Bias")
当你第一次戴上 VR 头显时,你通常是直视前方的。你不会立即开始疯狂旋转。在开始探索之前,你往往会在一段时间内专注于视野的中心。作者们称之为**“注视中心偏差”**。
这就像走进一个新房间。你站在门口,直视着面前的墙壁。你不会立即转动360度。你会先关注中心。
解决方案:一个“Transformer”侦探
团队创建了 SalFormer360。要理解它是如何工作的,请把它想象成一个拥有两种特殊工具的高级训练侦探:
SegFormer 主干网络(物体识别器):
该模型使用了一个最初设计用于在平面 2D 图片中寻找物体(比如在照片中找猫)的预训练“侦探”。作者意识到,吸引你注意力的事物(如人、球或汽车)通常与“物体识别器”所寻找的事物是一致的。因此,他们采用了这个现有的 2D 侦探,并教会了它如何处理 360 度视频那种奇特的、拉伸后的形状(看起来就像一张世界的平面地图)。
定制解码器(地图绘制器):
一旦侦探发现了有趣的物体,这个定制的“地图绘制器”就会将这些位置转化为热力图。这张地图精确地展示了人类很可能会看向哪里。
“中心偏差”调节(记忆功能):
这是核心秘诀。该模型不仅观察图像,还记住了“人类通常从中心开始注视”这一规则。
- 在视频开始时: 模型会说:“嘿,用户刚戴上头显。他们很可能正在看向中心。让我们提升对中间区域的预测。”
- 随着视频进行: 模型意识到:“好吧,他们已经有时间环顾四周了。‘中心规则’的重要性降低了。”它会慢慢调低“中心偏差”的音量,转而更多地关注场景中的实际物体。
它表现如何?
作者通过三个巨大的 360 度视频库(体育、游戏和通用场景)测试了他们的侦探,并将其与许多其他“侦探”(现有的 AI 模型)进行了对比。
- 结果: SalFormer360 在猜测人类注视点方面表现最佳。与之前的最强模型相比,它的准确率提升了高达 18.6%。
- 效率: 与那些像笨重、缓慢的大卡车一样的其他模型不同,SalFormer360 是一辆轻量级的跑车。它足够小,可以直接在 VR 头显上运行,无需依赖后台的超级计算机。它可以在仅 5 毫秒(比人类眨眼还快)内做出一次预测。
它的短板在哪里(“挑战性”情况)
论文承认该模型并非完美。它在两种特定情况下会遇到困难:
- 混乱: 如果场景中充满了剧烈的运动,或者同时有太多有趣的事情发生(比如繁忙的游乐园设施),模型会感到困惑,并仅仅通过猜测“中心”来应对,而不是选出正确的点。
- 干扰项: 如果有一个明亮的、闪烁的标志或一个奇怪的物体,即使它并不是视觉焦点,模型也可能会被误导,认为用户正在注视它,即便用户实际上是在看主要动作。
总结
这篇论文将 SalFormer360 呈现为一种聪明、快速且高效的预测 VR 用户视线的方法。通过将强大的物体识别 AI 与对人类行为的简单理解(即我们从中心开始注视)相结合,它有助于更流畅地传输 360 度视频,节省数据,并让体验感觉更加真实。
技术摘要:SalFormer360
问题陈述
显著性估计对于优化 360 度(全向)视频的传输和观看体验至关重要,特别是在视口预测和内容优化等任务中。然而,现有方法面临着由于 360 度内容的球面几何结构所带来的挑战,这种几何结构在等距柱状投影(equirectangular projections)中会引入几何畸变。此外,许多最先进的方法依赖于计算成本高昂的技术,例如球面卷积、立方体贴图投影或处理长时序序列(通常超过 10 帧)以及光流。这些方法往往会产生高额的计算开销和内存需求,使其难以在如头戴式显示器(HMD)等资源受限的设备上进行实时部署。此外,准确建模人类的观看行为,特别是最初关注画面中心点的倾向(观看中心偏差,Viewing Center Bias),仍然是一个复杂的任务,许多模型并未充分解决这一问题。
方法论
作者提出了 SalFormer360,一种专为 360 度视频设计的轻量级基于 Transformer 的显著性估计模型。该架构基于以下组件构建:
- 编码器(SegFormer 主干网络): 该模型利用了 SegFormer 的编码器,这是一种最初为 2D 语义分割开发的基于 Transformer 的架构。作者对该编码器进行了微调,以处理 360 度等距柱状帧。为了捕捉时序动态,模型接受两个输入帧:当前帧(t)和前一帧(t−5)。这两帧沿通道维度进行拼接,形成一个 6 通道的输入,初始卷积层的权重也经过调整以适应这种变化。
- 定制解码器: 一个定制的解码器用于处理来自编码器的特征图。它由一系列卷积层、批归一化(batch normalization)、ReLU 激活函数和双线性上采样组成,以重建空间分辨率。最后的卷积层配合 Sigmoid 激活函数生成初始显著性图(Sinit)。在训练期间应用了 30% 的 Dropout 以防止过拟合。
- 观看中心偏差(CB)集成: 为了考虑人类在开始播放时注视 360 度画面中心的倾向,模型集成了一个动态的观看中心偏差。这是通过将初始预测(Sinit)与第一帧的预计算平均显著性图(即 CB)进行融合来实现的。融合过程由一个随时间变化的权重因子(wt)控制,定义为:
S=wt⋅CB+(1−wt)⋅Sinit
权重 wt 结合了一个静态参数(βi)和一个衰减动态函数(δ(t)=e−αi(t/C)2)。这使得模型能够自适应地平衡短期偏差(在视频开始时较强)和长期偏差,其中参数 αi 和 βi 在针对每个特定数据集进行训练时是可学习的。
- 损失函数: 模型使用一个结合了四项内容的复合损失函数进行训练:皮尔逊线性相关系数(LCC)、KL 散度(LKL)、球面均方误差(LSMSE)以及二元交叉熵(LBCE)。LSMSE 特别应用了球面权重,以更严厉地惩罚赤道附近的误差,从而应对投影畸变。
核心贡献
- 新颖架构: 引入了 SalFormer360,这是一种基于 Transformer 的模型,利用 SegFormer 主干网络进行 360 度显著性估计,证明了分割架构可以有效地重新用于显著性任务。
- 观看偏差建模: 集成了一种可学习的观看中心偏差机制,该机制根据帧索引和数据集特征进行动态调整,通过反映人类的探索行为来提高预测精度。
- 数据集扩展: 作者通过从头部定向数据生成地面真值(ground-truth)显著性图并提取 RGB 帧,扩展了 PVS-HM 和 VR-EyeTracking 数据集,使其更易于未来的研究。
- 高效性: 该模型设计轻量,仅利用两帧作为时序上下文,并避免了复杂的球面卷积或光流计算。
实验结果
在三个大规模基准数据集上进行了广泛的实验:Sport360、PVS-HM 和 VR-EyeTracking。该模型与多种最先进的方法进行了对比,包括 2D 视频模型、360 度图像模型以及 360 度视频模型。
- 性能: SalFormer360 在所有三个数据集上均优于现有方法。在皮尔逊相关系数(CC)方面,与此前报告的最佳结果相比,它在 Sport360 上提升了 8.4%,在 PVS-HM 上提升了 2.5%,在 VR-EyeTracking 上提升了 18.6%。
- 效率: 该模型非常高效,仅包含 370 万个参数,占用存储空间为 14.13 MB。其计算成本为 1.21 GFLOPs。
- 推理速度: 在 NVIDIA L40s GPU 上,该模型实现了平均每帧 5.1 毫秒 的推理时间(约 196 fps),证实了其适用于实时应用。
- 消融实验: 实验证实,动态成分(δ)和静态成分(β)均对观看中心偏差有贡献,且它们的相对重要性因数据集而异。结合所有四个损失函数产生了最佳的整体性能。
意义与主张
论文声称 SalFormer360 展示了 Transformer 架构在 360 度视频显著性估计中的表示能力,同时保持了较低的计算复杂度。通过成功适配 2D 分割编码器并集成数据驱动的观看偏差,该模型在不承担球面卷积或长序列处理带来的沉重计算负担的情况下,实现了最先进的精度。作者强调,该模型的轻量化特性使其特别适合边缘侧或客户端部署,例如直接在 VR 头显上运行,从而实现用于视口预测和沉浸式内容优化的实时显著性估计。这项工作表明,准确且高效的显著性图可以通过允许高质量传输显著区域并降低边缘区域的质量,从而显著提高 360 度视频的流媒体传输效率。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。