为了解决这个问题,一个研究团队推出了 M3ISR,这是一个旨在衡量这些 3D 和 4D 高斯系统性能的新型测试场。该团队创建了一个包含二十五个不同场景的集合,涵盖了从温馨的卧室、厨房到户外环境的各种场景。与以往依赖于光照和摄像机角度变化难以预测的杂乱真实视频测试不同,这个新基准使用了一个受控的合成环境。他们使用六个呈扇形排列、同时对准同一个中心点的同步摄像机来渲染每个场景。这种设置允许研究人员隔离特定的变量,例如系统如何处理摄像机之间的间隙,或者如何处理静止房间与有人走动的房间之间的差异。该数据集内容极其丰富,不仅提供了视频图像,还提供了关于物体深度、物体类别以及场景中哪些部分在移动、哪些部分保持静止的完美、无噪声的信息。
研究人员将该数据集组织成五个不同的挑战,以覆盖 3D 视频从创建到交付的整个生命周期。前两个挑战侧重于构建场景:一个是针对静态环境,另一个是针对物体移动的动态环境。这些测试的结果揭示了一个令人惊讶的见解。虽然不同的方法生成的图像在视觉质量上非常相似,但它们所需的存储空间却差异巨大。有些方法存储单个场景需要超过三千兆字节,而另一些方法仅用五百兆字节就能达到同样的质量。这表明目前的重大障碍不在于让图像看起来好看,而在于如何让文件足够小,从而具备实用性。第三个挑战研究了实时流式传输这些动态场景的任务,事实证明这项任务要困难得多。用于流式传输的方法在处理仅两秒钟的视频时,竟然需要数百秒的处理时间,且视觉质量较静态测试有了明显的下降,这凸显出同时处理移动摄像机和移动物体仍然是一个难题。
最后两个挑战解决了压缩这一关键问题,即如何在不丢失细节的情况下缩小这些庞大的 3D 模型。研究团队并没有测试特定的新方法,而是定义了前馈压缩任务,并提供了参考率失真公式以及初步的基准评估,以引导未来的参与者。这种方法对于速度至关重要的现实应用场景非常关键,因为它建立了一个标准,使系统能够在单次处理中完成数据压缩,而无需每次都重新学习或针对特定场景进行优化。测试表明,虽然这些压缩方法可以成功减小文件大小,但目前的性能与广泛应用的需求之间仍存在显著差距。研究人员发现,其基准测试的合成特性使他们能够清晰地看到这些低效之处,且不受真实世界摄像机误差噪声的影响。他们证明了其新的测试套件可以有效地评估标准压缩技术和较新的基于学习的方法,为未来的改进提供了一条清晰的路径。
最终,这项工作并不声称已经解决了 3D 视频传输的问题,而是提供了准确衡量进展所需的必要工具。通过提供一个具有精确地面真值(ground truth)的受控环境,M3ISR 基准测试允许科学家公平地比较不同的方法,确保在追求速度或存储容量的提升时,不会以牺牲视觉质量为代价。研究结果表明,虽然渲染这些场景的技术正在趋于成熟,但用于存储和传输它们的系统仍处于早期发展阶段。该基准测试作为一个严谨的标尺,帮助业界明确了解瓶颈究竟在哪里,并引导未来的研究向着既具有视觉冲击力又具备高效实用性的方向发展。
技术摘要:M3ISR
问题陈述
高保真自由视角视频(FVV)和交互式渲染日益依赖于显式的高斯表示,例如 3D 高斯泼溅(3DGS)及其动态扩展(4DGS)。然而,实际部署受到表示规模、动态更新复杂度和计算成本的限制。现有的多视图视频和神经场景表示基准测试存在特定的局限性: