想象一下,你正试图在一段视频中,为一辆行驶中的汽车寻找放置贴纸的最佳位置。在视频压缩(如 VVC 标准)的世界里,这个“贴纸”就是对下一帧图像中某个部分位置的预测。
问题:穷举搜索
目前的这种方法被称为 MMVD(带运动矢量差值的合并模式),它就像一个拒绝猜测的侦探。它不去挑选一个可能的地点,而是检查每一个微小的位移(上、下、左、右以及各种距离),以观察哪种位移能让画面看起来效果最好。
虽然这确保了高质量,但速度极其缓慢。这就像为了找到那个正确的音符,而去检查钢琴上每一个键,即便你心里清楚那个音符就在中间附近。这种“穷举搜索”使得视频编码(即压缩视频的过程)耗时过长,这对于直播或低延迟应用来说是非常不利的。
解决方案:“滤波差值”捷径
本文的作者们提出了一个聪明的捷径。他们没有去检查每一个按键,而是利用一种“数学直觉”来决定哪些按键是绝对“错误”的,从而在按下它们之前就将其排除。
以下是他们如何实现这一点的,我们使用一个简单的类比:
草稿与精调:
- 常规合并(Regular Merge): 想象你有一张汽车位置的粗略草图。
- MMVD: 这是精调过程,通过轻微移动草图的位置来达到完美匹配。
- 窍门: 作者们发现,用于“移动”草图的工具(称为插值滤波器)与用于绘制粗略草图的工具非常相似。它们如此相似,以至于你可以用一个简单的两部分工具来近似模拟那个复杂的八部分工具。
梯度测试(“斜率”检查):
- 将视频图像想象成一个充满山丘和谷底(明亮区域和黑暗区域)的地形。
- 作者们观察汽车所在地形的斜率(梯度)。
- 他们计算粗略草图的误差与地形斜率之间的快速“点积”(一种简单的数学乘法)。
- 规则: 如果数学结果显示:“嘿,朝这个方向移动草图实际上会让误差变得更糟或者保持不变,”他们会立即跳过那个方向。他们不会浪费时间去检查它。
处理“边缘情况”:
- 有时,移动草图会使其跨越参考数据发生变化的“边界”。作者们创建了一条特殊的规则来处理这种偏移,而无需重新进行繁重的数学计算。他们只需翻转一个符号或稍微调整计算方式即可。
智能工程(“十字形”结构):
- 为了让这个捷径更快,他们并不会检查整个图像块。他们只检查中间穿过的一个十字形条带(水平移动时检查中间行,垂直移动时检查中间列)。
- 这就像通过只触摸墙壁中心来测量房间温度,而不是测量地板和天花板的每一寸空间。这种方法既快速,又足以做出准确的判断。
结果:提速而不失质
团队在 VVenC 编码器(一种特定的视频编码软件)上测试了这种新方法。
- 之前: 在现有的加速技术之后,编码器仍需检查约 21% 的所有可能“移动”选项。
- 之后: 使用了他们的新方法后,仅需检查约 11%。
- 收获: 他们将搜索时间缩短了一半(显著降低了“效能-质量”指标),同时保持了几乎完全相同的视频质量。
总结
本文介绍了一种用于视频压缩的“智能滤波器”。它不再盲目地尝试对运动物体进行每一次可能的微调,而是快速分析图像的纹理和当前的预测误差。如果数学逻辑表明某种特定的调整没有帮助,算法就会直接跳过它。这使得视频编码速度大幅提升,且不会牺牲视觉质量,是实时视频应用的理想工具。
技术摘要:通过滤波器差分分析加速 VVenC 中的运动矢量差值合并(MMVD)
问题陈述
运动矢量差值合并(MMVD)是通用视频编码(VVC)中用于增强运动预测准确性的关键工具,旨在通过方向性偏移量和距离来精细化基础运动矢量。然而,标准的实现依赖于对所有方向-距离组合(四个方向和八个距离步长)进行穷举搜索,这带来了巨大的计算负担。在 VVenC 编码器中,启用 MMVD 会使“faster”预设下的编码时间增加约 36.39%,在“fast”预设下增加 21.20%。这种开销阻碍了 MMVD 在低延迟场景中的应用。现有的 VVenC 快速搜索策略虽然减轻了这一负担,但仍需评估大量的候选对象,特别是四分之一像素的 MVD 候选对象,它们占据了总尝试次数的 60%–80%。
方法论
作者提出了一种新型的快速 MMVD 算法,该算法利用分数运动矢量滤波器差分分析来估计 MMVD 候选对象的潜在编码增益,从而实现对无望搜索路径的早期终止。核心方法包括以下步骤:
- 滤波器近似:该方法使用轻量级的 2 抽滤波器来近似 VVC 中标准的 8 抽插值滤波器。这种简化使得常规合并预测与 MMVD 预测之间的差异可以通过空间梯度进行建模。
- 残差-梯度准则:
- 对齐支持情况(Aligned-Support Case):当 MMVD 偏移量不改变整数位置的参考样本时,预测之差可近似为参考块的空间梯度(gref)与常规合并候选对象的残差(ei)的函数。如果内积项 −αi,j⟨ei,gref⟩≥0,则表示该 MMVD 候选对象不太可能比常规合并产生更低的失真,从而跳过该候选对象。
- 偏移支持情况(Shifted-Support Case):当偏移量跨越整数样本边界时,支持区域会发生移动。作者通过对滤波器差分进行分解,并对梯度应用简单的 2 抽滤波器,将准则进行了泛化处理,从而避免了对参考块进行直接的 3 抽滤波。
- 二维可分滤波:将 1D 分析扩展到 VVC 的 2D 可分插值。由于 MMVD 仅搜索正交方向,交叉项会消失,因此可以将残差-梯度准则独立地应用于水平和垂直偏移。
- 实现优化:为了最大限度地减少该方法本身带来的开销,引入了两种优化措施:
- 对称偏移推断:对于对称偏移(例如 +Δ 和 −Δ),通过对齐支持情况的响应进行符号反转来推断偏移支持情况的响应,从而减少冗余计算。
- 十字形降采样点积:计算不再是对整个块进行点积,而是限制在一个中心十字形区域内(水平偏移对应中间行,垂直偏移对应中间列)。
核心贡献
- 新型准则:推导了一种基于空间梯度和预测残差的轻量级准则,用于在无需穷举搜索的情况下估计 MMVD 增益。
- 泛化能力:扩展了该准则以适应偏移整数参考样本和 2D 可分滤波的情况,覆盖了实际的 VVC 场景。
- 工程优化:引入了对称偏移推断和高效的点积计算,以确保加速方法本身的复杂度极低。
- 集成性:将所提算法无缝集成到现有的 VVenC 快速搜索框架中(结合 Fast1、Fast2 和 Fast3 策略)。
实验结果
实验使用 VVenC-1.14.0 编码器,涵盖四种预设(faster, fast, medium, slow)以及标准测试序列(JVET CTC Classes A1, A2, B, C, D)。
- 搜索减少:所提方法将平均 MMVD 搜索比例从 21.07%(使用现有快速策略时)降低至 11.05%。
- 复杂度与性能:在“fast”预设下,编码时间开销从 4.52%(现有快速策略)降低至 2.23%。
- 效率指标 (η):效率-复杂度指标 η(单位 BD-rate 增益所对应的编码时间开销)显著提升。对于“fast”预设,η 从 11.79(现有快速策略)下降至 7.10。在其他预设中也观察到了类似的改进。
- 编码增益:在结合所提剪枝方法后,该方法保留了 MMVD 提供的大部分编码增益,与全搜索基准相比,BD-rate 损失可以忽略不计。
意义与声明
论文声称,与现有的 VVenC MMVD 加速方案相比,所提算法在编码复杂度与率失真(RD)性能之间实现了更优的权衡。通过利用滤波器差分分析有效地剪枝掉不太有希望的候选对象,该方法在不牺牲编码效率的前提下,显著降低了 MMVD 的计算负载。作者指出,目前的实现仅支持标准的四个正交方向,并计划在未来的工作中扩展该方法以支持具有灵活对角线角度的 MMVD 模式。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。