Predicting total time to compress a video corpus using online inference systems
本文提出并评估了一种新型在线机器学习框架,该框架能够预测整个视频语料库的总转码时间,且误差在5%以内,证明了其准确度显著高于以往的单片段预测方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在经营着一个巨大的数字图书馆,人们不断地把成千上万个视频文件送过来进行缩减。这个过程被称为“压缩”:你必须像折叠行李箱一样,把视频数据进行折叠和挤压,使其占用的空间更小,但视频越难“折叠”(即运动速度快或纹理复杂),所需的时间就越长。在云计算的世界里,准确知道这项“打包工作”要花多久时间至关重要。这能帮助公司确定需要消耗多少电力,更重要的是,确定该向客户收取多少费用。目前,大多数系统就像一个蒙着眼睛的厨师:只有在你吃完饭后,才会告诉你这顿饭的价格。这让预算控制变成了一场噩梦。科学家们曾尝试预测每一个单独视频剪辑的时间,但这就像试图通过称量每一块砖头的重量来猜测整卡车砖头的总重量一样。这种方法太慢了,而且误差会不断累积。大问题在于:我们能否在任务还没完成之前,就预测出整个视频堆的总耗时?我们能否在过程中变得越来越聪明?
这篇由都柏林圣三一学院团队撰写的论文,正是针对这一问题展开研究的。他们没有尝试逐一预测每个视频剪辑的时间,而是构建了一种新型的“智能计算器”,用于预测整个视频集合(或称“语料库”)所需的总时间。他们发现,观察大局比盯着局部细节要有效得多。事实上,他们预测整个群体总时间的方法,其准确度比传统的逐个预测单个剪辑的方法高出两倍多。
以下是他们的系统是如何运作的,我们用一个有趣的类比来解释。想象你是一名建筑工地的工头,负责粉刷 600 个不同的房间。有些房间很小且墙面平整;有些房间则很大,且布满了复杂的壁画。
- 旧方法(单剪辑预测): 你试图在开工前猜出粉刷每一个房间需要多长时间。你可能会猜壁画房需要 10 小时,而储藏室只需要 1 分钟。但如果你有一个猜错了,你对整个工程的总估算就会出现偏差。
- 新方法(语料库预测): 你开始粉刷。在完成仅仅一小部分工作(比如 2%)后,你会停下来观察已完成的工作。你会意识到:“嘿,我目前粉刷的这些房间平均每个要花 15 分钟。”然后,你会利用这些现实世界的数据来预测剩下 588 个房间所需的时间。
作者使用两种不同的“粉刷工具”(称为视频编解码器的 x264 和 x265)以及一个包含 600 个高质量 4K 视频剪辑的海量数据集测试了这个想法。他们不仅仅是在做猜测,他们构建了一个会随着进度学习的系统。他们称之为“在线推理(online inference)”。这就像是一个 GPS 导航,每当你经过一个新的地标,它都会更新你的路线和预计到达时间,而不是只在开始时给你一张静态地图。
他们测试了几种策略:
- “进度条”猜测: 这是最简单的方法。它仅仅假设剩余的视频将花费与已完成视频相同的平均时间。这种方法还可以,但并不出色。
- “分组”猜测: 这种方法根据视频看起来有多复杂(类似于根据房间是有壁画还是平整墙面进行分类)将视频分成不同的组(簇)。它会分别预测每个组内剩余房间所需的时间。这种方法更好。
- “超级大脑”猜测(机器学习): 这使用了名为 XGBoost 的智能算法。它观察你已经处理过的视频细节,并从中学习复杂的模式,以预测剩余部分。
结果令人惊讶且印象深刻。作者发现,你并不需要为了整个任务全程使用“超级大脑”。事实上,最好的策略是一种“混搭”方法:
- 开始之前: 使用一个通用的“超级大脑”模型来获得一个大致的想法。对于 x264 工具,这个预测值与总时间的误差约为 13.5%。
- 完成 2% 后: 切换到能够“边做边学”的在线“超级大脑”。这使得误差降至约 8.75%。
- 完成 6% 后: 切换到更简单的“分组”方法。令人惊讶的是,这种简单的方法变得更加准确,误差降至 5% 以下(x264 为 4.89%,x265 为 5.11%)。
论文明确反对了“需要一个基于所有数据训练的单一复杂模型才能获得良好结果”的观点。他们证明,一旦实际工作开始,通用模型(从其他来源训练得到的模型)的表现反而较差。他们还证明,你不需要等到任务完成 50% 或 90% 时才能获得良好的估算;在处理了极小比例的视频后,你就能获得非常准确的预测(误差小于 5%)。
该团队在一台拥有 64 个核心的强大计算机上进行了测试,处理了 600 个时长为 2 秒或 4 秒的剪辑。他们发现,运行这些预测所需的“脑力”微乎其微——为整个过程增加了不到 0.2% 的额外时间。这意味着该系统足够快,可以实时使用,而不会拖慢实际的视频压缩速度。
简而言之,这篇论文表明,对于预测大规模视频任务需要多长时间,做一个“学习型工头”比做一个“水晶球”效果更好。通过观察一小部分工作并随着进度调整你的猜测,你可以比尝试预先预测每一个步骤获得更高的准确度。这有助于云服务公司节省成本,并让客户在工作开始之前就清楚地知道自己要支付多少费用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。