What Do Audio-Visual Synchronization Metrics Actually Measure?
本文在统一的可靠性协议下审计了四种常见的音画同步指标,揭示了它们衡量的是同步的不同方面而非单一统一的概念,并因此建议报告一份综合性的“可靠性卡”,而非依赖于单一的分数。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,机器正在学习如何创作包含声音的视频,或者生成与运动画面完美匹配的声音。这是一项复杂的任务,因为计算机必须确保雷声在闪电出现的瞬间精准发生,或者歌手的口型与他们演唱的音符同步。为了教导这些机器并判断哪些机器做得最好,研究人员依赖于自动评分系统。这些系统充当裁判的角色,为一段视频分配一个单一的数字,以说明音画同步的程度。数字越高,匹配度越好。这个单一的分数被用于对不同的 AI 模型进行排名,甚至用于训练它们,引导软件如何改进。如果裁判不可靠,训练过程可能会出错,导致机器去优化错误的目标。
多年来,科学界一直使用几种不同的评分系统来执行这项工作,但很少有人检查这些裁判之间是否达成一致,或者它们是否真的测量了它们声称要测量的东西。弗吉尼亚理工大学和埃森哲(Accenture)的研究人员进行的一项新研究决定对这些评分系统进行“显微镜式”的审查。他们没有将这些指标视为完美的工具,而是将其视为需要审计的仪器。研究人员想知道,如果他们故意破坏视频的定时,这些分数是否会发生可预测的变化;如果视频被轻微缩放或裁剪,分数是否能保持稳定;以及不同的评分系统是否会对哪些视频是好的、哪些是坏的达成共识。
研究人员选取了一系列真实的、同步良好的视频剪辑,并创建了一系列受控的误差。他们将音频稍微提前或延后,加速音频,打乱视频片段,或者短暂地静音。因为他们确切知道自己对每个剪辑做了多少改动,所以他们拥有一个完美的“地面真值”(ground truth)来进行对比。然后,他们将这些经过修改的剪辑运行在领域内最常用的四个评分系统中。目标很简单:一个好的评分系统应该随着误差的增加而给出更低的分数,且呈现出平滑且一致的曲线。
结果揭示了这些工具能力中令人惊讶的分歧。没有哪一个评分系统是全能的。其中一个系统利用学习到的模型来预测声音与图像之间的精确时间差,它在检测简单的定时偏移方面表现得异常出色。当音频延迟了极小的一瞬间时,这个系统能立即察觉并给出较低的分数。然而,当研究人员引入更复杂的问题,如打乱视频片段或使声音静音时,这个系统就显得力不从心。它就像一个专门研究时间测量却对内容变化感到困惑的专家。
相比之下,其他侧重于声音与图像之间的整体含义和视觉相似性的评分系统,在识别这些内容破坏方面表现得更好。它们察觉到了视频被打乱或声音被切断的情况,但在处理微小的定时误差时敏感度较低。研究发现,这些不同的系统经常在彼此之间产生分歧。当研究人员要求它们对同一组视频进行排名时,这些系统给出的顺序经常不同,彼此之间的共识度非常低。事实上,这种分歧程度之高,以至于如果没有人类观察者,几乎无法判断哪个系统才是正确的。
研究人员还测试了这些系统是否能够处理两个非常相似的 AI 模型之间的细微差别。在现实世界中,开发者通常有两个几乎完全相同的模型版本,并且需要知道哪一个稍好一些。研究表明,对于大多数评分系统来说,这些相似模型之间的微小差距都会消失在噪声中。分数的波动如此之大,以至于这些系统无法可靠地分辨出更好的模型还是较差的模型。只有那个专门负责定时的系统能够一致地分离两者,但它无法捕捉到其他系统所注意到的更广泛的质量问题。
或许最重要的一点是,研究人员尝试将所有这些不同的分数合并为一个“大师级分数”,希望通过混合多种方法来创造一个完美的裁判。他们使用了数学方法来融合结果,但这并没有奏效。组合后的分数并不比其中表现最好的单个系统更好。这表明问题不仅仅是缺乏数据,而是这些系统测量的东西有着本质的区别。一个系统测量事件的精确定时,而另一个系统测量场景的整体和谐感。由于它们观察的是视频的不同方面,因此无法轻易地合并成一个数字。
该研究得出结论,该领域需要停止依赖单一的同步分数来评判 AI 模型。相反,研究人员建议采用一种名为“可靠性卡片”(Reliability Card)的新方法。这将是一份报告,列出模型在不同类型的误差下的表现,清晰地展示其优势和劣势。例如,一个模型可能在保持时间方面表现出色,但在处理复杂场景方面较差。通过以置信区间的方式报告这些细节,开发者和研究人员可以针对特定任务做出明智的决策。研究结果表明,虽然我们拥有强大的音画同步测量工具,但我们必须明白,没有任何单一工具能讲述完整的故事,仅仅信任一个数字可能会导致误导性的结论。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。