Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models
本文引入了一种用于生成式音视频模型的无参考评估框架,该框架通过利用一个生成失败数据集、一个改进的 Omni-LLM 以及实值组相对策略优化(Real-Valued Group Relative Policy Optimization),解决了人类相对感知与绝对自动化指标之间的悖论,从而在评估跨模态同步性方面实现了与人类偏好最先进的一致性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在看一部电影,其中一只狗在吠叫,但发出的声音却像个吱吱作响的玩具;或者玻璃破碎时,传出的却是水球爆裂的声音。在 AI 的世界里,这些“世界模拟器”在制作图像和声音方面正变得极其出色,但它们经常在“物理规律”上出错。它们可能会做出与动作不符的声音,或者完全忘记制作某个声音。
长期以来,科学家们试图通过玩一个简单的“找延迟”游戏来检查这些 AI 电影是否“同步”。他们会将一段完美的音频向左或向右移动一点点,然后观察计算机能否发现差异。但本文作者说:停下吧! 这就像是在试图通过判断一个人能否分辨同一罐子里的盐和糖来评价一位厨师。这行不通,因为现代 AI 不仅仅是时间对不上,它们连“故事”都讲错了。它可能会凭空创造出一个从未发生过的声音,或者漏掉一个本该存在的音效。
核心问题:“相对”与“绝对”的悖论
这是作者必须解决的棘手问题。当人类观看两个糟糕的 AI 视频时,很容易说:“视频 A 比视频 B 更好。”我们非常擅长比较事物。但如果问我们给视频 A 单独打一个百分制的分数(在没有任何对比对象的情况下),我们就会感到困惑。我们可能今天说“70分”,明天说“85分”。
然而,为了构建一个能在互联网上工作的机器人裁判,我们需要一个绝对分数。我们需要一个数字,无论存在哪些其他视频,都能明确表示“这个视频是 72.4 分”。论文指出,我们不能仅仅向人类索要一个数字,我们必须教会机器如何将我们的“更好/更差”的感觉转化为“72.4”这个数字。
解决方案:一种新型机器人裁判
团队构建了一个三步走的系统来解决这个问题,他们称之为 Beyond Time Shifts(超越时间偏移)。
1. “SynthSync”游乐场(数据集)
他们没有通过平移音频来伪造错误,而是创建了一个名为 SynthSync 的游乐场。他们提取了真实的视频,并让 10 种不同的 顶尖 AI 音频生成器对其进行处理。这产生了一堆“真实的失败案例”。
- 类比: 想象一下,要求 10 位不同的厨师 根据同样的食谱制作汤。有些厨师把大蒜烧焦了,有些忘了放盐,有些加了太多胡椒。作者不仅观察了汤的味道,还要求人类专家进行两两对比,并说:“厨师 A 的汤比厨师 B 的好。”他们通过 306,000 次 这样的对比,构建了一张庞大的“谁优于谁”的地图。
2. 拥有新大脑的“Omni-LLM”
他们采用了一个超智能 AI 模型 Omni-LLM(具体为 Qwen2.5-Omni-3B),并给了它一份新工作。通常,这个 AI 会输出像“好”或“坏”这样的词汇。作者拆除了那个文字生成器,取而代之的是一个连续滑块。
- 类比: 这个 AI 不再大喊“好!”或“坏!”,而是现在输出一个平滑的、单一的数值。他们利用来自 SynthSync 游乐场的“更好/更差”数据来训练它。他们使用了一种叫做 Bradley-Terry-Luce 的数学技巧,来教导 AI:如果它认为厨师 A 比厨师 B 好,那么 A 的分数就应该高于 B。
3. “R-GRPO”魔术技巧(强化学习)
这是核心秘诀。仅仅知道“A 比 B 好”是不够的;AI 需要理解整个群体。如果厨师 A 是最好的,厨师 B 是中等的,而厨师 C 是最差的,那么分数必须完美遵循这个顺序。
- 类比: 想象 AI 是一个正在考试的学生。老师(R-GRPO 算法)不仅仅是检查他们是否答对了第一题,而是观察整份答案列表。它使用“高斯策略”(这只是一个说法,意指“加入一点随机噪声以进行探索”),来看 AI 是否能同时找到整组厨师的最优排名。
- 结果: 通过使用这种方法,AI 学会了给出与人类专家高度一致的分数。
实验结果(数据)
作者将他们的新型机器人裁判与旧的方法(如 AV-Align、JavisScore 和 DeSync)进行了对比测试。
- 旧方法: 旧的指标就像一把坏掉的尺子。即使声音完全是胡言乱语,只要时间点对上了,它们往往也会给出高分。
- 新方法: 他们基于 SynthSync 数据集训练并使用 R-GRPO 进行微调的新指标,实现了 72.38% 的成对准确率(Pairwise Accuracy)。这意味着在比较两个视频时,它与人类专家的意见一致率达到了 72.38%。
- 对比: 他们测试的次优方法仅获得了 69.36% 的准确率。
- 排行榜: 他们使用这个新裁判对 6 个 著名的 AI 视频模型(包括 Sora-2、Veo-3.1 和 LTX-2)进行了排名。他们的裁判清晰地显示,Sora-2 和 Veo-3.1 在理解物理规律方面表现最好,而其他模型则表现挣扎。
他们明确排除了什么
论文非常明确地说明了哪些做法是无效的:
- 时间偏移(Time Shifts): 他们认为,由于现代 AI 会产生“结构性幻觉”(即凭空捏造的声音),仅仅通过平移音频(旧的标准)是毫无意义的。
- 离散词汇(Discrete Words): 他们发现,让 AI 输出“好”或“差”等词汇(使用文本生成)效果很差。这会产生“量化伪影”,意味着分数跳跃太大,不够平滑。
- 简单回归(Simple Regression): 他们尝试直接训练 AI 去预测一个数字(回归),但失败了,其 Kendall's τ(衡量排名匹配程度的指标)仅为 0.1628。而他们的新方法达到了 0.4899。
结论有多可靠?
作者对结果非常有信心,因为他们不仅是靠直觉,而是通过测量得出的。
- 他们构建了一个名为 SyncBench 的标准化基准测试,包含 185 个 不同的提示词(如“锯木头”、“下雨”或“摩托车”)。
- 他们测试了该指标作为“奖励信号”(一种告诉 AI 如何改进自身的方法)的效果。在跨指标测试中,当他们使用该指标从一组候选视频中挑选出最佳 AI 视频时,其表现比随机猜测好 5.0589 倍。
- 他们证明了该方法的有效性:通过展示当移除 R-GRPO 训练步骤时,分数显著下降(从 72.38% 降至 71.07%),从而证明了系统的每个部分都是必不可少的。
简而言之,这篇论文表明,要评判 AI 电影,我们不能只寻找延迟,我们需要一个能够理解声音与视觉背后“故事”的裁判。通过将人类“更好/更差”的感觉转化为一个平滑的连续数字,他们终于打造出了一个能以人类视角看待世界的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。