想象一个这样的世界:计算机不仅能绘制动态图像,还能创作出与之完全匹配的声音:树叶的沙沙声、火堆的噼啪声,或是房间里说话时那特定的音色。这就是音视频联合生成(joint video-audio generation)的前沿领域——在这个领域中,人工智能正在学习如何同时创造视觉场景与同步的声景。多年来,研究人员一直致力于教导这些系统生成让观众感到真实的内容。问题不仅仅在于制作清晰的图像或清脆的声音,而在于确保这两个元素作为一个统一、连贯的体验协同工作,从而契合正在讲述的故事。当视频中的一头奶牛试图弹奏吉他时,声音必须是笨拙的、带着哞哞声的拨弦,而不是完美的音乐和弦。如果计算机抓住了视觉细节却弄错了声音,或者音画略有不同步,这种幻觉就会破灭。直到现在,用于评判这些作品的工具就像是一组检查员,分别检查汽车的油漆、发动机和车轮,却忽略了汽车本身可能根本无法行驶这一事实。
一组研究人员引入了一种新方法来解决这种脱节问题。他们构建了一个名为 VA-Judger 的系统,旨在为人工智能充当批判性的眼睛和耳朵。该系统不再依赖于测量视频质量、音频质量和时序的独立且僵化的规则,而是学习像人类一样评估整个“整体包”。研究人员首先创建了一个庞大的比较库,收集了由不同计算机模型生成的数千对视听片段。对于每一对片段,人类标注员进行观看和聆听,决定哪一个感觉更好,并解释其中的确切原因。他们会记录一个片段是否更紧密地遵循了文字描述,唇形是否与言语同步,或者背景噪音是否自然。这些人类的选择构成了 VA-Judger 的训练场。
训练过程经过精心设计,旨在教会系统如何思考。首先,模型在简单的例子上进行学习,在这些例子中,好片段与坏片段之间的区别显而易见,就像学生学习区分清晰照片与模糊照片一样。一旦它掌握了给出结构化评论的形式,研究人员就会向它展示更难的情况,即两个片段的质量几乎完全相同。在这种情况下,模型必须学会识别细微的缺陷,例如音效的轻微延迟,或者手势与声音情感略有不符。为了确保模型是从人类的真理而非仅仅模仿模式中学习,研究人员使用了一个过滤步骤,由人类专家验证模型在这些困难配对上的选择,仅保留与人类判断一致的推理逻辑。最后,系统通过一个试错过程进行精炼,在此过程中,它会收到针对其每部分推理的具体反馈,从而鼓励它深入理解为什么一个视听配对成功而另一个失败。
这项工作的成果表明,新系统比以往的方法更贴近人类的偏好。在针对广泛现有工具(这些工具分别测量视频和音频)进行测试时,VA-Judger 被证明能更好地预测人类实际会喜欢哪一个片段。在一组涉及数百次比较的测试中,新系统的表现显著优于旧指标,旧指标经常会被那些视觉效果好但声音不对,或反之亦然的片段所迷惑。更重要的是,当研究人员使用 VA-Judger 来辅助训练视频生成模型时,输出结果得到了显著提升。新模型生成的片段不仅更清晰、更锐利,而且感觉更完整,也更忠实于原始故事。在面对面的对比中,人类观众选择经由这种新引导生成的片段的频率,是未经训练的基础模型的六倍以上,也是使用旧方法训练的模型中优选率的两倍以上。
这项工作表明,要让人工智能创造出真正令人信服的视频和音频,不能仅凭孤立特征的清单来评判。一个生成的场景之质量取决于视觉、听觉与叙事的无缝融合。通过利用人类观察者的细微反馈,教导计算机将这些元素结合起来进行评估,研究人员为生成那些感觉不像模拟、而更像捕捉到的真实瞬间的内容提供了一条路径。研究结果表明,创意人工智能的未来不在于更好的单个传感器,而在于能够理解全局的系统。
技术摘要:VA-Judger:面向音视频联合生成的基于人类偏好反馈的奖励建模
问题陈述
本文解决了通过强化学习(RL)进行音视频联合生成模型后训练时的一个关键瓶颈:缺乏可靠且符合人类偏好的奖励信号。现有的方法(如 OmniNFT)通过聚合针对单一维度(例如视觉逼真度、音频质量、文本-视频对齐度和音画同步性)的独立评估指标来构建奖励。作者认为,这些指标无法捕捉驱动人类偏好的整体跨模态相干性和语义-时间一致性。因此,针对这些脱节的指标优化模型会导致“奖励作弊”(reward hacking),即模型生成的虽然在特定指标上得分很高,但在人类看来却显得不连贯、不符合提示词或情感不匹配。此外,单模态奖励模型(如仅图像或仅音频的评估器)无法评估声音在视觉语境下的合理性,也无法评估跨模态事件的同步性。
方法论
作者提出了 VA-Judger,这是一种思维链(CoT)全模态奖励模型,旨在通过结构化的、基于维度的推理来评估联合音视频生成。该方法由三个核心部分组成:
1. 数据构建:VAPref-10K
为了克服联合音视频任务中人类偏好数据稀缺的问题,作者构建了 VAPref-10K,这是一个大规模数据集,包含:
- 约 9,000 个提示词,源自 10,173 个真实世界的视频-音频片段(来自 YouTube、电影、电视),涵盖七个类别(如对话、音乐、电影氛围)。
- 10,300 个细粒度的成对比较,由三个开源最先进模型(HaCohen 等,2026;Low 等,2025;SII-GAIR 等,2026)生成。
- 难度感知切分(Difficulty-Aware Splitting): 数据集被分为“简单”对(模型之间存在明显的质量差距)和“困难”对(差异细微,通常是同一模型使用不同种子生成),以促进课程学习。
2. VA-Judger 模型架构
VA-Judger 被训练为输出结构化的 CoT 回复,而非标量分数。对于给定的提示词和两个视频-音频片段,模型会从五个特定维度进行评估:
- (A) 提示词对齐度 (Prompt Alignment)
- (B) 音画一致性 (Audio-Visual Consistency)
- (C) 音频质量 (Audio Quality)
- (D) 视频质量 (Video Quality)
- (E) 完整性与连贯性 (Completeness and Coherence)
模型会为每个维度分配 1–10 的分数并给出理由,随后进行聚合,并输出最终的成对偏好。
3. 三阶段训练流水线
训练过程遵循渐进式策略,以确保模型既能学习输出格式,又能学习细微的人类偏好:
- 第一阶段:简单冷启动(格式蒸馏): 模型从 Qwen3-Omni 初始化,并在使用 Gemini 3.1 生成的结构化推理轨迹的“简单”对上进行训练。这建立了输出规范和基础的偏好辨别能力。
- 第二阶段:困难偏好对齐(拒绝采样): 对于质量差距细微、Gemini 判断不可靠(与人类一致性仅 60%)的“困难”对,作者使用人类标注员来选择更优的片段并识别支持维度。Gemini 会生成 CoT 解释,但只有当其最终偏好与人类标签一致时,才会通过拒绝采样保留下来。这产生了 4,500 个经过验证的样本用于微调。
- 第三阶段:维度级强化学习(GRPO): 为了超越单纯的模仿,作者采用了组相对策略优化(GRPO)。其奖励函数不是单一的二元标签,而是由以下部分组成的复合体:
- 答案奖励(Answer Reward): 最终偏好判断的正确性。
- 维度奖励(Dimension Reward): 分配的维度分数与人类识别出的偏好理由之间的一致性。
这鼓励模型开发出忠实的跨模态推理能力,而不是学习通过猜测胜者来走捷径。
核心贡献
- VAPref-10K 数据集: 首个专门为联合音视频生成定制的大规模人类偏好数据集,包含约 9K 个提示词和 10.3K 个由三个开源视频-音频生成模型生成的成对比较。
- VA-Judger 模型: 一种思维链全模态奖励模型,是首个探索使用人类反馈进行联合音视频生成奖励建模的模型。它通过将反馈分解为维度级推理,提供了更密集的优化信号。
- VA-Judger-Bench: 一个用于根据人类偏好评估奖励模型的新基准,包括领域内和领域外(包含 Sora 2 和 Veo 3.1 等闭源模型)的划分。
- 维度级 RL: 一种新颖的训练策略,同时验证最终决策及其底层的推理维度,防止模型将其推理过程与结论脱节。
实验结果
- 奖励模型评估: 在 VA-Judger-Bench 上,VA-Judger 在预测人类偏好方面的准确率达到 68.43%,显著优于单维度指标(范围在 50–56% 之间)和基础全模态模型。与基于指标的基准相比,它在领域外对上表现出卓越的泛化能力。
- 后训练生成: 当用于后训练 LTX-2 生成模型时,VA-Judger 带来了实质性的提升。在 JavisBench 子集上,经 VA-Judger 训练的模型在 13 个报告指标中有 11 个优于基础 LTX-2 和 OmniNFT 训练的模型。
- 人类评估: 在一项包含 200 个提示词的三选一强制选择研究中,VA-Judger 后训练模型被人类参与者选中的比例为 62.30%,而 OmniNFT 为 27.63%,基础 LTX-2 为 10.08%。这证实了这些改进在人类感知层面是显著的,而非仅仅是指标优化带来的伪影。
意义与主张
本文声称,VA-Judger 为联合音视频生成提供了更具可解释性且符合人类偏好的后训练基础步骤。通过从脱节的专家指标转向整体的、基于人类偏好的奖励信号,作者证明了生成不仅在单模态上高质量,而且在语义上连贯且在时间上与人类判断同步的音视频内容是可行的。这项工作强调,针对狭隘指标进行优化会导致输出不连贯,而基于人类对齐的奖励建模能有效缓解奖励作弊,并提高生成模型的整体保真度。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。