← 最新论文
💻 computer science

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

本文介绍了 VA-Judger,这是一种基于思维链(chain-of-thought)的奖励模型,该模型是在一个新的大规模人类偏好数据集(VAPref-10K)和一个全新的基准测试(VA-Judger-Bench)上训练而成的,旨在克服现有独立质量指标的局限性,从而提供更具连贯性且符合人类对齐的奖励,并显著提升通过强化学习进行的视听联合生成效果。

原作者: Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机不仅能绘制动态图像,还能创作出与之完全匹配的声音:树叶的沙沙声、火堆的噼啪声,或是房间里说话时那特定的音色。这就是音视频联合生成(joint video-audio generation)的前沿领域——在这个领域中,人工智能正在学习如何同时创造视觉场景与同步的声景。多年来,研究人员一直致力于教导这些系统生成让观众感到真实的内容。问题不仅仅在于制作清晰的图像或清脆的声音,而在于确保这两个元素作为一个统一、连贯的体验协同工作,从而契合正在讲述的故事。当视频中的一头奶牛试图弹奏吉他时,声音必须是笨拙的、带着哞哞声的拨弦,而不是完美的音乐和弦。如果计算机抓住了视觉细节却弄错了声音,或者音画略有不同步,这种幻觉就会破灭。直到现在,用于评判这些作品的工具就像是一组检查员,分别检查汽车的油漆、发动机和车轮,却忽略了汽车本身可能根本无法行驶这一事实。

一组研究人员引入了一种新方法来解决这种脱节问题。他们构建了一个名为 VA-Judger 的系统,旨在为人工智能充当批判性的眼睛和耳朵。该系统不再依赖于测量视频质量、音频质量和时序的独立且僵化的规则,而是学习像人类一样评估整个“整体包”。研究人员首先创建了一个庞大的比较库,收集了由不同计算机模型生成的数千对视听片段。对于每一对片段,人类标注员进行观看和聆听,决定哪一个感觉更好,并解释其中的确切原因。他们会记录一个片段是否更紧密地遵循了文字描述,唇形是否与言语同步,或者背景噪音是否自然。这些人类的选择构成了 VA-Judger 的训练场。

训练过程经过精心设计,旨在教会系统如何思考。首先,模型在简单的例子上进行学习,在这些例子中,好片段与坏片段之间的区别显而易见,就像学生学习区分清晰照片与模糊照片一样。一旦它掌握了给出结构化评论的形式,研究人员就会向它展示更难的情况,即两个片段的质量几乎完全相同。在这种情况下,模型必须学会识别细微的缺陷,例如音效的轻微延迟,或者手势与声音情感略有不符。为了确保模型是从人类的真理而非仅仅模仿模式中学习,研究人员使用了一个过滤步骤,由人类专家验证模型在这些困难配对上的选择,仅保留与人类判断一致的推理逻辑。最后,系统通过一个试错过程进行精炼,在此过程中,它会收到针对其每部分推理的具体反馈,从而鼓励它深入理解为什么一个视听配对成功而另一个失败。

这项工作的成果表明,新系统比以往的方法更贴近人类的偏好。在针对广泛现有工具(这些工具分别测量视频和音频)进行测试时,VA-Judger 被证明能更好地预测人类实际会喜欢哪一个片段。在一组涉及数百次比较的测试中,新系统的表现显著优于旧指标,旧指标经常会被那些视觉效果好但声音不对,或反之亦然的片段所迷惑。更重要的是,当研究人员使用 VA-Judger 来辅助训练视频生成模型时,输出结果得到了显著提升。新模型生成的片段不仅更清晰、更锐利,而且感觉更完整,也更忠实于原始故事。在面对面的对比中,人类观众选择经由这种新引导生成的片段的频率,是未经训练的基础模型的六倍以上,也是使用旧方法训练的模型中优选率的两倍以上。

这项工作表明,要让人工智能创造出真正令人信服的视频和音频,不能仅凭孤立特征的清单来评判。一个生成的场景之质量取决于视觉、听觉与叙事的无缝融合。通过利用人类观察者的细微反馈,教导计算机将这些元素结合起来进行评估,研究人员为生成那些感觉不像模拟、而更像捕捉到的真实瞬间的内容提供了一条路径。研究结果表明,创意人工智能的未来不在于更好的单个传感器,而在于能够理解全局的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →