← 最新论文
💻 computer science

SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning

本文介绍了 SyncDPO,这是一种高效的训练后框架,它通过利用带有即时规则构建负样本和课程学习的直接偏好优化,来增强视频 - 音频联合生成中的时序同步性,从而克服传统监督微调的局限性。

原作者: Xin Cheng, Xihua Wang, Ying Ba, Yuyue Wang, Kaisi Guan, Yinbo Wang, Wenpu Li, Ruihua Song

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Xin Cheng, Xihua Wang, Ying Ba, Yuyue Wang, Kaisi Guan, Yinbo Wang, Wenpu Li, Ruihua Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人制作一部音画完美同步的电影。如果机器人看到一个人拍手,那么“啪”的拍手声必须在双手接触的那一毫秒准时响起。如果声音哪怕晚了一瞬间,整部电影就会显得虚假且令人不适。

本文介绍了一种名为SyncDPO的新训练方法,旨在解决 AI 视频生成器中的时序问题。以下是其工作原理的通俗拆解:

问题所在:“延迟”的机器人

目前,AI 模型在制作“看起来”真实、“听起来”大体正确的视频方面表现出色。然而,它们在时序上往往力不从心。

  • 类比:想象一台糟糕的卡拉 OK 机器,歌手的歌声与音乐略微不同步。你能听到歌词,也能听到音乐,但它们对不上号。
  • 旧方法(SFT):过去,为了解决这个问题,工程师们使用一种称为“监督微调”(Supervised Fine-Tuning)的方法。想象一下,这就像老师向机器人展示一部正确的电影,并说:“试着让你的视频看起来和这部完全一样。”机器人试图复制画面和声音,但由于“时间稍有偏差”的惩罚力度太小,机器人会不断犯下微小的时序错误。这就像一个知道答案是"5"的学生,却总是写成"5.001",因为老师没有严格纠正小数点后的数字。

解决方案:“错误示例”课程

作者们意识到,要教会机器人完美的时序,你不仅需要展示正确的答案,还需要展示错误的答案,并告诉它:“这很糟糕,别这么做。”

他们使用了一种名为**直接偏好优化(Direct Preference Optimization, DPO)**的技术。

  • 类比:与其只给机器人展示一部完美的电影,不如给它展示两个片段:
    1. 胜者:枪声在枪支发射的同一瞬间响起。
    2. 败者:枪声在枪支发射两秒后才响起。
      机器人会学到:“啊!我必须避免第二种情况。”这 sharpened 了它的时序感。

创新点:即时生成“错误示例”

通常,制作这些“败者”片段既昂贵又缓慢。你需要生成许多视频,等待人类进行排名,或者使用其他复杂的 AI 来找出那些糟糕的样本。这就像雇佣一位影评人去观看 100 部烂片,只为找到一个时序错误的例子。

SyncDPO 通过扮演“基于规则的厨师”改变了游戏规则。
厨师不需要为了找一个坏例子而重新烹饪整道菜,而是直接拿完美的菜肴,利用简单的规则瞬间把它搞砸:

  • 加速:让视频变快但保持音频缓慢(或反之)。
  • 替换:从另一个视频中提取音频并粘贴到当前视频上。
  • 延迟:将声音向前或向后推移几秒。
  • 隐藏:静音部分音频或冻结部分视频。

这些“搞砸了”的版本是在数据加载过程中即时创建的。无需额外的人力,无需额外的等待,也无需额外的成本。

策略:“电子游戏”式方法(课程学习)

作者们还注意到,如果你一开始就给机器人展示极其明显的错误示例(例如 10 秒的延迟),它学得太容易了。但如果你从微小的错误开始(例如 0.1 秒的延迟),机器人会感到困惑且无法学习。

因此,他们采用了一种类似于电子游戏的**课程学习(Curriculum Learning)**策略:

  1. 第 1 关(简单):从明显的错误开始(例如将音频替换为完全不同的声音)。机器人学习“声音必须匹配画面”的基础知识。
  2. 第 2 关(困难):逐渐过渡到微妙的错误(例如稍微加快视频速度)。现在,机器人必须学习细粒度、精确的时序。

通过逐步增加难度,机器人最终成为了同步大师。

结果

该论文在四种不同类型的视频上测试了这种方法:

  • 人物对话(唇形同步)。
  • 枪声和爆炸声。
  • 动物发出的声音。
  • 一般环境音。

结果:
与以往的方法相比,SyncDPO 在音画对齐方面显著更优。

  • 它让“拍手”声在双手接触的瞬间准时响起。
  • 它让枪声在枪支发射的瞬间准时响起。
  • 即使面对它未曾见过的视频类型,它也能表现良好(泛化能力)。

至关重要的是,作者发现这种方法并没有降低视频或音频的质量;它只是让时序变得完美。甚至让人类观看结果后,人们一致更喜欢 SyncDPO 生成的视频,因为它们感觉更“真实”且更具沉浸感。

总结

简而言之,SyncDPO是一种更智能的训练 AI 进行音画同步的方法。它不仅仅是复制好的示例,而是通过简单的规则即时创建“坏”示例来教导 AI,从明显的错误开始,逐步进阶到微小、精确的错误。其结果是,AI 生成的视频中,声音与动作完美契合。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →