← 最新论文
🤖 AI

DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation

本文提出了 DiReCT 框架,通过解耦语义与物理行为并构建宏微观对比轨迹,有效解决了文本条件视频生成中的语义 - 物理纠缠与梯度冲突问题,从而在不增加训练时间的前提下显著提升了生成视频的物理常识性。

原作者: Abolfazl Meyarian, Amin Karimi Monsefi, Rajiv Ramnath, Ser-Nam Lim

发布于 2026-03-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Abolfazl Meyarian, Amin Karimi Monsefi, Rajiv Ramnath, Ser-Nam Lim

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 DiReCT 的新方法,旨在解决当前 AI 视频生成模型中一个非常有趣但棘手的问题:AI 生成的视频看起来很像真的,但动起来却经常违反物理常识。

为了让你轻松理解,我们可以把 AI 视频生成想象成教一个天才画家画画,而这篇论文就是给这位画家请了一位**“物理学家教练”**。

1. 核心问题:画得像,但动得假

现在的 AI(比如 Wan 2.1)非常擅长根据文字描述(比如“一辆车在雨中行驶”)画出每一帧画面,画面很清晰,时间也很连贯。但是,它们不懂物理定律。

  • 例子:如果提示词是“一个球掉在地上”,AI 可能会画出球落地后加速弹起(违反重力),或者两个物体互相穿过(像幽灵一样,违反固体碰撞)。
  • 原因:以前的训练方法就像让画家“死记硬背”每一帧的样子。它只关心“这一帧画得像不像”,而不关心“这一帧的动作合不合理”。它不知道球落地应该减速,也不知道水应该往下流。

2. 之前的尝试:为什么“对比学习”会失效?

为了解决这个问题,研究人员尝试过一种叫“对比学习”的方法。

  • 通俗解释:这就像教学生时,不仅给他看正确的答案(正样本),还故意给他看错误的例子(负样本),让他知道“这个不对,要避开”。
  • 遇到的问题(语义 - 物理纠缠):在文字描述的世界里,**“内容”“物理动作”**是绑在一起的。
    • 比如,你想教 AI 区分“球弹性地弹起”和“球粘在地上不动”。
    • 如果你随机找一个错误的例子(比如“一只猫在跑步”),AI 会发现:“哦,猫和球完全不同,我只要把猫画得不像球就行了。”这没学到物理知识。
    • 如果你找一个很相似的错误例子(比如“球粘在地上”),AI 会困惑:“这两个画面太像了,我到底该往哪边改?是改画面内容,还是改物理动作?”
    • 结果:这种混乱导致 AI 在训练时“左右互搏”,不仅没学会物理,反而把原本画得很好的画面也搞坏了。

3. DiReCT 的解决方案:分两步走的“物理特训”

DiReCT(Disentangled Regularization of Contrastive Trajectories)就像一位聪明的教练,它把“教物理”这件事拆解成了宏观微观两个层面,专门解决上面的混乱问题。

第一步:宏观对比(拉开距离)——“别跟不相关的比”

  • 比喻:想象你在教学生区分“苹果”和“汽车”。
  • 做法:如果正样本是“苹果”,负样本就选“汽车”。这两个东西差别巨大,AI 很容易学会“苹果是圆的,汽车是方的”。
  • 作用:这保证了 AI 在大的方向上不会搞混,建立了清晰的“世界地图”。

第二步:微观对比(精准打击)——“只改一点点物理”

  • 比喻:这是 DiReCT 最厉害的地方。它不再随机找错误例子,而是专门制造“高难度陷阱”
  • 做法
    1. 它保留画面的所有细节(场景、物体、光线都不变)。
    2. 它只修改一个物理属性。比如,把“水像蜂蜜一样粘稠地流”改成“水像水一样快速流动”。
    3. 它让 AI 去区分这两个极度相似但物理逻辑相反的视频。
  • 作用:这就像让画家在画同一幅画时,必须精确控制笔触的轻重,而不是去改画什么物体。这让 AI 真正学会了物理规律(比如流体力学、碰撞反弹),而不是仅仅学会画不同的东西。

第三步:防止“忘本”(分布锚定)

  • 比喻:就像学新技能时,不能把原本擅长的基本功给忘了。
  • 做法:在训练过程中,时刻提醒 AI:“你原本画得很好的地方(比如光影、纹理)要保持住,只改物理动作。”
  • 作用:确保 AI 在学会物理常识的同时,不会变成“物理很准但画面很丑”的模型。

4. 成果如何?

经过这种特训,AI 的表现有了质的飞跃:

  • 更懂物理:在测试中,AI 生成的视频更符合常识。比如,木头在水里会浮着顺流而下,而不是像石头一样定在原地;冲浪者会保持身体平衡,而不是慢慢融化进海浪里。
  • 以小博大:他们用的模型只有 13 亿参数(1.3B),却打败了那些拥有 50 亿甚至 100 亿参数 的超级大模型。这说明,“懂物理”比“堆参数”更重要
  • 效率更高:不需要重新训练整个模型,只需要在原有模型上“微调”一下,就像给车换个更好的导航系统,而不是换引擎。

总结

DiReCT 的核心思想就是:不要试图一次性教 AI 学会所有东西,也不要让它面对混乱的对比。

它通过**“宏观拉开距离”“微观精准修改物理”这两招,巧妙地解开了“画面内容”和“物理动作”纠缠在一起的死结。这就好比给 AI 戴上了一副物理眼镜**,让它不仅能“看”到世界,还能真正“理解”世界是如何运作的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →