← 最新论文
🤖 machine learning

PhyCo: Learning Controllable Physical Priors for Generative Motion

PhyCo 是一个通过利用大规模仿真数据集、基于 ControlNet 的物理监督微调以及大语言模型引导的奖励优化,来增强视频扩散模型的可控性与物理一致性运动的框架,从而在推理阶段无需模拟器或几何重建即可生成逼真的物理行为。

原作者: Sriram Narayanan, Ziyu Jiang, Srinivasa Narasimhan, Manmohan Chandraker

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Sriram Narayanan, Ziyu Jiang, Srinivasa Narasimhan, Manmohan Chandraker

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一部电影,其中有一个球在弹跳、一个箱子在滑动,或者一个人在蹦床上跳跃。在当今大多数由人工智能生成的视频中,这些运动往往感觉“不对劲”。球可能像幽灵一样漂浮,以错误的能量弹跳,或者在地板上滑行,仿佛它是由冰制成的,而实际上它应该是橡胶的。人工智能非常擅长让事物看起来真实(颜色、光线),但它并不完全理解事物如何根据物理定律运动

PhyCo 是一个旨在解决这一问题的新系统。你可以把它想象成给人工智能提供了一份“物理作弊表”,使其能够生成物体行为完全符合现实世界规律的影片。

以下是 PhyCo 的工作原理,分为三个简单的步骤:

1. 训练营(数据集)

在 PhyCo 能够教导人工智能之前,它必须先自己学习游戏规则。研究人员构建了一个包含10 万段模拟视频的庞大库。

  • 类比:想象一个巨大的健身房,机器人在其中练习跌倒、弹跳和滑动。在这个健身房里,研究人员可以调节每个物体的“旋钮”。他们可以让球超级有弹性,让地板超级滑,或者让墙壁超级软。
  • 结果:人工智能观看这些视频,并学习到“如果我调高‘摩擦’旋钮,物体应该滑动得更少”,或者“如果我调高‘形变’旋钮,物体应该被挤压得更厉害”。这就建立了一个巨大的因果关系数据库。

2. 控制面板(ControlNet)

一旦人工智能观看了训练视频,研究人员就会给它一个特殊的控制面板

  • 类比:想象一款电子游戏,你可以在屏幕上绘制地图来告诉角色去哪里。使用 PhyCo,你可以绘制一张物理属性的“地图”。你可以在屏幕上涂画一个区域,表示“这个区域很粘”,或者“这个物体很重”。
  • 工作原理:人工智能利用这些地图来生成视频。它不再只是猜测物体如何运动,而是查看你的地图并说:“好的,你告诉我这是高摩擦,所以我会让物体缓慢滑动。”这实现了连续控制,意味着你可以平滑地调高或调低摩擦系数,而不仅仅是开启或关闭。

3. 严格教练(VLM 奖励优化)

即使有了控制面板,人工智能仍可能犯一些小错误。为了解决这个问题,研究人员添加了一位“严格教练”。

  • 类比:想象一位教练观看人工智能的练习视频,并提出具体问题:“那个球弹得够高吗?”“那个箱子滑得够远吗?”如果人工智能回答错误,教练就会给予“惩罚”(数学惩罚)以纠正其行为。
  • 魔力:这位教练是一个视觉 - 语言模型(VLM)。它不仅仅查看像素;它理解物理的概念。它读取视频并检查运动是否符合你设定的规则。如果你要求高弹跳,但球弹得太低,教练就会告诉人工智能再试一次。随着时间的推移,人工智能学会了取悦教练,从而生成的视频不仅在视觉上美观,而且在物理上是准确的。

PhyCo 能做什么?

该论文表明,PhyCo 可以处理:

  • 摩擦:让物体轻松滑动或粘在地面上。
  • 恢复系数(弹性):让物体像橡胶球一样弹跳,或像石头一样沉闷地撞击。
  • 形变:让软物体被挤压并反弹,而硬物体保持刚性。
  • :以特定的强度将物体推向特定方向。

重大胜利

最令人印象深刻的是,PhyCo 在一个模拟世界(“健身房”)中学习了所有这些,但它在现实世界中同样有效。你可以要求它生成一个人在蹦床上跳跃的视频,即使它在训练期间从未见过真实的蹦床,它也知道蹦床应该如何形变以及人应该如何弹跳,因为它学习了物理的原理

简而言之,PhyCo 教会人工智能停止猜测世界如何运动,转而理解支配它的规则,使我们能够创造出物理现象与画面一样真实的视频。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →