想象一下,你正在观看一部电影,其中有一个球在弹跳、一个箱子在滑动,或者一个人在蹦床上跳跃。在当今大多数由人工智能生成的视频中,这些运动往往感觉“不对劲”。球可能像幽灵一样漂浮,以错误的能量弹跳,或者在地板上滑行,仿佛它是由冰制成的,而实际上它应该是橡胶的。人工智能非常擅长让事物看起来真实(颜色、光线),但它并不完全理解事物如何根据物理定律运动。
PhyCo 是一个旨在解决这一问题的新系统。你可以把它想象成给人工智能提供了一份“物理作弊表”,使其能够生成物体行为完全符合现实世界规律的影片。
以下是 PhyCo 的工作原理,分为三个简单的步骤:
1. 训练营(数据集)
在 PhyCo 能够教导人工智能之前,它必须先自己学习游戏规则。研究人员构建了一个包含10 万段模拟视频的庞大库。
- 类比:想象一个巨大的健身房,机器人在其中练习跌倒、弹跳和滑动。在这个健身房里,研究人员可以调节每个物体的“旋钮”。他们可以让球超级有弹性,让地板超级滑,或者让墙壁超级软。
- 结果:人工智能观看这些视频,并学习到“如果我调高‘摩擦’旋钮,物体应该滑动得更少”,或者“如果我调高‘形变’旋钮,物体应该被挤压得更厉害”。这就建立了一个巨大的因果关系数据库。
2. 控制面板(ControlNet)
一旦人工智能观看了训练视频,研究人员就会给它一个特殊的控制面板。
- 类比:想象一款电子游戏,你可以在屏幕上绘制地图来告诉角色去哪里。使用 PhyCo,你可以绘制一张物理属性的“地图”。你可以在屏幕上涂画一个区域,表示“这个区域很粘”,或者“这个物体很重”。
- 工作原理:人工智能利用这些地图来生成视频。它不再只是猜测物体如何运动,而是查看你的地图并说:“好的,你告诉我这是高摩擦,所以我会让物体缓慢滑动。”这实现了连续控制,意味着你可以平滑地调高或调低摩擦系数,而不仅仅是开启或关闭。
3. 严格教练(VLM 奖励优化)
即使有了控制面板,人工智能仍可能犯一些小错误。为了解决这个问题,研究人员添加了一位“严格教练”。
- 类比:想象一位教练观看人工智能的练习视频,并提出具体问题:“那个球弹得够高吗?”“那个箱子滑得够远吗?”如果人工智能回答错误,教练就会给予“惩罚”(数学惩罚)以纠正其行为。
- 魔力:这位教练是一个视觉 - 语言模型(VLM)。它不仅仅查看像素;它理解物理的概念。它读取视频并检查运动是否符合你设定的规则。如果你要求高弹跳,但球弹得太低,教练就会告诉人工智能再试一次。随着时间的推移,人工智能学会了取悦教练,从而生成的视频不仅在视觉上美观,而且在物理上是准确的。
PhyCo 能做什么?
该论文表明,PhyCo 可以处理:
- 摩擦:让物体轻松滑动或粘在地面上。
- 恢复系数(弹性):让物体像橡胶球一样弹跳,或像石头一样沉闷地撞击。
- 形变:让软物体被挤压并反弹,而硬物体保持刚性。
- 力:以特定的强度将物体推向特定方向。
重大胜利
最令人印象深刻的是,PhyCo 在一个模拟世界(“健身房”)中学习了所有这些,但它在现实世界中同样有效。你可以要求它生成一个人在蹦床上跳跃的视频,即使它在训练期间从未见过真实的蹦床,它也知道蹦床应该如何形变以及人应该如何弹跳,因为它学习了物理的原理。
简而言之,PhyCo 教会人工智能停止猜测世界如何运动,转而理解支配它的规则,使我们能够创造出物理现象与画面一样真实的视频。
以下是论文《PhyCo:学习可控制的物理先验以生成运动》的详细技术总结。
1. 问题陈述
现代视频扩散模型在合成逼真的纹理、光照和运动连续性方面取得了显著成功。然而,它们在物理一致性方面存在严重困难。常见的失败案例包括:
- 物体在重力作用下以不切实际的速度漂移或下落。
- 碰撞缺乏逼真的反弹(恢复系数)。
- 软体物体未能根据材料属性发生形变。
- 缺乏可控性:虽然基础模型在海量数据集上进行了训练,但无法在不重新训练或依赖复杂外部引导的情况下,通过可控操纵来生成特定物理属性的变化(例如,改变摩擦系数或力的大小)。
现有解决方案主要分为两类,但均存在局限性:
- 显式模拟:将扩散模型与物理求解器(如刚体动力学、MPM)耦合的方法,需要在推理阶段进行 3D 几何重建或预定义材料,限制了其可扩展性和泛化能力。
- 隐式先验:利用语言或轨迹提示的方法改善了语义一致性,但缺乏对形变、恢复系数和摩擦等多样物理属性的连续、细粒度控制。
2. 方法论
PhyCo 引入了一种框架,能够在推理阶段无需模拟器或几何重建的情况下,实现对视频生成的连续、可解释且基于物理的控制。该方法包含三个核心组件:
A. 大规模基于物理的数据集
- 规模与多样性:作者利用 Kubric 框架、PyBullet(物理引擎)和 Blender(渲染引擎)构建了一个包含10 万多个照片级真实感模拟视频的数据集。
- 场景:该数据集涵盖了六个受控场景(例如滑动的砖块、反弹的球体、软体碰撞),范围从刚性碰撞到可变形动力学。
- 标注:与以往的数据集不同,PhyCo 为四个关键属性提供了像素对齐的物理属性图:
- 摩擦系数 (μf)
- 恢复系数 (e)
- 形变(Neo-Hookean 参数:μ,λ,γ)
- 施加的力(大小和方向)
- 设计:模拟在视觉上简洁但在物理上丰富,使模型能够将视觉外观与底层动力学解耦。
B. 物理监督微调(阶段 1)
- 架构:作者使用ControlNet架构对预训练的扩散骨干网络(Cosmos-Predict2-2B)进行微调。
- 条件输入:去噪过程以空间对齐的物理属性图 (p) 为条件。这些图被标记化并通过适配器网络投影,以匹配 DiT(扩散 Transformer)骨干网络。
- 训练策略:仅微调 ControlNet 层;基础模型和标记器权重保持冻结,以保留预训练表示。模型在数据集中特定物理属性在动力学中显现的子集上进行训练。
C. VLM 引导的奖励优化(阶段 2)
- 动机:仅靠监督微调可能无法保证强大的控制保真度。为了弥合这一差距,使用**视觉 - 语言模型(VLM)**作为可微分的奖励信号。
- 过程:
- ** rollout(展开)**:模型执行 N 步去噪 rollout 以生成预测视频 x^0,而不是评估含噪的中间步骤。
- 评估:微调后的 VLM(Qwen2.5-VL-3B)利用精心策划的“物理问题库”分析生成的视频。查询为二元(是/否)或基于回归(例如,“力的大小是否在 0.2 到 0.4 之间?”或“运动是否位于蓝色扇区内?”)。
- 奖励信号:将 VLM 对正确与错误答案的 logits 转换为可微分的奖励损失 (LVLM)。
- 优化:利用该奖励损失进一步微调 ControlNet,使生成的动力学与预期的物理属性对齐。
3. 主要贡献
- PhyCo 数据集:一个新颖的大规模(10 万 + 视频)数据集,包含摩擦、恢复系数、形变和力的连续标注,旨在将视觉外观与物理动力学解耦。
- 受控物理条件输入:一种通过 ControlNet 将空间对齐的物理属性图注入扩散模型的方法,实现了对多个物理属性的同时连续控制。
- VLM 引导的对齐:一个新颖的训练阶段,其中微调后的 VLM 提供关于物理一致性的可微分反馈,显著提高了控制保真度,且无需在推理阶段使用显式物理求解器。
- 泛化能力:该框架展示了强大的组合泛化能力,能够在风格化或现实世界场景(例如,一个人在蹦床上跳跃)中生成物理一致的运动,尽管其仅在合成数据上进行了训练。
4. 实验结果
作者在Physics-IQ 基准上评估了 PhyCo,并进行了人类偏好研究。
Physics-IQ 基准:
- PhyCo 在五个领域(固体力学、流体动力学、光学、磁学和热力学)中显著优于强大的基线模型(SVD-XT、LTX-Video、CogVideoX、VLIPP)。
- 分数:完整的 PhyCo 模型(ControlNet + VLM 损失)达到了43.6 的 IQ 分数(而 VLIPP 为 34.6,SG-I2V 为 29.7)。
- 泛化能力:即使在 120 帧序列(长于 57 帧的训练数据)上进行测试,该模型仍保持了卓越的物理真实感。
用户研究(2AFC):
- 在成对比较中,人类评估者更倾向于 PhyCo 而非基线模型,特别是在物理真实感和可控性方面。
- 与基础 Cosmos 模型相比,PhyCo 在摩擦、恢复系数和形变方面的偏好率分别为90.9%、93.2%和91.3%。
消融研究:
- VLM 影响:添加 VLM 奖励优化将力方向的角偏差从约 38°(仅 ControlNet)降低至22.5°。
- 力方向:PhyCo 实现了**15.2°**的平均方向误差,显著优于力提示法(40.5°)。
- 组合控制:该模型成功处理了属性的组合(例如,力 + 摩擦),并泛化到了未见过的物体和场景。
5. 意义
PhyCo 代表了通往物理一致生成世界模型的可扩展路径。其意义在于:
- 推理效率:它消除了推理阶段对显式物理求解器或 3D 重建的需求,使其比混合模拟方法更快、更灵活。
- 可解释性:通过使用显式的物理属性图,控制是可解释的,并与标准物理模拟参数保持一致。
- 可扩展性:该方法从合成训练数据泛化到现实世界场景和多样化的物体类别,表明嵌入物理先验是构建理解物理定律的智能视觉模型的有效策略。
总之,PhyCo 成功弥合了视觉真实感与物理合理性之间的差距,提供了一个可控框架,通过连续属性操纵生成遵守物理定律的视频。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。