✨ 要点🔬 技术摘要
想象你拥有一位神奇的艺术家,能够从零开始绘制动态画面(视频)。这位艺术家在让事物看起来美丽且逼真方面才华横溢。然而,他们有一个盲点:并不总是理解现实世界是如何运作的。他们可能会画出一个向上漂浮而非向下坠落的球,或者一个在落地前就碎裂的杯子。
长期以来,为了修正这些错误,人们试图聘请一位“物理老师”(外部人工智能或人类)来观察这位艺术家,并指出:“不,那是错的。”但论文认为,这就像要求另一个人来批改艺术家的作业。这位老师可能带有自己的偏见,或者可能与艺术家使用不同的“语言”,从而导致误解。
引入"Proprio"。
作者提出了一种新方法,帮助艺术家自行修正错误,而无需聘请老师。他们将这种方法称为Proprio ,其名称源于生物学的“本体感觉”(proprioception)——即你无需看着手臂就能知道它在哪里的能力。正如你能感知自己的运动一样,Proprio 让视频生成器能够“感知”自己的创作,以判断其是否合乎逻辑。
以下是其工作原理,使用简单的类比说明:
1. “摇晃测试”(自我评分)
想象艺术家刚刚完成了一幅画作。与其请老师来审视,不如让艺术家对画作进行轻微、受控的摇晃。
逻辑: 如果画作在物理上是正确的(例如球在下落),轻微的摇晃不会让艺术家感到困惑。艺术家关于物体如何运动的内部规则依然成立。
故障: 如果画作是错误的(例如球在漂浮),那轻微的摇晃会导致艺术家的内部逻辑出现踉跄。由于物理规则被打破,艺术家会困惑于如何“修正”图像。
评分: Proprio 测量这种困惑程度。它根据视频受到轻微扰动时艺术家出现踉跄的程度来计算一个“分数”。低分意味着视频稳定且符合物理规律;高分则意味着视频不稳定,很可能存在错误。
2. “聚光灯”(动态掩码)
并非视频的每个部分都需要同等程度的检查。如果视频显示一个人静止坐着,那就没有什么需要检查的。但如果一辆车正在发生碰撞,那就是物理规律起作用的地方。 Proprio 使用动态聚光灯 (掩码)仅聚焦于视频中运动的部分。它忽略静态背景,放大动作区域,问道:“是这个 特定的运动合乎逻辑吗?”这使得“摇晃测试”更加准确。
3. 修正艺术的两种方式
一旦艺术家有了评分,Proprio 提供两种改进视频的方法:
“最佳 N 选”搜索(挑选优胜者): 想象艺术家绘制了同一场景的 16 个不同版本。Proprio 充当快速裁判,对每个版本进行“摇晃测试”评分。然后,它选出分数最低(即困惑最少)的一个,并宣布:“这是优胜者。”这就像掷 16 次骰子,然后选出最好的那一次。
“自我精炼”(打磨艺术): Proprio 不仅仅是挑选优胜者,它实际上可以微调 视频。它回到最开始的阶段——艺术家用来开始绘制的“噪声”或原始素材。它对这些素材进行轻微调整,要求艺术家重新绘制场景,希望能降低困惑评分。这就像雕塑家敲掉一点点石头,让雕像站得更自然,而无需改变雕塑家的工具或训练。
为什么这很重要
论文表明,这种“自我检查”方法比要求外部人工智能(如大型语言模型)来评判视频效果更好。
原生性: 艺术家使用其内部规则评判自己的作品,因此不存在语言障碍。
无需训练: 你不需要重新训练艺术家或教他们新的物理知识。你只需利用艺术家现有的大脑来发现并修正错误。
结果: 在针对球体滚动、物体碰撞和液体倾倒的视频测试中,Proprio 成功挑选并生成了人类评价为物理上更逼真的视频。
总结: Proprio 赋予了视频生成器一种对其自身工作的“直觉”。通过轻轻摇晃其创作并测量困惑程度,它既可以挑选最佳版本,也可以微妙地调整素材以使物理感觉正确,而这一切都不需要外部老师的介入。
技术摘要:Proprio:用于物理合理视频生成的潜在自评分与推理时优化
1. 问题陈述
现代视频生成模型,特别是基于扩散的架构,已实现了卓越的视觉保真度。然而,它们经常违反基本的物理原理,生成包含不现实碰撞、不可能物体交互或不一致动力学的视频。这些缺陷限制了它们作为机器人和仿真等下游应用可靠世界模型的实用性。
现有的解决方案通常依赖外部反馈机制 :
训练时干预 :注入物理先验或使用精心策划的数据集(例如 [35, 24])。
推理时外部评估器 :使用视觉 - 语言模型(VLM)或预训练的潜在世界模型(例如 V-JEPA [37, 41])来评分或引导生成。
作者指出了外部反馈范式的两个关键局限性:
偏差与不对齐 :VLM 经常将物理合理性与文本 - 图像对齐或视觉美学混为一谈。预训练的世界模型在其自身的表示空间中运行,与生成器的潜在空间产生不匹配。
缺乏内在一致性 :外部评估器以不同的目标进行训练,与生成器特定的去噪动力学不对齐,可能会在采样步骤中遗漏生成器特有的不一致性。
本文提出了一个核心问题:视频生成器能否利用其自身的去噪动力学作为自包含信号,来评估并提高其输出的物理合理性?
2. 方法论:Proprio
作者提出了Proprio ,这是一个无需训练、在推理时运行的框架,使冻结的视频生成器能够评估并优化其自身输出。受生物本体感觉(对自身运动的感知)的启发,该方法将模型在受控扰动下的内部流残差 (flow residual)视为自评分信号。
2.1 核心概念:流残差作为自评分
该方法基于以下观察:与生成器学习分布一致(即自然动力学)的样本,在受到扰动时,应产生更小且更稳定的残差。
扰动 :对于生成的潜在视频 z 0 z_0 z 0 ,该方法使用受控噪声 ϵ \epsilon ϵ 在不同的调度器时间步 t t t 构建扰动潜在变量 z t z_t z t 。
残差计算 :模型预测流场 v ^ θ ( z t , t , c ) \hat{v}_\theta(z_t, t, c) v ^ θ ( z t , t , c ) 。目标传输为 v ∗ ( z 0 , ϵ ) ≈ ϵ − z 0 v^*(z_0, \epsilon) \approx \epsilon - z_0 v ∗ ( z 0 , ϵ ) ≈ ϵ − z 0 。流残差 是以下差异:r ( z 0 , ϵ , t ; c ) = v ^ θ ( z t , t , c ) − v ∗ ( z 0 , ϵ ) r(z_0, \epsilon, t; c) = \hat{v}_\theta(z_t, t, c) - v^*(z_0, \epsilon) r ( z 0 , ϵ , t ; c ) = v ^ θ ( z t , t , c ) − v ∗ ( z 0 , ϵ )
评分 :该残差的平方范数作为局部评分。较低的残差表明模型在扰动下能更好地“解释”样本,意味着更高的物理合理性。
2.2 信号聚合与优化
为了构建鲁棒的评分,Proprio 在多个维度上聚合残差:
多扰动与多时间步 :评分在多个噪声实现和时间步上进行平均,以降低对特定噪声实例的敏感性。
逆方差加权 :残差方差较高(估计不稳定)的时间步被降低权重,而稳定的时间步被优先处理。
动态时空掩码 :应用掩码 M \mathcal{M} M 将评分聚焦于运动相关区域,过滤掉对物理合理性信息量较少的静态背景噪声。探索了三种掩码策略:
运动掩码 :基于解码帧的时间差异。
文本感知掩码 :基于潜在变量与提示词 token 之间的交叉注意力变化。
基于注意力的掩码 :基于自注意力特征的变化。
2.3 推理时策略
Proprio 在两种主要模式下利用计算出的评分 S ( z 0 ) S(z_0) S ( z 0 ) :
N 选优搜索(Best-of-N Search) :生成 N N N 个候选潜在变量,并选择自评分最低的一个。
自优化(Self-Refinement) :该方法不重新训练生成器,而是优化初始采样噪声 。它将噪声参数化为 ζ = μ + σ ⊙ ζ 0 \zeta = \mu + \sigma \odot \zeta_0 ζ = μ + σ ⊙ ζ 0 (其中 ζ 0 \zeta_0 ζ 0 是基础噪声),并使用梯度下降更新 μ \mu μ 和 σ \sigma σ 以最小化 Proprio 评分。KL 散度正则化器确保优化后的噪声仍接近原始高斯先验。
3. 主要贡献
生成器原生自评分 :提出了一种无需训练的框架,重用冻结生成器的去噪残差作为物理合理性的内在代理,消除了对外部奖励模型的需求。
推理时自对齐 :一种将自评分转化为优化目标的机制,通过仅更新初始噪声参数来优化输出,同时保持生成器权重固定。
实证验证 :在文本到视频(T2V)和图像到视频(I2V)基准测试上展示了持续改进,表明单个冻结生成器可以同时充当采样器和自评估器。
4. 实验结果
作者在 VideoPhy2 (T2V)和 Physics-IQ (I2V)基准测试上评估了 Proprio,并与随机选择、基于 VLM 的评分器(Qwen-7B)以及外部世界模型基线(WMReward)进行了比较。
性能提升 :
在 TurboWan2.2 上,Proprio 将 Physics-IQ 从 32.2 提升至 37.5(+16.5%),将 VideoPhy2-hard 物理常识从 45.6 提升至 55.0(+20.6%)。
Proprio 始终优于基于 VLM 的评分,并且经常超越 WMReward,特别是在物理常识(PC)指标方面。
混合评分方法(结合全局和运动感知评分)在语义遵循和物理一致性之间提供了最稳健的平衡。
人类评估 :
在成对比较中,人类评估者在约 67% 的案例中更偏好由 Proprio 选择或优化的视频,因其物理合理性更高。
视觉质量在很大程度上得以保留,在许多案例中评估者对基线没有表现出强烈的负面偏好,表明改进并未以牺牲美学为代价。
消融洞察 :
噪声水平 :最有信息的评分信号来自中等水平噪声 (采样步长的 0.3–0.6)。低噪声过于局部,而高噪声则失去了样本特定的结构。
方差加权 :逆方差加权通过优先处理稳定时间步,显著提升了非蒸馏模型的性能。
搜索与优化 :搜索(N 选优)对于 T2V 非常有效,因为场景多样性高。对于 I2V,由于候选项锚定在同一图像上,优化起着更主导的作用。
5. 意义与主张
本文主张,冻结的视频生成器包含可用于评估和改进物理合理性的可操作内部信号 。通过将模型自身的流残差重新解释为似然偏好信号,Proprio 证明了:
外部评估器对于物理对齐并非严格必要;生成器的内部动力学已足够。
推理时的扩展(搜索和优化)可以在不重新训练的情况下产生显著收益。
该方法提供了一种视角的转变:未来的系统可能会越来越多地利用生成器内部信号进行自评估,而不是完全依赖外部监督或辅助奖励模型。
承认的局限性 :
Proprio 受限于基础生成器中编码的知识;它无法恢复模型尚未学习到的动力学。
由于需要多个候选评分和优化步骤,它增加了推理成本。
基于梯度的优化目前依赖蒸馏模型以实现计算可行性,因为在大型模型中通过长去噪轨迹进行反向传播仍然昂贵。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。