← 最新论文
🤖 machine learning

ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow

ShadowDancer 通过利用一个“影子库”来构建具有相同动力学特性但外观不同的视频对,从而引入了一种用于交互式视频世界模型任意动作、帧级控制的新颖框架,通过跨影子预测实现统一动力学表示的学习,使得演示的动作能够在无需标签或微调的情况下无缝迁移到新环境中。

原作者: Jin Cao, Zian Meng, Kaipeng Zhang

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Jin Cao, Zian Meng, Kaipeng Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个神奇的、有生命的电影屏幕去做一些新事物。这不仅仅是一个视频播放器;它是一个“世界模型”(world model),一种能够生成无尽且具有交互性的视频世界的 AI——在这些世界里,你可以行走、战斗、驾驶或飞行。梦想是让这些世界感觉真实且具有响应性,就像一个永不结束、且能根据你的指令发生变化的电子游戏。但这里有一个巨大的难题:你该如何精确地告诉 AI 该做什么?

目前,我们有两种糟糕的选择。我们可以给 AI 一个模糊的指令,比如“跳跃”,它会自行猜测如何实现,但往往会在时机或风格上出错。或者,我们可以给它一个极其精确、机械化的指令,比如一套针对每个手指动作的 3D 坐标列表,但这只适用于特定的角色或机器人,一旦换成人类或汽车就会失效。这就像试图通过只给狗看一张猫的照片来教它弹钢琴,或者试图通过向人类提供喷气式飞机的精确发动机设计图来教他们飞行。我们需要一种方法,能向 AI 展示“任何”动作、“任何”风格,并让它理解动作的核心,而不被细节所迷惑。

于是,ShadowDancer 出现了。这是一种利用“影子”这一巧妙技巧的新方法。研究人员意识到,如果你观看一段人跳舞的视频,你看到的是被包裹在特定服装、灯光和背景中的舞蹈(即动作)。如果你能以某种方式看到由另一个人、在不同地点、在不同灯光下表演的“完全相同的舞蹈”,那么你就拥有了同一个底层动作的两个“影子”。通过比较这两个影子,AI 就能学会忽略服装和背景,而专注于纯粹的动作本身。

ShadowDancer 正是这样运作的。它创建成对的视频:一个是原始视频,另一个是“影子”视频——在这个影子视频中,动作是完全一致的,但除此之外的一切(角色、场景、天气)都被替换掉了。AI 被训练去观察第一个视频并预测第二个视频。因为第二个视频的外观完全不同,AI 就无法通过简单地复制颜色或形状来“作弊”;它被迫去学习那层看不见的动作“骨架”。一旦掌握了这一点,它就可以提取一段机器人手臂抬起箱子的纯粹“抬起”动作,并将这个动作原封不动地应用在人类角色、巨龙或汽车身上,而无需重新训练或给予特殊标签。

实验结果令人印象深刻。在测试中,ShadowDancer 在跨世界复制动作方面比以往的方法表现得更出色。旧的模型经常会产生混乱,导致角色扭曲成奇怪的形状或产生随机的冗余动作,而 ShadowDancer 则能保持动作的忠实度。在人类无法分辨哪个模型生成了哪个视频的盲测对比中,ShadowDancer 的胜率高达 86%。它甚至能通过仅仅观察一段剪辑就学会新的动作,例如让一个模组化的角色挥舞双手长剑,并在完全不同的环境中重现那次精准的挥砍。这意味着,我们很快就能通过向交互式世界展示一段视频来教导它们,而不是编写复杂的代码或给出模糊的指令。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →