想象一下,你正在看一部电影,主角可以伸手去抓起一个咖啡杯,喝上一口,然后把它放下,同时还在和你聊天。长期以来,计算机科学家们一直擅长让角色的身体动作变得逼真,但他们往往在“抓取”这一环节上感到吃力。有时,手会像幽灵一样穿过杯子,或者杯子在被触摸时会神奇地变形。这就是“人机交互”(human-object interaction)的挑战:教计算机不仅要理解一个人如何移动,还要理解他们如何物理性地接触并改变周围的世界。
为了实现这一点,研究人员通常依赖两种主要工具。首先是视频生成,它就像一位根据描述绘制动态图像的数字艺术家。其次是世界建模,这是一个高级说法,指的是计算机尝试预测一个场景随时间推移会发生怎样的变化。大问题在于:我们能否将这两者结合起来,创造出一个不仅仅是在原地跳舞,而是能与物体进行实时交互的角色——就像一个感觉真实到可以触摸的电子游戏角色?
这正是来自通义实验室(Tongyi Lab)的一个研究团队一直在致力于解决的问题。他们构建了一个全新的系统,充当一个“实时以人为中心的世界模型”。把它想象成一个数字木偶师,他不仅控制木偶的肢体,还会决定木偶手里拿的是一把锤子,还是仅仅在空中挥手。他们的目标是创建一个能够接收人的实时视频、一个物体的图片(比如一个杯子)以及一个简单的指令(比如“抓取”或“无接触”),并瞬间生成一段人物与该物体完美交互的视频的系统。
该团队发现,通过将控制权拆分为两个截然不同的部分,他们可以比以往的方法更好地解决问题。第一部分是连续人体状态,它处理身体、手部和面部的平滑、流动的动作。想象一下,这就像是木偶师引导木偶肌肉的手。第二部分是离散交互状态,它就像一个简单的开关,告诉系统:“现在手是否正在接触物体?”或者“它是否正握着它?”通过使用特定的、简短的指令来控制这个开关(例如“抓取”或“无接触”词汇,而不是长而复杂的句子),计算机可以瞬间且准确地在这些状态之间切换。
结果显示,该系统能以每秒 25 帧的速度生成交互视频,延迟仅为约 1000 毫秒。这意味着它的速度足以应对像实时对话或真实视频游戏那样的场景。研究人员展示了与旧系统相比,他们的方法能创造出更真实的动作以及更好的物体接触,而旧系统经常产生奇怪的故障,比如物体悬浮或手部无法准确合拢包裹住应抓取的物体。他们还创建了一个包含超过 30,000 个示例的特殊数据集,用以教导系统这些交互应当呈现的样子。虽然他们并未声称这解决了宇宙中的所有问题,但实验表明,这种“连续-离散”方法是让数字人在现实中实现实时交互迈出的重要一步。
技术摘要:面向上半身人机交互的实时以人为中心的世界模型
问题陈述
近期在人类视频生成领域的进展提升了上半身合成的质量,适用于远程呈现和交互式智能体等应用。然而,现有方法主要侧重于以人为中心的运动驱动生成(例如重演或化身动画),而没有明确地对人与物交互(human-object interaction)及其对周围局部场景的影响进行建模。虽然基于文本条件的生成模型可以描绘交互过程,但它们通常依赖于自由形式的提示词,这会导致运动与交互语义纠缠,从而导致运动控制力弱且接触结果不稳定。此外,目前大多数方法计算成本高昂且局限于离线生成,缺乏实现实时、交互式部署所需的统一框架,在实时部署中,人的运动及其与特定物体的具体接触状态必须能够同时受控且具备低延迟。
方法论
作者提出了一种用于上半身交互式生成的实时以人为中心的世界模型。该框架通过合成以人为中心的连贯局部世界动态,使协调的身体、手部和面部运动能够与可控的人物-物体离散交互共同演进。该方法的核心是一个由两个互补组件组成的连续-离散联合控制方案:
1. 连续人体状态控制
为了建模协调的上半身、手部和面部动态,作者引入了一种基于多尺度运动编码的统一隐式表示。
- 多尺度分解: 驱动输入被分解为四个区域:上半身、左手、右手和面部。
- 隐式编码: 区域特定的运动输入通过基于 ViT 的编码器被编码为潜向量。这些潜向量被融合到一个共享的潜空间中。
- 隐式重定向: 融合后的运动潜向量与线性投影的参考图像块拼接,并输入解码器。这种设计允许对身体-手-脸的动态进行富有表现力的细粒度控制,而无需显式的骨骼重定向,在捕捉微妙运动细节的同时保留身份特征。
2. 离散交互状态控制
为了建模人与周围物体之间的接触关系,作者使用语言编码的离散交互状态指令而非开放式的语义提示来表示交互。
- 离散状态: 交互状态 (so) 被定义为一个包含少量离散变量的小集合,具体为**“无接触”和“抓取”**。
- 显式控制: 文本作为一种显式指令用于在这些状态之间进行切换,作为连续人体状态控制的补充。这种分离使得模型能够在相似的人体运动条件下,生成不同的局部视觉结果(例如,抓取 vs 非接触)。
- 数据流水线: 构建了一个专门的渲染流水线,用于生成超过 30,000 个高质量样本的高质量数据集。该流水线使用 Z-Image 进行参考生成,使用 Qwen-VL 进行物体检测,并使用 Wan2.2-14B-I2V 进行视频合成,最后通过 Qwen-VL 过滤和人工检查以确保交互的合理性。
3. 实时优化
为了实现流式实时推理,模型进行了效率优化:
- 蒸馏: 模型使用 CausVid 进行蒸馏,将采样步数从 20 步减少到 4 步,并引入了用于自回归生成的因果注意力和滑动窗口注意力机制。
- 自我强制(Self-Forcing): 采用 Self-Forcing 技术来减轻迭代生成过程中的时间误差累积。
- 性能: 这些优化使得模型能够在两块 H100 GPU 上实现 25 FPS 的流式生成,端到端延迟约为 1000 ms。
4. 训练策略
模型采用了两阶段训练策略:
- 阶段 I(人体状态预训练): 模型使用通用的上半身运动视频(不含物体参考)通过流匹配(Flow Matching)学习统一的隐式人体表示,并辅以表示对齐损失(DINOv3 特征)和关键点监督损失。
- 阶段 II(交互状态学习): 模型从阶段 I 初始化,冻结运动编码器,并在仅使用合成交互数据集的情况下,利用流匹配目标训练剩余模块,以学习离散交互控制。
核心贡献
- 以人为中心的世界模型: 该框架通过对连续人体状态和离散交互状态的联合建模,将以人为中心的场景演化形式化,实现了从简单的运动复制向交互式局部世界建模的跨越。
- 统一控制方案: 引入了用于人体状态控制的统一隐式多尺度表示,并结合了以语言为条件的离散交互状态指令,实现了精确且可控的人物-物体交互生成。
- 实时系统: 开发了一个能够在 H100 GPU 上实现 25 FPS 推理的流式系统,支持低延迟的在线交互状态切换。
结果
论文通过定性和定量评估将其方法与最先进的基准模型(Wan2.2, Humo, VACE, MAI, 和 Wan-Animate)进行了对比。
- 定性评估: 与基准模型相比,该方法展示了更优的身份保持能力、更稳定的手物交互以及更准确的运动跟随。它成功处理了复杂的双手动作,并允许在相似的驱动运动下显式地在“无接触”和“抓取”状态之间切换。
- 定量评估: 该方法在客观指标上表现出色,包括更低的 FVD (154.1) 和 tLPIPS (0.178),更高的 CLIP-I (0.851),以及更高的物体质量 (OQ: 0.151)。它还显示出更低的 HandSIM 和 FaceSIM 误差,表明具有更好的细粒度局部运动精度。用户研究证实了其在文本遵循、动作跟随、运动一致性和视觉质量方面的提升。
意义
作者声称这项工作代表了从运动模仿向实时以人为中心的世界建模迈出的务实一步。通过将连续的人体运动与离散的交互状态解耦,并针对实时性能进行优化,该框架解决了现有方法要么缺乏显式交互控制,要么对于交互式应用而言速度过慢的问题。该系统能够合成以人为中心的、连贯且可控的交互式局部世界状态,为远程呈现和交互式智能体等应用提供了便利,在这些应用中,人不仅是在移动,还在与其周围的即时环境进行交互并改变环境。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。