← 最新论文
💻 computer science

Real-Time Human-Centric World Modeling for Upper-Body Human-Object Interaction

本文提出了一种实时以人为中心的世界模型,该模型通过结合用于连续人体运动的统一多尺度隐式表示与用于精确物体接触控制的语言编码离散状态,合成连贯的上半身交互,并在 H100 GPU 上实现了 25 FPS 的推理速度。

原作者: Chaonan Ji, Jinwei Qi, Peng Zhang, Bang Zhang

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Chaonan Ji, Jinwei Qi, Peng Zhang, Bang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在看一部电影,主角可以伸手去抓起一个咖啡杯,喝上一口,然后把它放下,同时还在和你聊天。长期以来,计算机科学家们一直擅长让角色的身体动作变得逼真,但他们往往在“抓取”这一环节上感到吃力。有时,手会像幽灵一样穿过杯子,或者杯子在被触摸时会神奇地变形。这就是“人机交互”(human-object interaction)的挑战:教计算机不仅要理解一个人如何移动,还要理解他们如何物理性地接触并改变周围的世界。

为了实现这一点,研究人员通常依赖两种主要工具。首先是视频生成,它就像一位根据描述绘制动态图像的数字艺术家。其次是世界建模,这是一个高级说法,指的是计算机尝试预测一个场景随时间推移会发生怎样的变化。大问题在于:我们能否将这两者结合起来,创造出一个不仅仅是在原地跳舞,而是能与物体进行实时交互的角色——就像一个感觉真实到可以触摸的电子游戏角色?

这正是来自通义实验室(Tongyi Lab)的一个研究团队一直在致力于解决的问题。他们构建了一个全新的系统,充当一个“实时以人为中心的世界模型”。把它想象成一个数字木偶师,他不仅控制木偶的肢体,还会决定木偶手里拿的是一把锤子,还是仅仅在空中挥手。他们的目标是创建一个能够接收人的实时视频、一个物体的图片(比如一个杯子)以及一个简单的指令(比如“抓取”或“无接触”),并瞬间生成一段人物与该物体完美交互的视频的系统。

该团队发现,通过将控制权拆分为两个截然不同的部分,他们可以比以往的方法更好地解决问题。第一部分是连续人体状态,它处理身体、手部和面部的平滑、流动的动作。想象一下,这就像是木偶师引导木偶肌肉的手。第二部分是离散交互状态,它就像一个简单的开关,告诉系统:“现在手是否正在接触物体?”或者“它是否正握着它?”通过使用特定的、简短的指令来控制这个开关(例如“抓取”或“无接触”词汇,而不是长而复杂的句子),计算机可以瞬间且准确地在这些状态之间切换。

结果显示,该系统能以每秒 25 帧的速度生成交互视频,延迟仅为约 1000 毫秒。这意味着它的速度足以应对像实时对话或真实视频游戏那样的场景。研究人员展示了与旧系统相比,他们的方法能创造出更真实的动作以及更好的物体接触,而旧系统经常产生奇怪的故障,比如物体悬浮或手部无法准确合拢包裹住应抓取的物体。他们还创建了一个包含超过 30,000 个示例的特殊数据集,用以教导系统这些交互应当呈现的样子。虽然他们并未声称这解决了宇宙中的所有问题,但实验表明,这种“连续-离散”方法是让数字人在现实中实现实时交互迈出的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →