← 最新论文
💻 computer science

CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation

CoInteract 是一种基于扩散变换器(DiT)的端到端框架,通过引入感知人体的专家混合机制和空间结构化协同生成策略,有效解决了现有方法在生成人机交互视频时手部结构不稳定及物理接触不真实的问题,实现了高保真且符合物理规律的交互视频合成。

原作者: Xiangyang Luo, Xiaozhe Xin, Tao Feng, Xu Guo, Meiguang Jin, Junfeng Ma

发布于 2026-04-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiangyang Luo, Xiaozhe Xin, Tao Feng, Xu Guo, Meiguang Jin, Junfeng Ma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想拍一段视频:视频里的人(比如你)正拿着一个全新的包包,一边说话一边展示它。现在的 AI 视频生成技术虽然能让人物动起来,但经常“翻车”:手可能会穿过包包(像幽灵一样),手指会融化成一团,或者包包看起来根本不像你选的那个。

这篇论文提出的 CoInteract,就是为了解决这些“翻车”现场而设计的一个超级智能视频导演

我们可以用三个生动的比喻来理解它的核心魔法:

1. 核心难题:为什么以前的 AI 会“穿模”?

以前的 AI 就像是一个只懂画画的画家。你给它看一张照片,它拼命模仿照片上的颜色和光影。但是,它不懂物理

  • 它不知道手是硬的,包包也是硬的,两个硬的东西不能互相穿过。
  • 它不知道手指有骨头,不能像面条一样随意扭曲。
  • 所以,当它画手抓东西时,经常画成手“插”进了包里,或者手指糊成一团。

2. CoInteract 的解决方案:三位一体的“导演组”

CoInteract 不再让 AI 只靠“猜”来画画,而是给它配了一个双轨制导演组和一个特种部队

🎬 魔法一:双轨制导演(空间结构化协同生成)

这是 CoInteract 最厉害的地方。它不再只生成“画面”,而是同时生成两条线:

  • 轨道 A(画面线): 负责生成漂亮的、有颜色的视频(RGB)。
  • 轨道 B(骨架线): 负责生成一个没有颜色、只有轮廓的“幽灵版”视频。在这个版本里,人变成了剪影,但保留了手和包包的空间位置关系

比喻: 想象你在盖房子。

  • 以前的 AI 是直接往墙上刷油漆(只关注颜色),结果窗户和门的位置经常对不上。
  • CoInteract 则是先搭好钢筋骨架(轨道 B),确保手和包包的位置是物理上合理的,不会互相穿过。然后,它再在这个完美的骨架上刷上漂亮的油漆(轨道 A)。
  • 关键点: 在训练时,AI 同时看这两条线,学会了“手不能穿过包包”的物理规则。但在最终生成视频时,它只输出漂亮的“画面线”,那个“骨架线”就消失了。所以,用户看视频时速度不会变慢,但质量却变高了。

🎨 魔法二:特种部队(人类感知混合专家 MoE)

AI 画全身时通常很均匀,但画这种细节丰富的地方,经常容易糊掉。
CoInteract 在 AI 的大脑里安插了一支特种部队

  • 普通专家: 负责画背景、衣服等普通区域。
  • 手/脸专家: 当 AI 发现正在画“手”或“脸”的像素时,会立刻把任务转交给手专家脸专家去处理。

比喻: 就像一家餐厅。

  • 以前是只有一个全能厨师,炒青菜、切刺身、做蛋糕都他一个人干,结果刺身切得不够薄。
  • 现在 CoInteract 是分灶台:有一个专门切刺身的大师(手专家),有一个专门做精致甜点的大师(脸专家)。一旦订单是“切手”,系统就自动派给刺身大师。
  • 结果: 手指清晰锐利,五官不再模糊,而且因为只派了少量专家去处理细节,并没有让餐厅变慢或变贵

🧭 魔法三:时空导航仪(3D RoPE)

为了让视频里的人动作连贯,且参考图里的人长得像,CoInteract 给每个像素都发了一个3D 身份证

  • 它告诉 AI:“这是过去的动作”、“这是现在的画面”、“这是参考图里的脸”。
  • 这样 AI 就不会把参考图里的脸“贴”到错误的地方,也不会让动作变得像跳大神一样不连贯。

3. 最终效果:像变魔术一样

当你给 CoInteract 输入:

  1. 一张你的照片(人)。
  2. 一张包包的照片(物)。
  3. 一段你想说的话(语音)。
  4. 一段文字描述(比如“拿起包包展示”)。

它就能生成一段视频,里面的人自然地拿起包包,手指紧紧扣住包带,绝对不会出现手穿过包包的鬼魅现象,而且你的脸和包包的样子都保持得一模一样。

总结

CoInteract 就像是一个既懂物理力学,又懂精细雕刻的超级导演

  • 它用**“先搭骨架后刷漆”**的方法,解决了手穿模、物体不合理的物理问题。
  • 它用**“专人专岗”**的方法,解决了手和脸画不好的细节问题。
  • 最重要的是,它把这些复杂的思考过程都藏在了训练阶段,用户使用时依然像以前一样快,只是看到的视频质量发生了质的飞跃。

这对于电商直播、虚拟带货来说,意味着未来的虚拟主播可以真正拿起商品,像真人一样自然地展示,而不再是一团模糊的“数字幽灵”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →