← 最新论文
💻 computer science

InTraGen: Trajectory-controlled Video Generation for Object Interactions

本文提出了名为 InTraGen 的轨迹控制视频生成管道,通过引入多模态交互编码与物体 ID 注入机制来增强物体间交互的生成效果,并配套发布了四个新数据集及一种轨迹质量评估指标,显著提升了视频生成的视觉保真度与定量性能。

原作者: Zuhao Liu, Aleksandar Yanev, Ahmad Mahmood, Ivan Nikolov, Saman Motamed, Wei-Shi Zheng, Xi Wang, Lei Sun, Luc Van Gool, Danda Pani Paudel

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zuhao Liu, Aleksandar Yanev, Ahmad Mahmood, Ivan Nikolov, Saman Motamed, Wei-Shi Zheng, Xi Wang, Lei Sun, Luc Van Gool, Danda Pani Paudel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 InTraGen 的新系统,它的核心能力是:你只需画几条线(轨迹),它就能生成一段物体之间发生真实互动的视频。

想象一下,现在的 AI 写视频就像是一个只会听模糊指令的糊涂画家
如果你对它说:“一辆红车撞了一辆蓝车”,它可能会画出两辆车,但不知道谁先谁后,或者两辆车像幽灵一样穿模而过,甚至撞完就消失了。这是因为文字太模糊,AI 搞不清楚“时间顺序”和“物体身份”。

InTraGen 就像给这位糊涂画家配了一位“精准的导演”和“身份识别员”。

以下是用生活中的比喻来拆解它的核心创新:

1. 核心痛点:文字太“虚”,时间太“乱”

  • 以前的做法:就像你给画家一张纸条,上面写着“球滚过去,碰到盒子,盒子倒了”。画家只能猜:球怎么滚?盒子在哪?先撞还是后倒?结果往往是一团乱麻。
  • InTraGen 的做法:不再只靠猜,而是直接给画家一张**“运动路线图”**。你告诉它:“球从 A 点走到 B 点,盒子在 C 点不动,它们在 D 点相遇。”

2. 三大创新法宝

🎨 法宝一:给每个物体发“身份证” (Object ID Injection)

  • 问题:在以前的视频生成里,如果两个球靠得很近,AI 经常分不清哪个是哪个。就像在人群中,如果两个人穿一样的衣服,AI 就会把他们的脸搞混,导致球突然变成了方块,或者两个球融合在一起。
  • 比喻:InTraGen 给每个物体都发了一张彩色的“身份证”
    • 红球永远穿红衣,蓝球永远穿蓝衣。
    • 即使它们撞在一起,或者一个球停在那不动,AI 也能通过颜色(ID)认出:“哦,这是那个红球,它刚才撞了蓝球,现在它停在那了。”
    • 这解决了“物体身份丢失”的难题,让互动看起来非常连贯。

🏃 法宝二:区分“动”与“静” (Multi-modal Encoding)

  • 问题:很多 AI 只关注“动的东西”,忽略了“不动的东西”。比如台球桌上,只有球在动,但桌子和球杆是静止的。如果 AI 忘了桌子,球就会穿到桌子下面去。
  • 比喻:InTraGen 像是一个全能导演
    • 它用一种信号(稀疏光流)来指挥**“谁在跑”**(动态信息)。
    • 它用另一种信号(物体 ID 图)来指挥**“谁在站着”**(静态信息)。
    • 这样,无论是飞驰的汽车还是静止的墙壁,AI 都知道该怎么处理,不会让汽车穿墙而过。

📏 法宝三:自带“评分尺子” (Trajectory Quality Metric)

  • 问题:以前很难评价 AI 生成的视频好不好,因为没人知道它到底有没有按你的要求做。
  • 比喻:InTraGen 团队自己造了一套**“轨迹比对尺”**。
    • 就像你画了一条线,AI 生成视频后,系统会自动把视频里物体的运动路线“抠”出来,和你画的线进行重叠比对
    • 如果重合度高,说明 AI 听话;如果偏离了,系统就知道哪里做得不好。这让训练和评估变得非常科学。

3. 他们做了什么实验?

为了训练这个“导演”,他们没去网上随便抓视频(因为网上的视频太乱,标注也不准),而是自己用 3D 软件(Blender 和 Unity)建了一个**“虚拟游乐场”**。

  • 他们造了四个场景:台球桌、多米诺骨牌、足球场、还有各种随机物体
  • 在这个游乐场里,他们生成了 5 万段视频,每一段都精确记录了每个物体的运动轨迹。
  • 这就好比给 AI 找了一群**“听话的替身演员”**,让它们反复排练“碰撞”、“倒下”、“滚动”等动作,直到 AI 完全学会。

4. 效果怎么样?

  • 以前:让 AI 生成“多米诺骨牌倒下”的视频,其他模型生成的画面里,骨牌可能还没倒就消失了,或者倒下的方向完全不对。
  • 现在:InTraGen 生成的视频里,骨牌一个个精准地倒下,球撞球后弹开的角度也很真实。
  • 用户测试:让人类观众来打分,大家普遍认为 InTraGen 生成的视频**“更像真的”,而且“更听指挥”**。

总结

InTraGen 就像是给视频生成 AI 装上了**“导航仪”“身份牌”
它不再让 AI 瞎猜物体怎么动,而是直接告诉它:“你(红球)走这条路,他(蓝球)站在那,你们在这里撞一下。”
这使得 AI 生成的视频不再是模糊的梦境,而是变成了
可控的、真实的物理世界模拟器**。这对于未来制作电影、设计游戏,甚至模拟物理实验都有巨大的帮助。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →