← 最新论文
💻 computer science

Generative Motion In-betweening by Diffusion over Continuous Implicit Representations

本文提出了一种基于运动隐式神经表示(INR)的新型潜在扩散模型流程,该流程能够从极度稀疏的关键帧中有效重建平滑且多样的运动过渡,同时严格保持关键帧的准确性并确保运动连续性。

原作者: Shiyu Fan, Paul Henderson, Edmond S. L. Ho

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Shiyu Fan, Paul Henderson, Edmond S. L. Ho

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位动画师,正试图制作一部角色从 A 点走到 B 点的电影。在过去,你必须手工绘制每一帧。后来,如果你提供起始和结束姿势,计算机可以“猜测”中间的帧。这被称为运动补间(motion in-betweening)

然而,当前的计算机程序在只获得少量“关键帧”(角色姿势的快照)时往往难以应对。它们可能会让角色的脚像踩在冰面上一样在地板上滑动,或者让动作看起来抖动且不自然。它们有时甚至无法准确记住角色在起点和终点本应处的位置。

本文介绍了一种名为**基于连续隐式表示的扩散生成运动补间(Generative Motion In-betweening by Diffusion over Continuous Implicit Representations)**的新工具。这个名字很长,让我们通过一些类比来拆解它。

1. 问题:“像素化”与“平滑”地图

大多数动画计算机将时间视为一串珠子。它们只知道特定时间点上特定的珠子(帧)。如果你给它们的珠子相距甚远,它们就必须猜测连接这些珠子的线。通常,这种猜测是错误的,导致动作生硬或出现“脚部滑动”。

作者提议使用平滑、连续的地图取而代之。他们使用了一种称为**隐式神经表示(Implicit Neural Representation, INR)**的技术。

  • 类比:想象低分辨率数字照片(像素化、块状)与高分辨率矢量绘图(无论放大多少倍,线条都完美平滑)之间的区别。
  • 工作原理:他们的系统不是存储姿势列表,而是学习一个“平滑函数”,将整个运动描述为一条单一、不间断的曲线。这意味着计算机将运动理解为连续流动,而非一系列不连续的快照。这自然地防止了“抖动”,使动作看起来更加自然。

2. 引擎:“扩散”艺术家

为了填补稀疏关键帧之间的空白,作者使用了扩散模型(Diffusion Model)

  • 类比:将扩散想象成一位雕塑家,从一块充满噪音和混乱的粘土开始。雕塑家慢慢剔除噪音, refining 形状,直到一尊完美的雕像显现。
  • 工作原理:计算机从随机噪音开始,慢慢“去噪”以生成运动。挑战在于确保这种新运动符合你特定的起点和终点(关键帧),同时不丢失运动的自然多样性。

3. 秘密武器:“隐式流形引导”(IMG)

这是最大的创新。通常,当扩散模型试图遵循特定规则(例如“在特定时间到达这个确切位置”)时,它会感到困惑。它可能过于严格地遵循规则,导致动作僵硬;或者忽略规则而偏离方向。

作者发明了一种新的转向机制,称为隐式流形引导(Implicit Manifold Guidance, IMG)

  • 类比:想象你试图在走钢丝(即“流形”或自然运动的平滑路径)时,手中握着一个沉重的重物,将你拉向特定目的地(你的关键帧)。
    • 如果你只是用力拉向目的地,你可能会从钢丝上摔下来(动作变得不自然)。
    • 如果你只是待在钢丝上,你可能会错过目的地。
    • IMG 就是这种平衡。它不断检查两件事:
      1. 几何误差:“我们在正确的位置吗?”(脚是否落在了该落的地方?)
      2. 流形误差:“我们是否仍在自然地行走?”(我们是否保持在平滑、自然的路径上?)
  • 结果:系统温和地推动运动以准确命中你的关键帧,同时不强迫其违背物理定律或看起来像机器人。当“雕塑家”剔除噪音时,它会实时修正路径。

4. 为什么这很重要

本文声称,通过结合这三者(平滑连续地图 + 扩散雕塑 + 智能转向):

  • 准确性:角色会命中你要求的精确起始和结束姿势,即使你只给了它们两三个快照。
  • 质量:动作平滑,没有脚部滑动或抖动。
  • 多样性:与旧方法可能每次产生完全相同且乏味的行走不同,该系统可以生成许多种不同的、从 A 到 B 的真实行走方式。
  • 无需文本:你不需要输入如“快乐的行走”之类的描述来让它工作;它只需使用你提供的姿势。

总结

可以将这篇论文视为教导计算机成为一位大师级动画师,它只需观察几幅粗略的草图,就能填补电影其余部分,呈现出平滑、真实且多样的表演,同时确保角色准确降落在你告知的位置。他们通过教导计算机将运动视为一条平滑、连续的河流,而不是一系列生硬的步骤,并赋予它一个特殊的指南针以保持航向,从而实现了这一点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →