← 最新论文
🤖 AI

Generative Animations: A Multi-Model Pipeline for Prompt-Driven Motion Synthesis

本文介绍了生成式动画,这是一种多模型流水线,利用大语言模型和 Segment Anything 模型,将自然语言提示自动转换为具备几何感知能力的、可直接投入生产的运动路径,从而消除了对人工动画配置的需求。

原作者: Mannat Khurana, Sanyam Jain, Rishav Agarwal

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Mannat Khurana, Sanyam Jain, Rishav Agarwal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一本数字剪贴簿或一张海报,并希望让它活起来。你希望一个名叫“马里奥”的角色沿着蜿蜒的山丘跳跃,或者让月亮绕着行星公转,在靠近时躲到行星背后。

在过去,要做到这一点,就像是一位电影导演必须亲手逐帧移动电影的每一帧。你需要选择一个工具,点击数百个微小的点来绘制一条线,然后精确地告诉计算机沿着这条线移动的速度。这个过程缓慢、繁琐,而且要求你成为一名专业的动画师,仅仅为了让一个简单的角色行走。

新方案:“生成式动画”

本文介绍了一种名为生成式动画的新系统。你可以将其视为一位魔法翻译官,它能将你的口头或书面想法瞬间转化为流畅、专业的动画。你不再需要用鼠标绘制线条,只需说:“让马里奥沿着山间小径移动”,计算机便会完成其余工作。

以下是该系统的运作原理,通过一个生动的类比分解为四个简单步骤:

1. 翻译官(大脑)

首先,系统聆听你的指令(例如:“让马里奥沿着山间小径移动”)。它利用强大的人工智能“大脑”(大型语言模型)来理解你的真实意图。它会分析:

  • 在移动?(马里奥)
  • 去哪里?(山间小径)
  • 如何移动?(也许是“奔跑”或“弹跳”)

它将你的句子转化为精确的指令集,就像为机器人厨师准备的食谱。

2. 定位器(眼睛)

接下来,系统需要在你的图片中找到“山间小径”。它使用一种名为SAM(Segment Anything Model,分割一切模型)的工具,这就像一支超精准的荧光笔。

  • 如果图片杂乱且包含多条路径,系统可能会请你点击屏幕一次,表示:“是的,这条就是路径。”
  • 一旦你点击,系统会立即隔离该特定形状,忽略其他所有内容。

3. 建筑师(构建者)

既然系统已经知道要移动什么以及路径在哪里,它就需要为角色构建一条平滑的行驶道路。

  • 图片中的原始形状可能是锯齿状或像素化的(就像低分辨率的照片)。
  • 系统就像一台熨平机。它会描摹锯齿状的边缘,将其转化为完美的流畅曲线(一种称为贝塞尔样条的数学线条)。
  • 它还会检查路径的宽度,确保角色始终完美居中,就像火车保持在轨道上一样。

4. 导演(舞台监督)

最后,系统将所有这些指令移交给动画软件(如 Adobe InDesign)。它设定速度、时间和风格。

  • 魔法技巧:系统足够智能,能够理解深度。如果你说“让月亮绕地球公转”,它知道月亮有时应该在地球前面,有时在地球后面。它会自动将路径拆分为两部分,使月亮在地球后方消失并重新出现,从而在平坦的二维屏幕上创造出逼真的三维效果。
  • 透视技巧:如果你有一段在三维空间中倾斜的文本,系统知道不要只是让它在屏幕上水平滑动。相反,它会调整移动路径以匹配文本的角度,使运动看起来属于该物体本身。

结果

在论文的测试中,该系统将通常需要人类设计师花费5 到 10 分钟进行仔细点击和描摹的任务,缩短为不到 2 秒的过程。

目前尚无法做到的(局限性):
论文指出,该系统依赖于能够清晰地看到图片中的形状。如果图像非常模糊或颜色过于相似,“定位器”可能会感到困惑。此外,目前它一次只能处理一条指令。如果你说“马里奥跳跃,然后月亮升起”,系统仍在学习如何将这个复杂的句子分解为一系列事件。

总结:
本文提出了一种工具,它弥合了你的想象你能构建的内容之间的鸿沟。它消除了创造优美、复杂动态所需的专业技术门槛,让任何人都可以简单地描述他们的愿景,并亲眼见证其生动呈现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →