← 最新论文
💻 computer science

LAMP: Language-Assisted Motion Planning for Controllable Video Generation

本文提出了 LAMP 框架,利用大语言模型将自然语言描述转化为基于领域特定语言(DSL)的结构化运动程序,进而生成精确的 3D 物体与相机轨迹,从而显著提升了视频生成中对复杂动态场景的可控性与意图对齐能力。

原作者: Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Erkut Erdem, Aykut Erdem, Duygu Ceylan

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Erkut Erdem, Aykut Erdem, Duygu Ceylan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 LAMP 的新工具,你可以把它想象成视频生成领域的“全能导演助理”

在以前,如果你想让 AI 生成一段视频,通常只能告诉它:“我要一艘大船在海上航行”。AI 虽然能画出船,但船怎么动、摄像机怎么拍,往往由 AI 自己瞎猜,结果经常是船在乱飘,或者摄像机像喝醉了酒一样乱转。

LAMP 的出现,就是为了解决这个“沟通不畅”的问题。它让普通人也能像专业电影导演一样,用自然语言指挥 AI 拍出具有电影感的视频。

以下是用通俗的比喻来解释它的核心原理:

1. 核心痛点:语言 vs. 数学的“翻译鸿沟”

  • 以前的困境:你想让摄像机“绕着船转一圈”,但 AI 的底层逻辑是复杂的数学坐标(X 轴走多少,Y 轴转多少度)。让 AI 直接猜这些数字,就像让一个不懂乐理的人直接指挥交响乐团,它可能知道“要激昂”,但不知道具体哪个音符该响多久。
  • LAMP 的解决方案:LAMP 引入了一个中间层,就像一位精通电影术语的“翻译官”。它不直接让 AI 算坐标,而是先把你说的话翻译成一套**“电影动作剧本”**(也就是论文里说的 DSL,领域特定语言)。

2. LAMP 是如何工作的?(三步走)

第一步:听懂你的“导演意图”

当你输入:“一艘大船向右航行,摄像机要平滑地绕着它逆时针转半圈。”
LAMP 背后的大语言模型(LLM) 就像一位经验丰富的老导演,它立刻听懂了你的意图,并把它拆解成专业的指令。

第二步:编写“动作剧本” (DSL)

这是 LAMP 最厉害的地方。它不会直接输出乱码般的坐标,而是生成一段结构清晰的**“动作代码”**。

  • 比喻:这就好比导演在分镜本上写:
    • 物体动作自由移动 (向右,速度中等)
    • 摄像机动作轨道跟随 (逆时针,90 度,平滑)
  • 这套“剧本”是结构化的,就像乐高积木一样,由标准的“动作模块”(如:环绕、跟随、旋转)和“修饰词”(如:快慢、平滑、角度)组成。

第三步:精准执行 (从剧本到 3D 轨迹)

一旦“剧本”写好,LAMP 就会把它100% 准确地转换成 3D 空间中的运动轨迹。

  • 比喻:这就像把剧本交给一个精密的机械臂。因为剧本是标准化的,机械臂能完美执行“绕船转 90 度”这个动作,不会偏差分毫。
  • 最后,这些精准的 3D 轨迹(船怎么走,摄像机怎么飞)被喂给视频生成 AI,AI 只需要负责“画画”,剩下的运动逻辑已经由 LAMP 安排得明明白白。

3. 为什么 LAMP 很牛?(三大优势)

  • 像搭积木一样简单(可组合性)
    以前想拍个复杂的镜头(比如“先跟拍,再拉远,最后旋转”),很难描述清楚。LAMP 把这些动作变成了积木块。你可以随意组合:“先 跟拍,再 螺旋上升"。AI 能轻松理解这种组合,就像搭乐高一样。

  • 可以反复修改(可编辑性)
    这是最实用的功能。如果生成的视频里,你觉得“摄像机太高了”,你不需要重新生成整个视频。你只需要告诉 LAMP:“把摄像机降低一点"。LAMP 会立刻修改“剧本”里的参数,重新生成轨迹,视频里的摄像机就会乖乖降下来。

    • 比喻:这就像在写文章时修改错别字,而不是把整篇文章撕了重写。
  • 万物皆可控(物体 + 摄像机双控)
    以前的工具大多只能控制摄像机,或者只能控制物体。LAMP 是第一个能同时指挥“演员”(船、人、车)和“摄影师”(摄像机)的工具。它能让演员和摄影师配合得天衣无缝,就像真正的电影拍摄现场。

4. 总结:它改变了什么?

想象一下,以前用 AI 做视频像是在**“蒙眼射箭”**,你喊一声“射”,箭飞出去,能不能中靶全看运气。

LAMP 则是给了你一副**“瞄准镜”和“操作杆”**。

  1. 你告诉它你的想法(自然语言)。
  2. 它帮你把想法变成精确的**“电影分镜脚本”**。
  3. 它确保摄像机和演员严格按照脚本走位。
  4. 最后,AI 负责把画面画得漂亮。

一句话总结:LAMP 让普通人也能通过简单的对话,像好莱坞导演一样,精准地控制视频里每一个物体的运动和每一个镜头的运镜,让 AI 生成的视频真正“听指挥”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →