这篇论文介绍了一个名为 LAMP 的新工具,你可以把它想象成视频生成领域的“全能导演助理”。
在以前,如果你想让 AI 生成一段视频,通常只能告诉它:“我要一艘大船在海上航行”。AI 虽然能画出船,但船怎么动、摄像机怎么拍,往往由 AI 自己瞎猜,结果经常是船在乱飘,或者摄像机像喝醉了酒一样乱转。
LAMP 的出现,就是为了解决这个“沟通不畅”的问题。它让普通人也能像专业电影导演一样,用自然语言指挥 AI 拍出具有电影感的视频。
以下是用通俗的比喻来解释它的核心原理:
1. 核心痛点:语言 vs. 数学的“翻译鸿沟”
- 以前的困境:你想让摄像机“绕着船转一圈”,但 AI 的底层逻辑是复杂的数学坐标(X 轴走多少,Y 轴转多少度)。让 AI 直接猜这些数字,就像让一个不懂乐理的人直接指挥交响乐团,它可能知道“要激昂”,但不知道具体哪个音符该响多久。
- LAMP 的解决方案:LAMP 引入了一个中间层,就像一位精通电影术语的“翻译官”。它不直接让 AI 算坐标,而是先把你说的话翻译成一套**“电影动作剧本”**(也就是论文里说的 DSL,领域特定语言)。
2. LAMP 是如何工作的?(三步走)
第一步:听懂你的“导演意图”
当你输入:“一艘大船向右航行,摄像机要平滑地绕着它逆时针转半圈。”
LAMP 背后的大语言模型(LLM) 就像一位经验丰富的老导演,它立刻听懂了你的意图,并把它拆解成专业的指令。
第二步:编写“动作剧本” (DSL)
这是 LAMP 最厉害的地方。它不会直接输出乱码般的坐标,而是生成一段结构清晰的**“动作代码”**。
- 比喻:这就好比导演在分镜本上写:
- 物体动作:
自由移动 (向右,速度中等)
- 摄像机动作:
轨道跟随 (逆时针,90 度,平滑)
- 这套“剧本”是结构化的,就像乐高积木一样,由标准的“动作模块”(如:环绕、跟随、旋转)和“修饰词”(如:快慢、平滑、角度)组成。
第三步:精准执行 (从剧本到 3D 轨迹)
一旦“剧本”写好,LAMP 就会把它100% 准确地转换成 3D 空间中的运动轨迹。
- 比喻:这就像把剧本交给一个精密的机械臂。因为剧本是标准化的,机械臂能完美执行“绕船转 90 度”这个动作,不会偏差分毫。
- 最后,这些精准的 3D 轨迹(船怎么走,摄像机怎么飞)被喂给视频生成 AI,AI 只需要负责“画画”,剩下的运动逻辑已经由 LAMP 安排得明明白白。
3. 为什么 LAMP 很牛?(三大优势)
像搭积木一样简单(可组合性):
以前想拍个复杂的镜头(比如“先跟拍,再拉远,最后旋转”),很难描述清楚。LAMP 把这些动作变成了积木块。你可以随意组合:“先 跟拍,再 螺旋上升"。AI 能轻松理解这种组合,就像搭乐高一样。
可以反复修改(可编辑性):
这是最实用的功能。如果生成的视频里,你觉得“摄像机太高了”,你不需要重新生成整个视频。你只需要告诉 LAMP:“把摄像机降低一点"。LAMP 会立刻修改“剧本”里的参数,重新生成轨迹,视频里的摄像机就会乖乖降下来。
- 比喻:这就像在写文章时修改错别字,而不是把整篇文章撕了重写。
万物皆可控(物体 + 摄像机双控):
以前的工具大多只能控制摄像机,或者只能控制物体。LAMP 是第一个能同时指挥“演员”(船、人、车)和“摄影师”(摄像机)的工具。它能让演员和摄影师配合得天衣无缝,就像真正的电影拍摄现场。
4. 总结:它改变了什么?
想象一下,以前用 AI 做视频像是在**“蒙眼射箭”**,你喊一声“射”,箭飞出去,能不能中靶全看运气。
LAMP 则是给了你一副**“瞄准镜”和“操作杆”**。
- 你告诉它你的想法(自然语言)。
- 它帮你把想法变成精确的**“电影分镜脚本”**。
- 它确保摄像机和演员严格按照脚本走位。
- 最后,AI 负责把画面画得漂亮。
一句话总结:LAMP 让普通人也能通过简单的对话,像好莱坞导演一样,精准地控制视频里每一个物体的运动和每一个镜头的运镜,让 AI 生成的视频真正“听指挥”。
论文标题
LAMP:用于可控视频生成的语言辅助运动规划
1. 研究背景与问题 (Problem)
尽管现有的视频生成模型在视觉保真度上取得了显著进展,但在运动控制(Motion Control)方面仍存在局限性,特别是难以同时精确控制物体动态和相机轨迹。
- 现有瓶颈:目前的交互方式主要依赖文本提示、从现有视频提取的标注或简单的 2D 草图。这些模态在描述复杂的 choreographed(编排好的)运动和导演级的相机运镜时显得力不从心。
- 核心难点:物体运动与相机轨迹通常是相互纠缠的(例如,相机需要相对于移动的物体进行环绕)。用户很难仅凭自然语言直接想象并指定精确的 3D 坐标序列,导致生成的视频往往缺乏物理一致性或无法准确反映用户的导演意图。
- 现有方法缺陷:大多数现有方法要么只关注布局生成,要么只关注相机轨迹,且通常直接回归连续的 3D 坐标,缺乏结构化和可解释性。
2. 方法论 (Methodology)
LAMP 提出了一种将运动控制视为**“语言到程序合成” (Language-to-Program Synthesis)** 的框架。它利用大语言模型(LLM)作为运动规划器,将自然语言描述转换为结构化的运动程序,再映射为 3D 轨迹。
核心组件:
运动领域特定语言 (Motion DSL):
- 受电影摄影惯例启发,设计了一种 DSL,将运动抽象为原语 (Primitives) 和 修饰符 (Modifiers)。
- 四大原语:
Free-form:无约束的 6 自由度运动。
Orbit track:相机围绕目标物体旋转。
Tail track:相机跟随物体(可配置时间偏移)。
Rotation track:相机原地旋转以调整构图。
- 修饰符:包括平移(lat, vert, depth)、旋转(yaw, pitch, roll)、速度、缓动(easing)等键值对。
- 优势:这种符号化表示具有可解释性、组合性,且能减少数据需求。
LLM 运动规划器:
- 使用微调后的自回归 LLM 作为规划器。
- 输入:描述物体和相机运动的自然语言文本。
- 输出:结构化的 DSL 程序(包含物体运动序列 sobj 和相机运动序列 scam)。
- 策略:采用分层概率建模,先确定物体运动,再基于物体运动生成相机轨迹,符合电影摄影的逻辑(主体决定场景动态,相机调整构图)。
确定性转换 (DSL-to-Trajectory Converter):
- 将生成的 DSL 程序确定性地映射为 3D 物体和相机的轨迹。
- 对于跟踪类运动,先合成物体轨迹,再计算相对于物体的相机轨迹,最后转换到世界坐标系。
- 生成的轨迹被渲染为控制视频(Control Video),用于条件化预训练的视频扩散模型(如 VACE)。
大规模程序化数据集:
- 构建了包含 40 万 个“文本 - 运动”样本的数据集。
- 通过程序化采样运动原语并组合,生成 DSL 程序和对应的 3D 轨迹。
- 利用辅助 LLM 对描述进行改写,增加语言多样性。
- 数据集覆盖了广泛的运动模式(从单轴运动到多轴复合运动)。
3. 关键贡献 (Key Contributions)
- 首个统一的物体与相机运动规划框架:提出了 LAMP,这是首个能够从自然语言直接生成物体和相机双重 3D 轨迹的框架,填补了现有方法仅关注单一维度的空白。
- 受电影摄影启发的 DSL:设计了一种符号化的运动语言,将复杂的导演意图转化为可解释、可编辑的程序,实现了从“回归坐标”到“程序合成”的范式转变。
- 大规模程序化数据集与生成框架:构建了 40 万规模的文本 - 运动配对数据集,并开源了数据生成框架,支持可扩展的语言驱动运动规划研究。
- 可迭代与解耦的控制接口:由于运动规划与视频生成解耦,用户可以在昂贵的视频合成之前,通过简单的文本指令(如“把相机放低一点”)对运动轨迹进行迭代 refinement(细化),极大地提高了工作流的灵活性。
4. 实验结果 (Results)
- 相机轨迹评估:
- 在 DataDoP 和 ET 数据集上,LAMP 在文本 - 轨迹对齐度(CLaTr-CLIP)、运动真实性(FID)和运动标签准确率(F1 Score)上均显著优于 SOTA 基线(如 GenDoP, ET, Director3D 等)。
- 即使在未使用特定数据集训练的情况下,LAMP 的表现也优于在这些数据集上专门训练的模型,证明了其强大的泛化能力。
- 物体轨迹评估:
- 在程序化数据集测试集上,LAMP 在粗粒度(27 类)和细粒度(343 类)平移及旋转预测上均取得了极高的 F1 分数(>0.92)。
- 消融实验:
- 对比直接回归连续轨迹的变体,基于 DSL 的方法在方向准确性和旋转误差上表现更好,证明符号化推理对 LLM 更有效。
- 用户研究:
- 在主观评估中,参与者一致偏好 LAMP 生成的视频,特别是在相机运动对齐度、物体运动对齐度和整体视频质量方面。
- 定性结果:
- 生成的视频展现了连贯的相机 - 物体交互(如环绕、跟随、推拉),具有物理一致性和电影感。
5. 意义与影响 (Significance)
- 导演级控制:LAMP 将视频生成从“随机采样”提升到了“导演控制”的层面,允许用户通过自然语言精确编排复杂的镜头语言。
- 可解释性与可控性:通过 DSL 将黑盒的生成过程透明化,使得运动规划变得可编辑、可调试,解决了直接生成 3D 坐标难以修正的问题。
- 通用接口:生成的 3D 轨迹是模型无关的,可以适配多种现有的视频生成模型(T2V, I2V, V2V),为未来的可控视频生成提供了标准化的控制信号。
- 未来方向:为语言驱动的电影制作(Language-driven Cinematography)奠定了基础,未来可进一步扩展至多物体交互、更复杂的物理约束及长序列生成。
总结:LAMP 通过引入大语言模型作为运动规划器,结合电影摄影领域的 DSL,成功解决了视频生成中复杂运动控制难、意图对齐差的问题,实现了从自然语言到高质量、可控视频生成的端到端闭环。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。