← 最新论文
💻 computer science

Lighting-grounded Video Generation with Renderer-based Agent Reasoning

本文提出了 LiVER 框架,通过引入大规模 3D 场景标注数据集、基于渲染的控制信号解耦机制以及将用户指令自动转化为 3D 控制信号的智能体,实现了在保持高保真度和时间一致性的同时,对视频生成中的布局、光照和相机轨迹等关键场景因素进行精确且解耦的可控生成。

原作者: Ziqi Cai, Taoyu Yang, Zheng Chang, Si Li, Han Jiang, Shuchen Weng, Boxin Shi

发布于 2026-04-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziqi Cai, Taoyu Yang, Zheng Chang, Si Li, Han Jiang, Shuchen Weng, Boxin Shi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位电影导演,想要用 AI 生成一段视频。以前的 AI 就像是一个**“凭感觉画画”的艺术家**:你给它一个指令“夕阳下的海边”,它确实能画出一张很美的图,但如果你说“让太阳慢慢落山,影子要变长”,它可能就会画错,或者让太阳突然瞬移,影子也不对劲。它不懂物理规律,光线和物体之间的关系是混乱的。

这篇论文提出的 LiVER,就是为了解决这个问题。它给 AI 装上了一个**“懂物理的灯光师”和一个“严谨的 3D 导演”**。

我们可以把 LiVER 的工作流程想象成拍摄一部好莱坞大片的三个步骤

1. 第一步:组建“虚拟剧组” (Agent Reasoning)

以前,你直接给 AI 写剧本(文字提示),AI 就瞎猜怎么拍。
LiVER 不一样,它先派出一个**“智能导演助手” (Agent)**。

  • 它的任务:当你输入“夕阳下的海边”时,这个助手不会直接开始画,而是先像个真正的导演一样思考:
    • 场景搭建:海边有什么?沙滩、礁石、椰子树。它们摆在哪里?(布局)
    • 灯光设计:夕阳是什么颜色的?光线从哪个角度照过来?影子有多长?(光照)
    • 运镜规划:摄像机怎么动?是慢慢推进,还是绕着转圈?(相机轨迹)
  • 成果:它不直接生成视频,而是先画出了一套**“施工图纸”**(3D 场景、光照地图、摄像机路径)。这就像在拍电影前,先搭好了一个精确的 3D 模型布景。

2. 第二步:制作“物理光效参考图” (Renderer-based Scene Proxy)

有了“施工图纸”后,LiVER 不会直接让 AI 去猜光影,而是用专业的3D 渲染引擎(就像 Blender 这种软件)先算一遍。

  • 它做了什么:它根据刚才的图纸,生成了一组**“光效参考图”**。这组图非常特别,它把光线拆解成了三层:
    1. 漫反射层:物体本身的颜色(比如沙滩是黄的)。
    2. 粗糙层:物体表面粗糙的地方怎么反光(比如石头怎么漫反射)。
    3. 高光层:物体光滑的地方怎么反光(比如水面或玻璃的反光)。
  • 比喻:这就好比在拍电影前,灯光师先给每个物体贴上了**“反光贴纸”。AI 在生成视频时,不是靠猜“这里应该有光”,而是看着这些贴纸,“照着做”**。这样,光线打在玻璃杯上会有真实的反光,打在皮肤上会有柔和的阴影,完全符合物理规律。

3. 第三步:AI 演员“按图索骥” (Video Synthesis)

最后,真正的 AI 视频生成模型(大导演)登场了。

  • 它的任务:它手里拿着刚才那套“光效参考图”和“施工图纸”。
  • 怎么拍:它不再瞎猜了。它看着参考图,知道哪里该亮、哪里该暗、影子该往哪边倒。它只需要负责把画面画得**“像真的一样”(比如让海浪动起来,让树叶摇曳),而“光线和位置”**这些硬指标,完全由前面的图纸决定。
  • 结果:生成的视频里,太阳移动时,影子会平滑地拉长;摄像机旋转时,物体的反光会自然地变化。一切都**“严丝合缝”**。

为什么这很厉害?(核心创新)

  1. 把“乱炖”变成了“分步走”
    以前的 AI 是把“光线”、“物体”、“摄像机”混在一起学,容易学糊涂。LiVER 把它们拆开:先算好物理光线,再让 AI 去画。就像学做菜,先准备好切好的菜和调好的料,厨师(AI)只需要负责炒,味道(物理效果)就不会出错。

  2. 造了一个“超级题库” (LiVERSet)
    为了让 AI 学会这些物理规律,作者们自己造了一个包含1.1 万条视频的数据库。

    • 一部分是真实世界的视频(去分析真实的光影)。
    • 一部分是电脑合成的视频(专门设计各种奇怪、复杂的光照场景,让 AI 见多识广)。
      这就好比让 AI 看了无数部“物理光学教科书”,它自然就懂了。
  3. 像玩游戏一样“可编辑”
    因为视频是基于 3D 图纸生成的,所以你可以随时修改。

    • 觉得光线太暗?改一下“灯光图纸”,视频里的光线立马变亮,而且影子方向完全正确。
    • 觉得摄像机角度不对?改一下“运镜图纸”,视频里的镜头就跟着变。
      这就像是在玩一个**“可无限重来的 3D 电影模拟器”**。

总结

简单来说,LiVER 就是给 AI 视频生成加了一个**“物理引擎”“专业导演组”**。它不再让 AI 靠“猜”来生成光影,而是先算好物理规律,再让 AI 去执行。

这就好比以前 AI 画画是**“蒙眼摸象”,现在 LiVER 是“拿着蓝图施工”。生成的视频不仅画面漂亮,而且光影、影子、反光都符合物理常识**,真正做到了“所见即所得”,让普通人也能像专业电影人一样控制视频里的每一束光。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →