← 最新论文
💻 computer science

CinemaTraj: Composing Atomic Camera Trajectories for 3D Scenes with LLM Agents

CinemaTraj 是一个新颖的框架,它利用大语言模型(LLM)智能体和结构化 3D 场景图,将自然语言提示词分解为原子的、无碰撞的摄像机运动,从而从真实世界 3D 环境中生成高质量的带解说视频。

原作者: Qianru Li, Xuyang Chen, Erkin Türköz, Lu Liu, Xuqin Wang, Liqiu Meng, Tao Wu, Yanfeng Zhang

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Qianru Li, Xuyang Chen, Erkin Türköz, Lu Liu, Xuqin Wang, Liqiu Meng, Tao Wu, Yanfeng Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你手里拿着一部神奇的摄像机,它可以飞越任何房间,但不是由你来操控,你只需要对它说话。“绕着沙发飞一下,然后放大聚焦到花瓶上,”你说道。在计算机科学领域,这是一个被称为**相机轨迹生成(camera trajectory generation)**的梦想。这是一门教计算机如何在三维空间中移动虚拟相机的艺术,使其看起来像是在拍电影,而不仅仅是随机游走。

长期以来,计算机在两件事上表现出色:理解语言(比如阅读一个故事)和理解三维形状(比如知道墙在哪里)。但让它们协同工作一直是个难题。一些旧方法试图仅根据平面图像来猜测路径,这就像戴着眼罩在迷宫中导航——它们经常撞上隐形的墙。其他方法虽然非常擅长避障,却不知道如何让相机进行“电影感”的移动,导致画面抖动、枯燥,看起来像监控摄像头而非电影。核心问题在于:我们能否教会计算机同时理解电影导演的“语言”和三维空间的“物理特性”?

于是,CinemaTraj 诞生了,它是一个像超级聪明的电影导演助手一样的框架。其背后的研究人员意识到,要制作出精彩的电影路径,你需要一个理解语言的“大脑”和一个理解三维空间的“地图”。他们构建了一个系统,其中大型语言模型(LLM)——一种非常擅长理解人类语言的 AI——会获得一个特殊的“三维场景图(3D scene graph)”。把这个图想象成一张详细的数字蓝图,它能告诉 AI 沙发具体在哪里,是否贴着墙,以及天花板有多高。

有了这张蓝图,AI 不再只是瞎猜,而是进行规划。当你输入“给我来一场这个客厅的电影感巡礼”时,AI 会将这一请求分解为微小的、专业的电影运镜动作。它会决定“环绕(orbit)”沙发(绕着它转圈)、“升降(crane)”向电视(垂直移动)以及“缩放(zoom)”聚焦到花瓶。这些都不是随机的动作,而是真正的导演所使用的特定、命名的摄影技术。随后,系统会为这些动作构建一条平滑的路径,但最巧妙的部分在于:它使用了一个被称为“符号距离函数(Signed Distance Field, SDF)”的数学“安全网”。想象一下,这是一个隐形的力场,如果相机离家具太近,它就会将相机推开,确保相机永远不会撞到咖啡桌或被卡在椅子后面。

论文显示,这种方法的效果非常出色。在利用真实世界三维扫描房间(来自名为 ScanNet++ 的数据集)进行的测试中,CinemaTraj 创建的路径比以往的方法更加平滑且安全。它完美地遵循了用户的指令,几乎完全避免了碰撞,甚至还添加了同步的旁白和字幕来讲述一个故事。研究人员发现,相比于仅仅计算几何线条,他们的方法能更好地让相机像人类导演那样移动。

然而,论文也谨慎地指出了一些目前还无法实现的功能。它目前适用于静态房间,即没有任何物体移动的情况。如果有人在摄像过程中走过场景,系统还无法识别并躲避。此外,它专注于单次连续的镜头,而非通过剪辑组合成一整部电影或进行场景切换。但就目前而言,CinemaTraj 证明了通过给 AI 一张好的地图并教会它电影语言,我们终于可以生成既安全又真正具有电影感的 3D 相机路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →