← 最新论文
💻 computer science

MultiCube: Compositional 3D Generation With Part-Level Semantic and Spatial Control

MultiCube 是一种新颖的两阶段扩散方法,它通过接收全局文本提示以及特定的部件级语义和空间布局,实现了精确的组合式 3D 生成,从而产生具有可独立控制组件的高质量 3D 物体。

原作者: Ava Pun, Kangle Deng, Yiheng Zhu, Jun-Yan Zhu, Maneesh Agrawala, Tinghui Zhou

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Ava Pun, Kangle Deng, Yiheng Zhu, Jun-Yan Zhu, Maneesh Agrawala, Tinghui Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

为电影、视频游戏和虚拟世界创建数字3D物体传统上是一项劳动密集型的工艺。艺术家们需要花费数小时手动进行雕刻、绘画和组装复杂的模型,以确保每一个轮子、机翼或肢体都精确地放置在应有的位置。近年来,人工智能开始自动化这一过程,允许计算机根据简单的文本描述生成3D形状。然而,这些早期的AI系统通常生成的是实心的、单一整体的物体,缺乏专业使用所需的内部结构。如果开发者需要一个拥有可活动手臂的角色或是一个拥有可拆卸车轮的车辆,标准的AI生成模型往往是无用的,因为它们仅仅是一个连续的几何体块。研究人员面临的挑战在于,不仅要教会计算机如何制作一个形状,还要让它理解一个形状是由可以被单独控制的、截然不同的、有意义的部分组成的。

一组研究人员推出了一种名为MultiCube的新系统,旨在通过让创作者精确控制生成3D物体中每个部分的身份和位置来解决这个问题。用户不再只是简单地要求计算机“做一个机器人”,而是现在可以明确指定他们想要哪些部件——例如一个头部、两条手臂和四个轮子——并告诉系统每个部件应该在空间中的确切位置。随后,该系统会生成一个完整的3D物体,其中每个组件都是一个独立的、可编辑的零件,并完美地符合用户的指令。这种方法弥合了基于文本生成的创意自由度与专业3D建模的严格结构要求之间的鸿沟。

MultiCube的核心创新在于它如何解释指令。以往的方法可能会接收一个文本提示和一个大致的位置概念,但它们往往难以保持部件的独立性或确保其处于正确的位置。MultiCube的工作方式是接受三个特定的输入:对整体物体的描述、所需特定部件的列表,以及一组定义每个部件大小和位置的不可见方框。想象一下,一位用户描述了一个“坚固的金属手电筒”,并将它的组件列为手柄、开关和透镜。然后他们在虚拟空间中画了三个方框:一个用于手柄,一个用于开关,一个用于透镜。系统会将这些方框作为严格的引导,确保生成的柄部位于第一个方框内,开关位于第二个方框内,透镜位于第三个方框内,同时看起来仍是一个凝聚统一的手电筒。

为了实现这一点,研究人员构建了一个两步走的流程。首先,计算机生成一个包含所有请求部件及其正确位置的单一实心形状。它通过学习将每个部件的文本描述与其分配到的特定方框联系起来来实现这一点。系统中的一个特殊组件,称为“部件布局适配器”(Part Layout Adapter),充当了一个翻译器,负责保持每个部件信息的独立性,防止计算机在哪个方框中属于哪个部件的问题上产生混淆。一旦这个实心形状被创建出来,系统就会进入第二步,即小心地将这个实心物体重新分解为用户所请求的各个独立部件。这确保了最终结果不仅仅是一个单一的网格,而是一系列完美契合的独立3D模型集合。

这种方法的成果相比现有工具有了显著提升。在测试中,MultiCube能够生成复杂的物体,如带有外露转轮的左轮手枪、拥有多个头部的雄伟鹰怪,或是具有特定肢体的机械机器人,同时还能严格遵循用户的空间指令。与其他系统相比,MultiCube生成的形状在预期布局方面更加准确,且错误(如部件重叠或缺失)更少。该系统还具备足够的灵活性来处理变化;如果用户决定将生物的腿换成翅膀,或者拉长尾巴,系统可以在保持其余结构完整的同时,利用新部件重新生成物体。

除了静态物体之外,这项技术还为更动态的应用打开了大门。由于系统生成的是作为独立、带标签部件的物体,这些部件可以立即用于动画制作。使用MultiCube创建的角色可以独立移动其手臂和腿部,而无需进行繁琐的手动绑定——这一过程通常需要艺术家手动定义关节如何弯曲和旋转。研究人员还展示了该系统可以实现完全自动化:通过将其连接到大型语言模型,用户只需输入类似“一个温馨的卧室”的描述,系统就会自动确定必要的部件(床、床头柜、灯),并在逻辑布局中排列它们,而无需任何手动绘制方框的操作。

尽管该系统功能强大,但研究人员也承认它并不完美。如果定义部件的方框绘制方式在物理逻辑上不成立(例如将一个轮子放在头部内部),生成的物体可能会看起来很奇怪。此外,系统偶尔会产生轻微重叠的部件,尽管这种情况很少见。尽管存在这些细微的局限性,这项工作仍代表了使3D创作变得更加易得且可控的重要进步。通过赋予用户不仅能决定物体外观,还能决定其构建方式及部件位置的能力,MultiCube正使人工智能向专业艺术家所要求的控制水平迈进,将简单的文本和粗略的草图转化为复杂的、可用的3D资产。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →