← 最新论文
💻 computer science

MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling

MegaParts 是一个可扩展且具有令牌效率的自回归框架,它结合了矢量量化形状分词器与大语言模型,用以生成具有高达 300 个组件的高保真、部件感知型 3D 物体,克服了现有方法的内存和长度限制。

原作者: Manwen Liao, Xinyu Lian, Jian Mao, Kaixu Chen, Li Luo, Jinghao Yan, Wanshui Gan, Qiao Yu, Weitian Zhang, Chunhua Shen, Guang Chen, Bo Dai, Xudong Xu, Zhaoyang Lyu

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Manwen Liao, Xinyu Lian, Jian Mao, Kaixu Chen, Li Luo, Jinghao Yan, Wanshui Gan, Qiao Yu, Weitian Zhang, Chunhua Shen, Guang Chen, Bo Dai, Xudong Xu, Zhaoyang Lyu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在电子游戏、虚拟现实和动画电影的数字世界中,物体很少仅仅是单一、实心的块状物。汽车有可以开启的车门和可以转动的轮子;机器人有可以弯曲的关节和可以更换的工具。为了让计算机创建这些复杂的物品,它们需要理解一个物体是由许多相互协作的小型、独立部件组成的集合。这种被称为“部件感知生成”(part-aware generation)的概念,使得数字艺术家能够精确地编辑模型的特定部分或使其运动。然而,教导计算机构建这些复杂的装配体一直是一个艰巨的挑战。传统方法在部件数量增加时往往难以应对,会被描述数百个组件的每一条曲线和边缘所需的海量数据所压垮。随着物体复杂性的增加,描述其细节的计算成本往往变得过高而无法实现,从而限制了真正精巧的数字资产的创作。

研究人员最近推出了一种名为 MegaParts 的新方法,旨在通过将 3D 物体的创建更像是一项语言任务而非几何谜题来克服这些局限性。该系统不再试图一次性生成整个复杂的形状,而是将这一过程分解为一系列步骤,就像作家逐字逐句地构思故事一样。由包括香港大学和上海人工智能实验室在内的机构科学家领导的团队开发出一种方法,可以生成由多达 300 个不同部件组成的物体。这是一个显著的进步,因为以往的方法在物体超过几十个组件时通常就会失效。该系统的工作原理是首先规划物体的布局,决定每个部件的位置,然后依次生成每个部件的详细形状,并将它们组装成一个完整且连贯的整体。

核心创新在于系统如何处理描述这些形状所需的数据。在以往的尝试中,描述一个复杂的物体需要海量的数字信息,往往会超出计算机内存的极限。MegaParts 团队通过创造一种极其高效的方式来压缩每个部件的描述解决了这个问题。他们开发了一个分词器(tokenizer),将 3 分形几何形状转换为一段简短的数字代码序列。至关重要的是,这个工具是自适应的:它对简单的部件(如平坦的桌腿)使用极少的代码,但仅在必要时才为复杂的部件(如机器的精细齿轮)分配更多代码。这确保了不会在简单形状上浪费任何数字空间,同时保留了复杂部件所需的精细细节。通过最小化每个组件所需的数据量,该系统可以处理拥有数百个部件的物体,而不会耗尽内存或损失质量。

一旦系统拥有了这种高效的形状描述方式,它就会使用大型语言模型来进行组装。该模型经过训练,可以遵循逻辑性的思维链,类似于人类处理建筑项目的方式。它首先预测最终物体的整体尺寸和位置。接着,它确定该物体内每个独立部件的位置和大小。最后,它生成每个部件的具体形状代码,并将它们放置在指定位置。这种结构化的方法使计算机能够保持对部件如何相互契合的清晰理解,从而防止了不同组件融合在一起变成一个无法辨认的整体这一常见错误。其结果是,生成的 3D 物体不仅视觉上准确,而且在结构上也是稳固的,每个部件都保持着独立性和可编辑性。

研究人员在包含从家具到机械装置在内的庞大 3D 模型数据集上测试了他们的系统。他们发现 MegaParts 可以成功生成多达 300 个部件的物体,这种规模是此类技术此前无法实现的。在实验中,该系统生成的网格具有比现有方法更高的几何质量,其中包括目前作为 3D 生成标准的扩散模型。团队证明,通过高效压缩数据,他们并没有牺牲最终形状的保真度;事实上,生成的物体通常比其他方法创建的物体更加精细且结构连贯。这表明,使用类语言模型的推理方式来构建 3D 物体是一种强大的替代传统方法的方式,为创建高度复杂、具有交互性的未来数字世界提供了路径。

这项工作的意义不仅限于制作外观更好的模型。由于该系统将物体生成为结构化的部件装配体,它为动画和模拟领域开辟了新的应用前景。艺术家现在可以获取生成的物体并轻松修改单个组件,例如更换椅腿或调整机器人的手臂,而无需从头开始重建整个模型。这种能力对于创建关节资产至关重要,即那些部件需要进行真实运动和交互的资产,例如钢琴的琴键或控制面板上的按钮。这种大规模生成详细、交互式结构的能力,可能会改变游戏、电影和虚拟环境内容的创作方式,推动行业向着计算机能像写句子一样轻松构建复杂、功能性世界的未来迈进。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →