3D 理解(侦探): 你向它展示一个 3D 模型(比如一把椅子),它会写下一段完美的描述。如果你提供几张从不同角度拍摄的椅子照片,它在描述颜色和纹理方面会做得更好。
3 D 生成(雕塑家): 你输入“给我做一个背着背包的红色机器人”,系统会利用侦探的知识来引导雕塑家,精准地构建出那个机器人。
3D 编辑(装修队): 这是最酷的部分。你可以给它一个现有的 3D 物体(比如一个站立的人),然后下达指令如“弯曲他的膝盖让他坐下”。系统理解原始形状,读取你的指令,并告诉雕塑家如何在不破坏其身份特征的前提下重塑物体。这就像是告诉雕塑家,“把这个粘土雕像的膝盖轻轻弯曲一下”,而不是要把整个雕像熔化掉重新开始。
这意味着该系统的训练成本更低,能更好地兼容现有工具,并且能生成更高质量、完全符合你要求的 3D 物体,甚至能捕捉到微小的细节(比如椅子上的“圆形镂空”)。因为它是一个“即插即用”的解决方案,所以你可以更换不同的侦探或雕塑家,而中间的桥梁依然能够正常工作。
技术摘要:PnP-U3D
问题陈述 虽然大型多模态模型已成功统一了 2D 理解与生成,但将这一范式扩展到 3D 领域仍处于探索阶段。现有的尝试将 3D 任务统一在单一自回归(AR)范式下的方法(如 ShapeLLM-Omni)面临显著局限。这些方法需要将连续的 3D 信号离散化为 Token,导致量化引起的信息丢失、高昂的训练成本,并且无法有效利用预训练的大型语言模型(LLM)先验知识。此外,纯自回归框架难以在支持理解任务的同时,维持 3D 生成所需的高保真度。核心挑战在于如何弥合大规模语言模型在理解方面的丰富先验与 3D 生成数据稀缺性之间的不对称性,且无需强行采用一种会损害专业模型固有优势的统一范式。
方法论 作者提出了 PnP-U3D,这是一个即插即用(Plug-and-Play)框架,它将 3D 理解和生成解耦到各自的最优范式中,同时实现有效的跨模态交互。
双范式架构:
3D 理解(自回归): 该框架采用自回归下一 Token 预测范式进行理解。它扩展了一个预训练的 2D 视觉语言模型(VLM),具体为 QwenVL-2.5,以处理 3D 形状。一个 3D 形状 x 通过预训练的 3D VAE(Hunyuan3D 2.1)被编码为连续潜变量 u。一个轻量级的 MLP 投影器将这些潜变量映射到 VLM 的 Token 嵌入空间。VLM 保持冻结,仅训练投影器以预测文本描述 t。
3D 生成(扩散): 对于生成,该框架利用连续扩散范式。给定文本提示 t,会在输入中附加一组固定长度的可学习查询 Token Q。这些查询通过冻结的 VLM 以提取丰富的高层特征。一个轻量级的 Transformer 连接器随后将这些特征投影到预训练 3D 扩散模型(DiT)的条件嵌入空间中。扩散模型生成 3D 潜变量 z,并将其解码回网格几何体。
3D 编辑: 同一套机制支持指令驱动的编辑。输入序列包括文本指令、源 3D 形状的潜表示以及可学习的查询。VLM 提取联合文本-形状特征,连接器将其与扩散模型对齐,以生成编辑后的潜变量 zedit。
训练策略:
该框架采用“即插即用”策略,其中沉重的骨干模型(VLM 和 3D 扩散模型)保持冻结。
训练分为三个阶段,使用不同的数据集进行:(1) 3D 理解(40K 个形状),(2) 文本到 3D 生成(320K 个形状),以及 (3) 3D 编辑(14K 个形状-提示对)。
3D 生成: 在文本到 3D 生成方面,该方法在基准模型(Trellis, ShapeLLM-Omni, SAR3D, GaussianAnything)中取得了最佳的 Q-Align 分数,表明文本提示与生成的形状之间具有卓越的对齐度。定性结果显示,该模型能够捕捉到竞争对手经常忽略的细粒度细节(例如“圆形镂空”)。
3D 编辑: 模型成功执行了复杂的姿态和外观编辑(例如将男性形象改为女性形象),同时保持了原始物体的身份。消融研究表明,增加查询 Token 的长度(最高至 1024)能显著提高对输入属性的保持能力和语义对齐度。
泛化能力: 尽管在 1024 个 Token 上进行训练,但该框架在推理时表现出对更长潜变量(高达 4096)的鲁棒性,并能有效地适配不同的 3D 生成骨干模型(如 CraftsMan3D)。
意义 论文声称,PnP-U3D 凸显了“统一 AR+Diffusion 模型”作为构建更通用 3D 智能的极具前景的方向。通过证明有效的统一并不需要强制执行单一的自回归范式,这项工作为 3D 任务提供了一条可扩展且具有成本效益的路径。作者认为,他们的方法为开发统一的 3D 理解-生成模型及智能编辑系统提供了新的视角,鼓励社区去探索那些能够利用预训练先验而非丢弃它们的架构。