✨ 要点🔬 技术摘要
将简单的文本描述转化为三维物体已成为游戏开发者、电影制作人和机器人专家手中的强大工具,他们需要将自然语言转化为数字资产。多年来,挑战一直在于如何在质量与速度之间取得平衡。现有的方法通常走的是两条路径之一。第一种方法通过逐个构建物体的微小部分来构建形状,一次只决定一个极小的部件。虽然这种方法可以产生细节丰富的成果,但它是一个缓慢的顺序过程,早期产生的错误在后期无法轻易修复。第二种方法试图一次性优化整个物体,同时调整每一个部分。这在理论上更快,但随着物体变得更加精细,计算成本会变得极其高昂且缓慢,因为计算机必须反复处理整个形状以达到理想效果。研究人员长期以来一直寻求一种既能实现高几何保真度又能实现低生成时间的方法,但两者之间的权衡关系始终难以突破。
来自浙江大学及多家国际机构的研究团队推出了一种名为 Block3D 的新方法,它改变了这些数字形状的构建方式。Block3D 不再是一个个微小的标记(token)地构建物体,也不再通过一个巨大的循环来优化整个形状,而是将生成过程分解为易于管理的块(chunks)。想象一下,一个三维物体的数字蓝图就像是一长串指令序列。Block3D 将这个序列划分为连续的块,并从左到右依次生成这些块。然而,在每个块内部,系统并不只是猜测下一个部件,而是同时观察整个块,并一起优化其中的所有部件。这使得计算机可以在进入下一个环节之前,先修正该特定区域内的错误,从而防止小错误在物体构建过程中不断累积。
其核心创新在于系统如何处理不确定性。当模型生成形状的一个块时,它会为每个部件分配一个置信度分数。如果系统对某个特定部分不确定,它可以在该块最终确定并锁定之前对其进行修订。这种“置信度引导的修正”意味着模型可以在实时生成过程中修正自身的错误,但仅限于当前正在处理的部分。一旦一个块完成并添加到不断增长的形状中,它就会被固定下来,随后系统继续向前推进。这种方法既避免了旧方法那种缓慢的步进式猜测,又避开了反复优化整个物体所带来的沉重计算负担。
在利用大规模三维资产及其文本描述数据集进行的测试中,结果令人瞩目。研究人员将这种新方法与使用旧有的逐个部件构建方法的标准微调基准进行了对比。传统方法生成单个三维物体平均需要 25.71 秒,而 Block3D 将这一时间缩短至仅 4.99 秒,速度提升了五倍以上。尽管速度大幅提升,但几何质量并未受到影响。事实上,新方法生成的形状比较慢的基准模型具有更好的几何准确性和与文本提示的对齐度。该系统成功生成了复杂的形态,从风格化的骑士和动物到家具及建筑元素,在保持高保真度的同时,实现了使实时应用成为可能的运行速度。
这项研究证实,通过重新组织计算机处理形状创建序列的方式,是可以打破速度与质量之间长期存在的壁垒的。该方法并不依赖于魔法或复杂的物理学,它仅仅改变了计算机处理信息的时间表,使其能够对小规模数据组进行并行处理,而不是进行严格的线性处理或大规模的重复循环。这种效率的提升表明,高质量的三维生成可能很快就会成为交互式工作流的标准组成部分,在这些工作流中,速度与最终产品的视觉细节同样至关重要。
技术摘要:Block3D:通过块状扩散实现高效的文本到 3D 生成
问题陈述 高质量的文本到 3D 生成面临着几何保真度与推理延迟之间的根本权衡。现有方法通常分为两类,两者在处理高分辨率时都难以兼顾效率。自回归方法按顺序解码形状标记(shape tokens);虽然它们避免了对完整表示的重复处理,但一旦发射标记便无法修正错误,从而导致暴露偏差(exposure bias)和误差累积。相反,扩散和流匹配模型并行地细化全局 3D 表示,但必须在多个去噪步骤中反复处理整个潜序列。随着几何细节的增加,这些全序列细化的计算成本变得极其高昂,导致难以同时实现高保真度和低生成延迟。
方法论 作者提出了 Block3D ,一个将自回归生成的因果依赖从单个形状标记转向连续潜块(latent blocks)的框架。基于 Cube [5] 的离散形状标记表示和 Block Diffusion 调度方案 [43],Block3D 将长度为 N = 1024 N=1024 N = 1024 的固定长度序列划分为 K K K 个连续块。
生成过程遵循块因果调度:
块级自回归(Block-Wise Autoregression): 块从左到右顺序生成。一旦一个块被确定,它就会被“冻结”并添加为因果前缀,防止对已完成部分进行未来的修改。
块内并行去噪(Intra-Block Parallel Denoising): 在当前活跃块内,所有标记通过双向注意力机制进行联合去噪。这使得模型能够并行处理整个块,而不是逐个标记进行处理。
置信度引导的块内修正(Confidence-Guided Intra-Block Correction): 为了在块被提交为前缀之前减轻活跃块内的误差累积,该框架采用了置信度引导的修正机制。该机制结合了**掩码到标记(Mask-to-Token, M2T)恢复(填充被掩码的位置)和 标记到标记(Token-to-Token, T2T)**编辑(修改已填充的位置)。
模型使用每个块 T T T 次迭代的有界解码时界(decoding horizon)。
一个确定性的“揭示配额”(reveal quota)确保每次迭代中至少填充一定数量的掩码位置,从而保证在 T T T 步内完成。
置信度阈值 (η M , η T \eta_M, \eta_T η M , η T ) 决定了是填充还是修正标记,允许模型在块被提交到前缀之前修正低置信度的预测。
训练目标涉及一种编辑感知的破坏策略,使模型接触到被掩码和被替换的形状标记。在计算损失之前,会执行一步基于模型的展开(one-step model-based rollout),使模型能够从其自身生成的候选对象(残差误差)而非仅仅从初始破坏中学习。
核心贡献
块因果自回归框架: Block3D 将 Cube [5] 中的因果时界从单个标记重新定义为潜块。这实现了块内的并行去噪,同时保持了顺序生成顺序,显著降低了逐标记自回归固有的顺序解码延迟。
置信度引导的块内修正: 作者引入了一种集成 M2T 恢复与 T2T 编辑的机制。通过在最终确定前修正活跃块内的低置信度标记,该方法在不牺牲块级生成效率的情况下缓解了误差累积。
效率与保真度: 该框架在不损害几何质量的前提下实现了生成时间的显著减少,证明了块状扩散在效率上可以优于纯自回归和全序列扩散基准。
实验结果 在来自 TRELLIS-500K 数据集的 100 个留出对象集上进行评估,Block3D 展示了优于包括 ShapeLLM-Omni、TRELLIS-text、AR3D-R1 和微调后的 Cube 基准在内的多种方法的性能。
几何保真度: Block3D 在评估的方法中实现了最佳的几何指标,其 Chamfer-L1 距离为 0.078 ,法线一致性(Normal Consistency)为 0.668 ,以及 1% F-score 为 0.309 。这些结果超过了微调后的 Cube 基准(CD-L1: 0.094)和其他最先进的方法。
推理速度: 该方法将平均端到端生成时间从 25.71 秒 (Cube 基准)缩短至 4.99 秒 ,实现了 5.15 倍的加速 。
消融研究: 实验证实,块大小 B = 64 B=64 B = 64 在延迟与质量之间提供了最佳平衡。当去噪步数 (T T T ) 超过 4 步时,质量收益递减且延迟增加。与仅含 M2T 的变体相比,加入 T2T 编辑进一步提升了几何指标和文本-形状对齐度。
意义与主张 本文声称,Block3D 通过将因果依赖从标记转向块,成功解决了文本到 3D 生成中的延迟-质量瓶颈。通过保留固定的离散表示并缩短所学先验的顺序时界,该方法避免了全序列扩散的重复细化成本以及逐标记自回归的不可逆误差累积。
作者指出,该方法专门设计用于处理固定解码时界内的块内误差。他们承认在跨块暴露偏差和语义部件结构方面的局限性,因为已提交的前缀块是不可变的。因此,这项工作将 Block3D 定位为迈向高效、高保真 3D 生成的一步,并建议未来的工作探索跨块细化和更广泛的形状表示。该方法在大幅提高生成速度的同时,保持了具有竞争力的文本-形状对齐度(CLIPScore),使得高品质 3D 资产的创建对于延迟敏感型应用更具可行性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。