← 最新论文
💻 computer science

Block3D: Efficient Text-to-3D Generation via Block-Wise Diffusion

Block3D 是一个高效的文本到 3D 生成框架,它将离散形状标记划分为连续块进行联合去噪,并采用置信度引导的块内修正,在保持高几何保真度的同时,实现了比自回归基线模型快 5.15 倍的速度。

原作者: Bowen Cui, Weijie Wang, Zeyu Zhang, Yefei He, Mingda Lin, Haoyu Zhao, Yuanyu He, Donny Y. Chen, Feng Chen, Bohan Zhuang

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Bowen Cui, Weijie Wang, Zeyu Zhang, Yefei He, Mingda Lin, Haoyu Zhao, Yuanyu He, Donny Y. Chen, Feng Chen, Bohan Zhuang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

将简单的文本描述转化为三维物体已成为游戏开发者、电影制作人和机器人专家手中的强大工具,他们需要将自然语言转化为数字资产。多年来,挑战一直在于如何在质量与速度之间取得平衡。现有的方法通常走的是两条路径之一。第一种方法通过逐个构建物体的微小部分来构建形状,一次只决定一个极小的部件。虽然这种方法可以产生细节丰富的成果,但它是一个缓慢的顺序过程,早期产生的错误在后期无法轻易修复。第二种方法试图一次性优化整个物体,同时调整每一个部分。这在理论上更快,但随着物体变得更加精细,计算成本会变得极其高昂且缓慢,因为计算机必须反复处理整个形状以达到理想效果。研究人员长期以来一直寻求一种既能实现高几何保真度又能实现低生成时间的方法,但两者之间的权衡关系始终难以突破。

来自浙江大学及多家国际机构的研究团队推出了一种名为 Block3D 的新方法,它改变了这些数字形状的构建方式。Block3D 不再是一个个微小的标记(token)地构建物体,也不再通过一个巨大的循环来优化整个形状,而是将生成过程分解为易于管理的块(chunks)。想象一下,一个三维物体的数字蓝图就像是一长串指令序列。Block3D 将这个序列划分为连续的块,并从左到右依次生成这些块。然而,在每个块内部,系统并不只是猜测下一个部件,而是同时观察整个块,并一起优化其中的所有部件。这使得计算机可以在进入下一个环节之前,先修正该特定区域内的错误,从而防止小错误在物体构建过程中不断累积。

其核心创新在于系统如何处理不确定性。当模型生成形状的一个块时,它会为每个部件分配一个置信度分数。如果系统对某个特定部分不确定,它可以在该块最终确定并锁定之前对其进行修订。这种“置信度引导的修正”意味着模型可以在实时生成过程中修正自身的错误,但仅限于当前正在处理的部分。一旦一个块完成并添加到不断增长的形状中,它就会被固定下来,随后系统继续向前推进。这种方法既避免了旧方法那种缓慢的步进式猜测,又避开了反复优化整个物体所带来的沉重计算负担。

在利用大规模三维资产及其文本描述数据集进行的测试中,结果令人瞩目。研究人员将这种新方法与使用旧有的逐个部件构建方法的标准微调基准进行了对比。传统方法生成单个三维物体平均需要 25.71 秒,而 Block3D 将这一时间缩短至仅 4.99 秒,速度提升了五倍以上。尽管速度大幅提升,但几何质量并未受到影响。事实上,新方法生成的形状比较慢的基准模型具有更好的几何准确性和与文本提示的对齐度。该系统成功生成了复杂的形态,从风格化的骑士和动物到家具及建筑元素,在保持高保真度的同时,实现了使实时应用成为可能的运行速度。

这项研究证实,通过重新组织计算机处理形状创建序列的方式,是可以打破速度与质量之间长期存在的壁垒的。该方法并不依赖于魔法或复杂的物理学,它仅仅改变了计算机处理信息的时间表,使其能够对小规模数据组进行并行处理,而不是进行严格的线性处理或大规模的重复循环。这种效率的提升表明,高质量的三维生成可能很快就会成为交互式工作流的标准组成部分,在这些工作流中,速度与最终产品的视觉细节同样至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →