✨ 要点🔬 技术摘要
想象一下,你想要为电子游戏或机器人仿真构建一个逼真的3D世界。过去,AI工具能够创建3D物体,但它们往往看起来像光滑、模糊的黏土雕塑。它们缺乏锐利的边缘,材质在不同光照下显得不真实,而且物体只是“实心块”,无法拥有像门或轮子那样的可动部件。
Seed3D 2.0 是字节跳动推出的全新升级版本,旨在解决这些问题。你可以把它想象成从儿童的橡皮泥套装进阶到了专业建筑师的3D打印机,后者不仅能构建物体,还能制造可动的机械装置。
以下是其工作原理的简化分解:
1. 构建形状:“草稿”与“精修”
旧的AI试图一次性构建整个形状,这往往导致细节混乱。Seed3D 2.0 采用两步流程 ,就像雕塑家分阶段工作:
阶段1(草稿): AI快速构建物体的基本骨架和整体形状。它把握住了大体轮廓,但表面略显光滑和模糊。
阶段2(精修): AI基于该草稿,回头添加微小的高频细节。它锐化边缘、添加划痕并修正曲线。
核心秘诀: 为了实现快速高效,他们使用了一种特殊的“压缩工具”(局部感知VAE)。想象一下收拾行李箱:与其把每件衬衫单独折叠,这个工具会智能地将相似物品归类打包,这样行李箱(计算机内存)保持小巧,但当你 unpack 时,衣物依然平整如新。
2. 绘制表面:“智能画师”
过去,AI会先给物体上色,然后在单独的步骤中猜测材质(是金属?还是塑料?)。这常导致错误,例如一个闪亮的塑料玩具看起来像湿金属。
Seed3D 2.0 的方法: 它使用统一画师 。它同时绘制颜色(反照率)和材质属性(光泽度或粗糙度)。
“智能助手”: 为了帮助AI理解材质“应该”是什么样子,它会咨询一位“智能助手”(视觉 - 语言模型)。如果你要求一个“生锈的蒸汽朋克机器人”,助手会告诉画师:“好的,这需要看起来像陈旧的铜和风化的金属,而不仅仅是棕色油漆。”这防止了AI犯下违背物理常识的错误,比如让橡胶球看起来像镜子。
3. 使其“仿真就绪”:“乐高构建者”
这是最大的飞跃。之前的模型生成的是实心、静态的雕像。如果你想要一把带有可动扶手的椅子,旧的AI无法做到。Seed3D 2.0 引入了三种新工具,以创建能够在物理世界中真正交互 的物体:
场景规划器: 它不仅能生成单个物体,还能根据文本描述或视频,规划整个房间的布局。它决定沙发放在哪里、桌子应该多大,以及它们如何摆放而不互相碰撞。
部件分解器: 它可以观察一个实心物体(如烤面包机),并识别出哪些部分是独立的(门、杠杆、底座)。它将物体分解为功能性的“乐高积木”。
“铰链”制造者: 一旦部件分离,AI就会确定它们的运动方式。它会问:“这扇门是绕铰链摆动吗?这个轮子是旋转的吗?”然后构建不可见的关节和限制(门能打开的最大角度),以便物体在物理引擎中正确运作。
4. 结果
团队将 Seed3D 2.0 与另外五款顶级商业AI模型进行了测试。他们请人类专家从成对的3D物体中挑选最佳的一个。
结果: Seed3D 2.0 几乎每次都获胜。在创建全纹理3D物体的测试中,其受青睐程度比竞争对手高出 69% 到 90% 。
意义所在: 它创建的物体不仅仅是漂亮的图片;它们是“仿真就绪”的。这意味着它们足够精确,可用于机器人训练、虚拟现实或3D打印,在这些场景中,物体需要表现得与真实世界物体完全一致。
简而言之: Seed3D 2.0 将过去那些杂乱、模糊、静态的3D物体,转化为锐利、逼真且可交互的资产,随时可用于复杂的现实世界应用。
技术摘要:Seed3D 2.0
问题陈述
尽管 Seed3D 1.0 为仿真就绪的 3D 资产生成奠定了基础,但两个关键差距阻碍了其在高保真生产环境(XR、机器人技术、3D 打印)中的部署:
质量差距 :现有模型(包括 Seed3D 1.0)难以生成具有锐利边缘的几何规则形状,以及在不同光照下保持一致的物理材质(PBR)。单阶段生成流程往往难以平衡全局结构学习与高频细节恢复。
能力差距 下游应用日益需要连贯的多物体场景、功能分解的物体以及支持部件级物理交互的资产。Seed3D 1.0 仅限于静态、整体的网格,缺乏部件级分解或关节运动能力。
方法论
Seed3D 2.0 通过涵盖几何、纹理和仿真就绪能力的全面系统升级来解决这些差距,并由严格的数据管道提供支持。
1. 几何生成
该系统采用由粗到细的两阶段流程 ,将全局结构学习与高频细节恢复解耦:
Seed3D-VAE :一种局部感知变分自编码器将连续 3D 几何压缩为紧凑的 VecSet 表示。它利用局部感知潜在聚合 将表示能力集中在几何复杂区域,并采用内容自适应稀疏路由机制 以降低解码延迟,同时保持重建保真度。
Seed3D-DiT :一种基于整流流的扩散 Transformer 分两个阶段运行:
阶段 1(粗略结构) :从图像条件生成几何基础,确立全局拓扑。
阶段 2(细节细化) :细化阶段 1 的输出以恢复高频细节。该阶段通过粗略形状先验 (部分扩散的阶段 1 潜在变量)和源自粗略几何的体素化位置编码 进行正则化,确保结构规则性和锐利边缘恢复。
2. 纹理与材质生成
Seed3D 2.0 用统一 PBR 模型 取代了其前身级联流程:
直接生成 :该模型直接从参考图像和 3D 几何生成多视图**反照率(albedo)和 金属度 - 粗糙度(MR)**贴图,消除了多视图 RGB 合成带来的中间误差累积。
混合专家(MoE) :MoE 架构实现了更高分辨率的生成和更丰富的视觉模式(包括文本和精细纹理),而无需成比例的计算开销。
基于 VLM 的条件控制 :为了解决未知光照下材质估计的病态性质,视觉 - 语言模型(VLM)提供语义先验(材质类型、表面特征)作为条件令牌,稳定生成过程并提高物理合理性。
3. 仿真就绪生成模型套件
为了弥合静态生成与交互式仿真之间的差距,Seed3D 2.0 引入了三个无需训练或微调的模块:
场景布局规划 :从文本、图像或视频输入推断空间一致的物体布局。对于视觉输入,它利用深度估计和 VLM 恢复全局结构;对于文本输入,微调后的 LLM 处理空间推理以生成物体描述和布局。
部件级生成 :采用“先感知后生成”流程,使用Seed3D-PartSeg (用于表面分割)和Seed3D-PartDiT (用于部件感知重建)将资产分解为功能有意义的组件(例如门、把手)。
关节资产生成 :通过结合来自 VLM 的语义先验、来自分解网格的几何先验以及来自图像到视频生成模型的动态先验,推断运动学结构(关节类型、轴、运动范围)。输出被导出为标准格式(如 URDF)以供物理引擎使用。
4. 数据与训练
数据管道 :一个六阶段预处理框架确保数据质量,包括格式规范化、类别特定的视觉去重、VLM 评分/字幕生成、资产策展、保留锐度的水密重网格化(使用基于 L ∞ L_\infty L ∞ 的公式)以及条件渲染。
训练策略 :
几何 :一个分层渐进流程,包括预训练(PT)、随分辨率增加的持续训练(CT)以及监督微调(SFT)。阶段 2 特别通过体素化编码引入正则化。
纹理 :两阶段策略,其中基于 MoE 的 PBR 模型在多样化数据上进行预训练,随后使用 VLM 生成的材质描述进行 SFT,以在复杂光照下优化材质估计。
推理效率 :采用渐进式蒸馏流程 以降低推理成本。它首先蒸馏无分类器引导(CFG)机制,然后应用渐进式步数蒸馏以迭代地将采样步数减半,同时保持视觉保真度和一致性。
主要贡献
增强的几何 :具有局部感知 VAE 的两阶段 DiT 流程实现了优于单阶段方法的几何锐度和结构精度。
统一 PBR 纹理 :具有 MoE 扩展和 VLM 条件控制的统一模型提供了更高分辨率的纹理、准确的材质边界以及改进的文本渲染保真度。
仿真就绪能力 :引入场景布局规划、部件感知分解和无需训练的关节生成,实现了连贯的场景构建和部件级物理交互。
生产可扩展性 :渐进式蒸馏策略显著降低了推理成本,同时保持了质量,促进了生产规模的部署。
结果
一项大规模人类偏好研究将 Seed3D 2.0 与五个最新的商业模型(Hunyuan3D-2.5、Hunyuan3D-3.1、Tripo 3.0、Rodin Gen2 v1.9 和 HiTem v2.0)进行了比较:
仅形状生成 :Seed3D 2.0 的胜率范围从 55.2% (对比 Hunyuan3D-3.1)到 98.3% (对比 Seed3D 1.0)。
端到端纹理资产生成 :Seed3D 2.0 在所有基线中取得了 69.0% 到 89.9% 之间一致的胜率。 定性比较证实,Seed3D 2.0 生成了具有锐利结构细节的高精度几何体,以及卓越的纹理分解,包括可靠的文本渲染。
意义
Seed3D 2.0 代表了 3D 内容生成的系统性进步,超越了静态资产创建,迈向生产级、仿真就绪的输出 。通过缩小质量和能力差距,该系统弥合了生成式 3D 建模与 XR、机器人技术和具身 AI 中现实世界部署需求之间的鸿沟。语义条件控制、部件级分解和关节推断的整合,为创建交互式、物理合理的 3D 环境提供了统一基础。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。