SceneConductor: 3D Scene Generation from Single Image with Multi-Agent Orchestration
原作者: Jeonghwan Kim, Yushi Lan, Yongwei Chen, Hieu Trung Nguyen, Chuanyu Pan, Xingang Pan
原作者: Jeonghwan Kim, Yushi Lan, Yongwei Chen, Hieu Trung Nguyen, Chuanyu Pan, Xingang Pan
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:SceneConductor
问题陈述
从单张图像生成完整且连贯的 3D 场景是一项具有挑战性的基础任务,因为视觉证据本身存在固有的歧义性。这需要对物体几何形状、空间布局、物体间关系以及环境上下文进行联合推理。现有方法面临显著的局限性:
- 整体生成(Holistic Generation): 基于扩散的方法在同时生成多个物体和布局时常面临可扩展性问题,因为内存和计算量会随着物体数量的增加而增长,使其难以应用于复杂的现实世界场景。
- 以物体为中心的流水线(Object-Centric Pipelines): 生成物体并进行组装的方法过度依赖于在合成或领域受限数据集上训练的布局或姿态模块。这些方法往往难以泛化到具有多样化视角和构图的“野外(in-the-wild)”图像。
- 基于智能体的系统(Agent-Based Systems): 虽然大语言模型(LLM)和视觉语言模型(VLM)智能体提供了规划能力,但许多方法依赖于文本先验而非图像驱动的约束。基于图像条件的多智能体系统通常采用粗粒度的生成器/评估器角色,对整个场景进行整体操作。这导致需要针对全上下文进行重复的多轮交互,增加了延迟并限制了局部修正的精度。
方法论:SceneConductor
作者提出了 SceneConductor,一个多智能体编排框架,将单图 3D 场景生成分解为三个结构化的顺序阶段。该方法为智能体分配了专门的角色,使它们仅在相关的上下文中运行,而不是对整个场景进行全局推理。
1. 场景初始化 (Scene Initialization)
此阶段建立粗略的 3D 场景基础:
- 掩码细化 (Mask Refinement): 一个智能体处理分割掩码(通过 Grounded-SAM 提取),以解决冗余、合并破碎的实例并拆分覆盖多个物体的掩码,确保掩码与物理物体之间实现精确的一一对应。
- 3D 重建 (3D Reconstruction): 利用细化后的掩码通过 SAM3D 重建物体网格。相同的物体仅重建一次并进行复制,以避免冗余。
- 布局预测 (Layout Prediction): 一个几何感知布局预测器用于估计物体的初始空间排列。
2. 环境构建 (Environment Construction)
此阶段构建环境支架(房间边界、平面、材质、照明)以锚定场景:
- 平面图估计 (Floor Plan Estimation): 利用初始场景和预测的点图,系统在鸟瞰图(BEV)空间内运行。它提取有效的 3D 点,将其投影到水平面上,并计算凸包以定义一个粗略的舞台多边形。
- 支架生成 (Scaffold Generation): 一个智能体推断一个包含地面/支撑平面和边界墙的简化结构。这种轻量级的支架强制执行物理支撑(防止物体悬空)并防止墙体穿透。
- 语境化 (Contextualization): 智能体分析输入图像,以分配与场景主导外观相匹配的墙面材质,并配置光源以实现合理的照明。
3. 多智能体细化 (Multi-Agent Refinement)
最后阶段通过简单操作与复杂操作的混合,迭代提升几何一致性和视觉真实感:
- 规划器智能体 (Planner Agent): 检查场景并将问题路由至简单的确定性操作或复杂的局部修正。
- 简单操作 (Simple Operations): 规划器发布一个确定性列表,用于执行诸如强制物理支撑、对齐相似物体的尺度/旋转以及纠正不合理姿态等任务。
- 复杂操作 (Complex Operations - 专家智能体): 对于紧密耦合的相互作用,规划器隔离出一个相互依赖物体的子场景。专家智能体通过多轮交互对该子场景进行细化,通过检查渲染图像和分割结果来解决空间不一致问题。细化后的子场景随后被重新整合到全局场景中。
核心组件:几何感知布局预测器 (Geometry-Aware Layout Predictor)
一个关键贡献是设计了一个布局预测器,旨在提供可靠的初始化,而无需高昂的场景级标注成本。
- 训练策略: 该模型不是从受限的 3D 数据集中学习生成分布,而是通过源自分割掩码和点图的稀疏几何先验,回归布局参数(旋转、平移、缩放、地面旋转)。
- 架构: 模型编码图像、掩码和点图特征。物体网格被体素化并嵌入到潜在 Token 中。一个带有全局注意力的 Transformer 用于捕捉物体间的相互作用。
- 姿态分解 (Pose Decomposition): 模型在规范的地面对齐坐标系下预测每个物体的姿态 (Ri,Ti,Si) 以及共享的全局地面旋转 F。这种分解明确地将全局地面对齐与单个物体的姿态分离,减少了自由度并强化了统一的高度概念。
- 损失函数: 点图监督的几何损失结合了单侧 Chamfer 距离(从点图到网格)与边界框对齐项,使得在没有真实 3D 姿态的情况下,也能在规模庞大的 2D 分割数据集上进行训练。
核心贡献
- 三阶段多智能体框架: 一个结构化的流水线(初始化、环境构建、细化),利用专门的智能体来提高任务协调性和可靠性,避免了全局场景推理带来的开销。
- 几何感知布局预测器: 一种新型预测器,它利用来自真实世界图像的稀疏几何先验(分割和点图)来学习空间信息,消除了对昂贵的场景级标注的需求,并提高了泛化能力。
- 性能提升: 在基准数据集上证明了在几何准确性、空间一致性和感知真实感方面较现有方法有持续的改进。
实验结果
该方法在 3D-FUTURE、ScanNet 和 MIT-Indoor-67 数据集上进行了评估。
- 定量指标: 在 3D-FUTURE 和 ScanNet 上,SceneConductor 与 3D-Fixer、SceneGen 和 SAM3D 等基线相比,实现了最低的 Chamfer 距离 (CD) 和最高的 F-Score 及 IoU-B。例如,在 3D-FUTURE 上,其 CD 为 0.0089(SAM3D 为 0.0117),F-Score 为 0.9261。
- 视觉指标: 使用基于 VLM 的评估器(Qwen3.5-2B)和 CLIP 分数,该方法在真实感、功能性、布局一致性和图像对齐方面均优于基线。在 MIT-Indoor-67 上,其平均得分(4.2742)高于 SAM3D(4.0179)和 VIGA(1.300)。
- 消融实验: 实验证实,结合几何损失、地面旋转预测以及在分割数据上进行训练可获得最佳性能。具体而言,地面旋转通过减少旋转歧义性稳定了姿态预测。
- 定性分析: 视觉对比显示,SceneConductor 能产生更准确的物体旋转和更连贯的地面结构,特别是在其他方法会生成不稳定布局的倾斜相机视角场景中。
意义与主张
论文声称 SceneConductor 为可扩展且可控的图像到场景生成提供了一个极具前景的方向。通过将生成过程分解为结构化阶段并使用专门的智能体,该框架使得生成过程比整体式方法更容易管理和控制。
作者强调,其几何感知布局预测器具有重要意义,因为它能够仅利用 2D 分割和点图数据实现可靠的初始化,从而绕过了昂贵的场景级标注。这使得系统能够鲁棒地泛化到多样化的真实环境。
局限性: 作者承认该框架依赖于顺序执行的多个基础模型,这引入了推理延迟以及早期阶段误差传播的风险。目前的实验侧重于具有纹理级建模的室内场景;将该框架扩展到室外/无界环境以及更丰富的材质表示被列为未来的工作方向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。