SceneConductor: 3D Scene Generation from Single Image with Multi-Agent Orchestration
Autores originais: Jeonghwan Kim, Yushi Lan, Yongwei Chen, Hieu Trung Nguyen, Chuanyu Pan, Xingang Pan
Autores originais: Jeonghwan Kim, Yushi Lan, Yongwei Chen, Hieu Trung Nguyen, Chuanyu Pan, Xingang Pan
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Resumo Técnico: SceneConductor
Declaração do Problema
Gerar cenas 3D completas e coerentes a partir de uma única imagem é uma tarefa fundamentalmente desafiadora devido à ambiguidade inerente da evidência visual. Isso requer a inferência conjunta da geometria dos objetos, disposição espacial, relações entre objetos e contexto ambiental. As abordagens existentes enfrentam limitações significativas:
- Geração Holística: Métodos baseados em difusão que geram múltiplos objetos e layouts simultaneamente frequentemente sofrem com problemas de escalabilidade, pois a memória e o processamento crescem com o número de objetos, tornando-os difíceis de aplicar a cenas do mundo real congestionadas.
- Pipelines Centrados em Objetos: Métodos que geram objetos independentemente e os montam dependem fortemente de módulos de layout ou pose treinados em conjuntos de dados sintéticos ou de domínio restrito. Estes frequentemente falham ao generalizar para imagens "in-the-wild" com diversos pontos de vista e composições.
- Sistemas Baseados em Agentes: Embora agentes de Grandes Modelos de Linguagem (LLM) e Modelos de Visão-Linguagem (VLM) ofereçam capacidades de planejamento, muitos dependem de priors textuais em vez de restrições fundamentadas na imagem. Sistemas multi-agentes condicionados por imagem empregam frequentemente papros de gerador/avaliador grosseiros que operam sobre toda a cena de forma holística. Isso exige interações repetidas de múltiplos turnos sobre o contexto completo, aumentando a latência e limitando a precisão das correções localizadas.
Metodologia: SceneConductor
Os autores propõem o SceneConductor, um framework de orquestração multi-agente que decompõe a geração de cenas 3D a partir de uma única imagem em três estágios sequenciais estruturados. Esta abordagem atribui funções especializadas aos agentes, permitindo que operem apenas em contextos relevantes, em vez de raciocinar sobre toda a cena de forma holística.
1. Inicialização da Cena
Este estágio estabelece uma fundação bruta de cena 3D:
- Refinamento de Máscaras: Um agente processa máscaras de segmentação (extraídas via Grounded-SAM) para resolver redundâncias, mesclar instâncias fragmentadas e dividir máscaras que cobrem múltiplos objetos, garantindo um mapeamento um-para-um limpo entre máscaras e objetos físicos.
- Reconstrução 3D: Máscaras refinadas são usadas para reconstruir malhas de objetos via SAM3D. Objetos idênticos são reconstruídos uma única vez e replicados para evitar redundância.
- Predição de Layout: Um preditor de layout consciente da geometria estima o arranjo espacial inicial dos objetos.
2. Construção do Ambiente
Este estágio constrói o arcabouço ambiental (limites de cômodos, superfícies, materiais, iluminação) para ancorar a cena:
- Estimativa de Planta Baixa: Usando a cena inicial e um mapa de pontos previsto, o sistema opera no espaço de visão aérea (BEV - bird's-eye-view). Ele extrai pontos 3D válidos, projeta-os no plano horizontal e computa um invólucro convexo para definir um polígono de palco grosseiro.
- Geração de Arcabouço (Scaffold): Um agente infere uma estrutura simplificada incluindo um plano de piso/suporte e paredes de limite. Este arcabouço leve impõe suporte físico (evitando objetos flutuantes) e evita penetrações nas paredes.
- Contextualização: O agente analisa a imagem de entrada para atribuir materiais às paredes que correspondam à aparência dominante da cena e configura fontes de luz para uma iluminação plausível.
3. Refinamento Multi-Agente
O estágio final melhora iterativamente a consistência geométrica e o realismo visual através de um híbrido de operações simples e complexas:
- Agente Planejador: Inspeciona a cena e roteia problemas para operações determinísticas simples ou revisões localizadas complexas.
- Operações Simples: O planejador emite uma lista determinística para tarefas como impor suporte físico, alinhar escalas/rotações de objetos similares e corrigir poses implausíveis.
- Operações Complexas (Agentes Especialistas): Para interações fortemente acopladas, o planejador isola uma subcena de objetos interdependentes. Um agente especialista refina esta subcena através de interação de múltiplos turnos, inspecionando imagens renderizadas e segmentação para resolver inconsistências espaciais. As subcenas refinadas são então reintegradas à cena global.
Componente Central: Preditor de Layout Consciente da Geometria
Uma contribuição crítica é um preditor de layout projetado para fornecer inicialização confiável sem anotações de cena dispendiosas.
- Estratégia de Treinamento: Em vez de aprender uma distribuição generativa de conjuntos de dados 3D restritos, o modelo regride parâmetros de layout (Rotação, Translação, Escala, Rotação do Piso) supervisionados por priors geométricos esparsos derivados de máscaras de segmentação e mapas de pontos.
- Arquitetura: O modelo codifica características de imagem, máscara e mapa de pontos. Malhas de objetos são voxelizadas e incorporadas em tokens latentes. Um transformer com atenção global captura interações entre objetos.
- Decomposição de Pose: O modelo prevê poses por objeto (Ri,Ti,Si) em um frame canônico alinhado ao piso e uma rotação de piso global compartilhada F. Esta decomposição separa explicitamente o alinhamento global do piso da pose individual do objeto, reduzindo os graus de liberdade e impondo uma noção de altura consistente.
- Função de Perda: Uma perda de geometria supervisionada por mapa de pontos combina uma distância de Chamfer unilateral (do mapa de pontos para a malha) com um termo de alinhamento de caixa delimitadora (bounding-box), permitindo o treinamento em grandes conjuntos de dados de segmentação 2D sem necessidade de poses 3D reais.
Principais Contribuições
- Framework Multi-Agente de Três Estágios: Um pipeline estruturado (Inicialização, Construção do Ambiente, Refinamento) que utiliza agentes especializados para melhorar a coordenação de tarefas e a confiabilidade, evitando o overhead do raciocínio de cena holístico.
- Preditor de Layout Consciente da Geometria: Um preditor inovador que aprende informações espaciais de imagens do mundo real usando priors geométricos esparsos (segmentação e mapas de pontos), eliminando a necessidade de anotações de layout em nível de cena e melhorando a generalização para ambientes diversos.
- Ganhos de Desempenho: Demonstrou melhorias consistentes em relação às abordagens existentes em precisão geométrica, consistência espacial e realismo perceptual em conjuntos de dados de referência.
Resultados Experimentais
O método foi avaliado nos conjuntos de dados 3D-FUTURE, ScanNet e MIT-Indoor-67.
- Métricas Quantitativas: No 3D-FUTURE e ScanNet, o SceneConductor alcançou a menor Distância de Chamfer (CD) e o maior F-Score e IoU-B em comparação com baselines como 3D-Fixer, SceneGen e SAM3D. Por exemplo, no 3D-FUTURE, alcançou um CD de 0.0089 (vs. 0.0117 para SAM3D) e um F-Score de 0.9261.
- Métricas Visuais: Usando avaliadores baseados em VLM (Qwen3.5-2B) e scores de CLIP, o método superou os baselines em realismo, funcionalidade, consistência de layout e alinhamento de imagem. No MIT-Indoor-67, alcançou a maior pontuação média (4.2742) comparado ao SAM3D (4.0179) e VIGA (1.300).
- Estudos de Ablação: Experimentos confirmaram que a combinação de perda de geometria, predição de rotação de piso e treinamento em dados de segmentação produz o melhor desempenho. Especificamente, a rotação do piso estabiliza a predição de pose ao reduzir a ambiguidade rotacional.
- Análise Qualitativa: Comparações visuais mostam que o SceneConductor produz rotações de objetos mais precisas e estruturas de plano de solo mais coerentes, particularmente em cenas com pontos de vista de câmera inclinados, onde outros métodos geram layouts instáveis.
Significância e Alegações
O artigo afirma que o SceneConductor oferece uma direção promissora para a geração de cena de imagem-para-cena escalável e controlável. Ao decompor o processo de geração em estágios estruturados e utilizar agentes especializados, o framework torna o processo de geração mais fácil de gerenciar e controlar em comparação com abordagens holísticas.
Os autores enfatizam que seu preditor de layout consciente da geometria é significativo porque permite uma inicialização confiável usando apenas dados de segmentação 2D e mapas de pontos, contornando a necessidade de anotações dispendiosas em nível de cena. Isso permite que o sistema se generalize de forma robusta para diversos ambientes do mundo real.
Limitações: Os autores reconhecem que o framework depende de múltiplos modelos de fundação executados sequencialmente, o que introduz latência de inferência e o risco de propagação de erro das etapas iniciais. Os experimentos atuais focam em cenas internas com modelagem de nível de textura; estender o framework para ambientes externos/ilimitados e representações de materiais mais ricas é notado como trabalho futuro.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.
Receba os melhores artigos de computer science toda semana.
Confiado por pesquisadores de Stanford, Cambridge e da Academia Francesa de Ciências.
Verifique sua caixa de entrada para confirmar sua inscrição.
Algo deu errado. Tentar novamente?
Sem spam, cancele quando quiser.