SceneConductor: 3D Scene Generation from Single Image with Multi-Agent Orchestration
Autores originales: Jeonghwan Kim, Yushi Lan, Yongwei Chen, Hieu Trung Nguyen, Chuanyu Pan, Xingang Pan
Autores originales: Jeonghwan Kim, Yushi Lan, Yongwei Chen, Hieu Trung Nguyen, Chuanyu Pan, Xingang Pan
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: SceneConductor
Declaración del Problema
Generar escenas 3D completas y coherentes a partir de una sola imagen es una tarea fundamentalmente desafiante debido a la ambigüedad inherente de la evidencia visual. Requiere inferir conjuntamente la geometría de los objetos, la disposición espacial, las relaciones entre objetos y el contexto ambiental. Los enfoques existentes enfrentan limitaciones significativas:
- Generación Holística: Los métodos basados en difusión que generan múltiples objetos y disposiciones simultáneamente suelen sufrir problemas de escalabilidad, ya que la memoria y la computación crecen con el número de objetos, lo que dificulta su aplicación a escenas del mundo real congestionadas.
- Pipelines Centrados en Objetos: Los métodos que generan objetos de forma independiente y los ensamblan dependen en gran medida de módulos de disposición o pose entrenados en conjuntos de datos sintéticos o de dominio restringido. Estos suelen fallar al generalizarse a imágenes "en el mundo real" (in-the-wild) con diversos puntos de vista y composiciones.
- Sistemas Basados en Agentes: Aunque los agentes de Modelos de Lenguaje Extensos (LLM) y Modelos de Visión-Lenguaje (VLM) ofrecen capacidades de planificación, muchos dependen de priors textuales en lugar de restricciones ancladas a la imagen. Los sistemas multi-agente condicionados por imagen emplean a menudo roles de generador/evaluador toscos que operan sobre toda la escena de manera holística. Esto requiere interacciones repetidas de múltiples turnos sobre el contexto completo, lo que aumenta la latencia y limita la precisión de las correcciones localizadas.
Metodología: SceneConductor
Los autores proponen SceneConductor, un marco de orquestación multi-agente que descompone la generación de escenas 3D a partir de una sola imagen en tres etapas secuenciales estructuradas. Este enfoque asigna roles especializados a los agentes, permitiéndoles operar solo en los contextos relevantes en lugar de razonar sobre toda la escena de forma holística.
1. Inicialización de la Escena
Esta etapa establece una base de escena 3D gruesa:
- Refinamiento de Máscaras: Un agente procesa las máscaras de segmentación (extraídas mediante Grounded-SAM) para resolver redundancias, fusionar instancias fragmentadas y dividir las máscaras que cubren múltiples objetos, asegurando un mapeo uno a uno limpio entre las máscaras y los objetos físicos.
- Reconstrucción 3D: Las máscaras refinadas se utilizan para reconstruir mallas de objetos mediante SAM3D. Los objetos idénticos se reconstruyen una sola vez y se replican para evitar redundancias.
- Predicción de la Disposición: Un predictor de disposición consciente de la geometría estima la disposición espacial inicial de los objetos.
2. Construcción del Entorno
Esta etapa construye el andamio ambiental (límites de la habitación, superficies, materiales, iluminación) para anclar la escena:
- Estimación del Plano de Planta: Utilizando la escena inicial y un mapa de puntos predicho, el sistema opera en el espacio de vista de pájaro (BEV). Extrae puntos 3D válidos, los proyecta al plano horizontal y calcula un casco convexo para definir un polígono de escenario grueso.
- Generación de Andamios: Un agente infiere una estructura simplificada que incluye un plano de suelo/soporte y paredes de límite. Este andamio ligero impone el soporte físico (evitando que los objetos floten) y evita las penetraciones en las paredes.
- Contextualización: El agente analiza la imagen de entrada para asignar materiales a las paredes que coincidan con la apariencia dominante de la escena y configura fuentes de luz para una iluminación plausible.
3. Refinamiento Multi-Agente
La etapa final mejora iterativamente la consistencia geométrica y el realismo visual mediante un híbrido de operaciones simples y complejas:
- Agente Planificador: Inspecciona la escena y dirige los problemas hacia operaciones deterministas simples o revisiones localizadas complejas.
- Operaciones Simples: El planificador emite una lista determinista para tareas como imponer el soporte físico, alinear escalas/rotaciones de objetos similares y corregir poses implausibles.
- Operaciones Complejas (Agentes Especialistas): Para interacciones estrechamente acopladas, el planificador aísla una sub-escena de objetos interdependientes. Un agente especialista refina esta sub-escena mediante interacción de múltiples turnos, inspeccionando imágenes renderizadas y segmentación para resolver inconsistencias espaciales. Las sub-escenas refinadas se reintegran luego en la escena global.
Componente Central: Predictor de Disposición Consciente de la Geometría
Una contribución crítica es un predictor de disposición diseñado para proporcionar una inicialización confiable sin necesidad de anotaciones de escena costosas.
- Estrategia de Entrenamiento: En lugar de aprender una distribución generativa a partir de conjuntos de datos 3D restringidos, el modelo realiza una regresión de los parámetros de disposición (Rotación, Traslación, Escala, Rotación del Suelo) supervisada por priors geométricos dispersos derivados de máscaras de segmentación y mapas de puntos.
- Arquitectura: El modelo codifica características de la imagen, la máscara y el mapa de puntos. Las mallas de los objetos se voxelizan y se integran en tokens latentes. Un transformador con atención global captura las interacciones entre objetos.
- Descomposición de Pose: El modelo predice las poses por objeto (Ri,Ti,Si) en un marco canónico alineado con el suelo y una rotación de suelo global compartida F. Esta descomposición separa explícitamente la alineación global del suelo de la pose de cada objeto, reduciendo los grados de libertad y reforzando una noción de altura consistente.
- Función de Pérdida: Una pérdida de geometría supervisada por mapa de puntos combina una distancia de Chamfer de un solo lado (del mapa de puntos a la malla) con un término de alineación de caja delimitadora (bounding box), permitiendo el entrenamiento en conjuntos de datos de segmentación 2D a gran escala sin necesidad de poses 3D reales.
Principales Contribuciones
- Marco Multi-Agente de Tres Etapas: Un flujo de trabajo estructurado (Inicialización, Construcción del Entorno, Refinamiento) que utiliza agentes especializados para mejorar la coordinación de tareas y la fiabilidad, evitando la sobrecarga del razonamiento de la escena de forma holística.
- Predictor de Disposición Consciente de la Geometría: Un predictor novedoso que aprende información espacial a partir de imágenes del mundo real utilizando priors geométricos dispersos (segmentación y mapas de puntos), eliminando la necesidad de anotaciones de disposición a nivel de escena y mejorando la generalización a entornos diversos.
- Ganancias de Rendimiento: Demostró mejoras consistentes sobre los enfoques existentes en precisión geométrica, consistencia espacial y realismo perceptual en conjuntos de datos de referencia.
Resultados Experimentales
El método fue evaluado en los conjuntos de datos 3D-FUTURE, ScanNet e MIT-Indoor-67.
- Métricas Cuantitativas: En 3D-FUTURE y ScanNet, SceneConductor logró la menor Distancia de Chamfer (CD) y el mayor F-Score e IoU-B en comparación con las líneas base como 3D-Fixer, SceneGen y SAM3D. Por ejemplo, en 3D-FUTURE, alcanzó un CD de 0.0089 (frente al 0.0117 de SAM3D) y un F-Score de 0.9261.
- Métricas Visuales: Utilizando evaluadores basados en VLM (Qwen3.5-2B) y puntuaciones CLIP, el método superó a las líneas base en realismo, funcionalidad, consistencia de la disposición y alineación con la imagen. En MIT-Indoor-67, alcanzó la puntuación media más alta (4.2742) en comparación con SAM3D (4.0179) y VIGA (1.300).
- Estudios de Ablación: Los experimentos confirmaron que la combinación de la pérdida de geometría, la predicción de la rotación del suelo y el entrenamiento con datos de segmentación produce el mejor rendimiento. Específicamente, la rotación del suelo estabiliza la predicción de la pose al reducir la ambigüedad rotacional.
- Análisis Cualitativo: Las comparaciones visuales muestran que SceneConductor produce rotaciones de objetos más precisas y estructuras de plano de suelo más coherentes, particularmente en escenas con puntos de vista de cámara inclinados donde otros métodos generan disposiciones inestables.
Significado y Reivindicaciones
El artículo afirma que SceneConductor ofrece una dirección prometedora para la generación de escenas a partir de imágenes escalable y controlable. Al descomponer el proceso de generación en etapas estructuradas y utilizar agentes especializados, el marco hace que el proceso de generación sea más fácil de gestionar y controlar en comparación con los enfoques holísticos.
Los autores enfatizan que su predictor de disposición consciente de la geometría es significativo porque permite una inicialización confiable utilizando únicamente datos de segmentación 2D y mapas de puntos, evitando la necesidad de costosas anotaciones a nivel de escena. Esto permite que el sistema se generalice de manera robusta a diversos entornos del mundo real.
Limitaciones: Los autores reconocen que el marco depende de múltiples modelos fundacionales ejecutados secuencialmente, lo que introduce latencia en la inferencia y el riesgo de propagación de errores desde las etapas tempranas. Sus experimentos actuales se centran en escenas interiores con modelado de texturas; extender el marco a entornos exteriores/no limitados y representaciones de materiales más ricas se señala como un trabajo futuro.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.
Recibe los mejores artículos de computer science cada semana.
Utilizado por investigadores de Stanford, Cambridge y la Academia Francesa de Ciencias.
Revisa tu bandeja de entrada para confirmar tu suscripción.
Algo salió mal. ¿Intentar de nuevo?
Sin spam, cancela cuando quieras.