SceneConductor: 3D Scene Generation from Single Image with Multi-Agent Orchestration
Auteurs originaux : Jeonghwan Kim, Yushi Lan, Yongwei Chen, Hieu Trung Nguyen, Chuanyu Pan, Xingang Pan
Auteurs originaux : Jeonghwan Kim, Yushi Lan, Yongwei Chen, Hieu Trung Nguyen, Chuanyu Pan, Xingang Pan
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé Technique : SceneConductor
Énoncé du Problème
Générer des scènes 3D complètes et cohérentes à partir d'une seule image est une tâche fondamentalement complexe en raison de l'ambiguïté inhérente des preuves visuelles. Cela nécessite d'inférer conjointement la géométrie des objets, la disposition spatiale, les relations entre les objets et le contexte environnemental. Les approches existantes font face à des limitations significatives :
- Génération Holistique : Les méthodes de diffusion qui génèrent simultanément plusieurs objets et dispositions souffrent souvent de problèmes d'évolutivité, car la mémoire et le calcul augmentent avec le nombre d'objets, ce qui les rend difficiles à appliquer à des scènes réelles encombrées.
- Pipelines Centrés sur l'Objet : Les méthodes qui génèrent des objets indépendamment et les assemblent dépendent fortement de modules de disposition ou de pose entraînés sur des jeux de données synthétiques ou à domaine restreint. Celles-ci échouent souvent à se généraliser aux images « in-the-wild » présentant des points de vue et des compositions diversifiés.
- Systèmes Basés sur des Agents : Bien que les agents basés sur les Grands Modèles de Langage (LLM) et les Modèles de Vision-Langage (VLM) offrent des capacités de planification, beaucoup reposent sur des priors textuels plutôt que sur des contraintes ancrées dans l'image. Les systèmes multi-agents conditionnés par l'image emploient souvent des rôles de générateur/évaluateur grossiers qui opèrent sur l'ensemble de la scène de manière holistique. Cela nécessite des interactions répétées de plusieurs tours sur l'ensemble du contexte, augmentant la latence et limitant la précision des corrections localisées.
Méthodologie : SceneConductor
Les auteurs proposent SceneConductor, un cadre d'orchestration multi-agent qui décompose la génération de scènes 3D à partir d'une image unique en trois étapes séquentielles structurées. Cette approche assigne des rôles spécialisés aux agents, leur permettant d'opérer uniquement sur les contextes pertinents plutôt que de raisonner sur l'ensemble de la scène de manière holistique.
1. Initialisation de la Scène
Cette étape établit une fondation de scène 3D grossière :
- Raffinement des Masques : Un agent traite les masques de segmentation (extraits via Grounded-SAM) pour résoudre les redondances, fusionner les instances fragmentées et diviser les masques couvrant plusieurs objets, assurant ainsi une correspondance un-à-un propre entre les masques et les objets physiques.
- Reconstruction 3D : Les masques raffinés sont utilisés pour reconstruire les maillages d'objets via SAM3D. Les objets identiques sont reconstruits une seule fois et répliqués pour éviter la redondance.
- Prédiction de la Disposition : Un prédicteur de disposition conscient de la géométrie estime l'arrangement spatial initial des objets.
2. Construction de l'Environnement
Cette étape construit l'échafaudage environnemental (limites de la pièce, surfaces, matériaux, illumination) pour ancrer la scène :
- Estimation du Plan au Sol : En utilisant la scène initiale et une carte de points prédite, le système opère dans l'espace de vue aérienne (BEV). Il extrait les points 3D valides, les projette sur le plan horizontal et calcule une enveloppe convexe pour définir un polygone de scène grossier.
- Génération de l'Échafaudage : Un agent infère une structure simplifiée comprenant un plan de sol/support et des murs de bordure. Cet échafaudage léger impose un support physique (empêchant les objets flottants) et empêche les pénétrations de murs.
- Contextualisation : L'agent analyse l'image d'entrée pour assigner des matériaux de mur correspondant à l'apparence dominante de la scène et configure des sources lumineuses pour une illumination plausible.
3. Raffinement Multi-Agent
La phase finale améliore de manière itérative la cohérence géométrique et le réalisme visuel grâce à un hybride d'opérations simples et complexes :
- Agent Planificateur : Inspecte la scène et dirige les problèmes vers soit des opérations déterministes simples, soit des révisions localisées complexes.
- Opérations Simples : Le planificateur émet une liste déterministe pour des tâches telles que l'imposition du support physique, l'alignement des échelles/rotations d'objets similaires, et la correction de poses implausibles.
- Opérations Complexes (Agents Spécialistes) : Pour les interactions étroitement liées, le planificateur isole une sous-scène d'objets interdépendants. Un agent spécialiste affine cette sous-scène par une interaction multi-tours, inspectant les images rendues et la segmentation pour résoudre les incohérences spatiales. Les sous-scènes raffinées sont ensuite réintégrées dans la scène globale.
Composant Central : Prédicteur de Disposition Conscient de la Géométrie
Une contribution critique est un prédicteur de disposition conçu pour fournir une initialisation fiable sans annotations de scène coûteuses.
- Stratégie d'Entraînement : Au lieu d'apprendre une distribution générative à partir de jeux de données 3D restreints, le modèle régresse les paramètres de disposition (Rotation, Translation, Échelle, Rotation du Sol) supervisés par des priors géométriques épars dérivés des masques de segmentation et des cartes de points.
- Architecture : Le modèle encode les caractéristiques de l'image, du masque et de la carte de points. Les maillages d'objets sont voxelisés et intégrés dans des jetons (tokens) latents. Un transformeur avec une attention globale capture les interactions entre objets.
- Décomposition de la Pose : Le modèle prédit les poses par objet (Ri,Ti,Si) dans un cadre canonique aligné sur le sol et une rotation globale du sol partagée F. Cette décomposition sépare explicitement l'alignement global du sol de la pose par objet, réduisant les degrés de liberté et imposant une notion de hauteur cohérente.
- Fonction de Perte : Une perte de géométrie supervisée par la carte de points combine une distance de Chamfer unilatérale (de la carte de points vers le maillage) avec un terme d'alignement de boîte englobante (bounding-box), permettant l'entraînement sur de grands jeux de données de segmentation 2D sans poses 3D de vérité terrain.
Principales Contributions
- Cadre Multi-Agent en Trois Étapes : Un pipeline structuré (Initialisation, Construction de l'Environnement, Raffinement) qui utilise des agents spécialisés pour améliorer la coordination des tâches et la fiabilité, évitant ainsi la surcharge du raisonnement holistique de la scène.
- Prédicteur de Disposition Conscient de la Géométrie : Un prédicteur novateur qui apprend l'information spatiale à partir d'images réelles en utilisant des priors géométriques épars (segmentation et cartes de points), éliminant le besoin d'annotations de disposition au niveau de la scène et améliorant la généralisation à des environnements divers.
- Gains de Performance : Démontre des améliorations constantes par rapport aux approches existantes en termes de précision géométrique, de cohérence spatiale et de réalisme perceptuel sur les jeux de données de référence.
Résultats Expérimentaux
La méthode a été évaluée sur les jeux de données 3D-FUTURE, ScanNet et MIT-Indoor-67.
- Métriques Quantitatives : Sur 3D-FUTURE et ScanNet, SceneConductor a obtenu la distance de Chamfer (CD) la plus faible et les scores F-Score et IoU-B les plus élevés par rapport aux bases comme 3D-Fixer, SceneGen et SAM3D. Par exemple, sur 3D-FUTURE, il a atteint un CD de 0,0089 (contre 0,0117 pour SAM3D) et un F-Score de 0,9261.
- Métriques Visuelles : En utilisant des évaluateurs basés sur les VLM (Qwen3.5-2B) et les scores CLIP, la méthode surpasse les bases en termes de réalisme, de fonctionnalité, de cohérence de la disposition et d'alignement avec l'image. Sur MIT-Indoor-67, elle a obtenu le score moyen le plus élevé (4,2742) comparé à SAM3D (4,0179) et VIGA (1,300).
- Études d'Ablation : Les expériences ont confirmé que la combinaison de la perte de géométrie, de la prédiction de la rotation du sol et de l'entraînement sur des données de segmentation produit les meilleures performances. Plus précisément, la rotation du sol stabilise la prédiction de la pose en réduissant l'ambiguïté rotationnelle.
- Analyse Qualitative : Les comparaisons visuelles montrent que SceneConductor produit des rotations d'objets plus précises et des structures de plan de sol plus cohérentes, particulièrement dans les scènes avec des points de vue de caméra inclinés où d'autres méthodes génèrent des dispositions instables.
Signification et Revendications
L'article affirme que SceneConductor offre une direction prometteuse pour la génération de scènes à partir d'images scalable et contrôlable. En décomposant le processus de génération en étapes structurées et en utilisant des agents spécialisés, le cadre rend le processus de génération plus facile à gérer et à contrôler par rapport aux approches holistiques.
Les auteurs soulignent que leur prédicteur de disposition conscient de la géométrie est significatif car il permet une initialisation fiable en utilisant uniquement des données de segmentation 2D et de cartes de points, contournant ainsi le besoin d'annotations de niveau scène coûteuses. Cela permet au système de se généraliser de manière robuste à divers environnements réels.
Limitations : Les auteurs reconnaissent que le cadre repose sur plusieurs modèles de fondation exécutés séquentiellement, ce qui introduit une latence d'inférence et un risque de propagation d'erreurs des premières étapes. Les expériences actuelles se concentrent sur les scènes intérieures avec modélisation de texture ; l'extension du cadre aux environnements extérieurs/non bornés et à des représentations de matériaux plus riches est notée comme un travail futur.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.
Recevez les meilleurs articles computer science chaque semaine.
Adopté par des chercheurs de Stanford, Cambridge et de l'Académie des sciences.
Vérifiez votre boîte mail pour confirmer votre inscription.
Quelque chose s'est mal passé. Réessayer ?
Pas de spam, désinscription à tout moment.