← Derniers articles
💻 computer science

ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space

Le document présente ABot-3DWorld 0, un modèle de monde 3D multimodal universel qui convertit le texte, les images et les vidéos en environnements 3D explorables à haute fidélité en les unifiant dans une Primitive Générative Spatiale, en générant des vidéos panoramiques 3D cohérentes, et en les reconstruisant en scènes de Gaussian Splatting 3D photoréalistes.

Auteurs originaux : Mingchao Sun, Luyang Tang, Yu Liu, Xu Yan, Zhan Li, Yunwei Zhang, Fei Yu, Zengye Ge, Yumin Liu, Jiacheng Zhang, Yongchang Zhang, Jiawei Zhang, Zhicheng Liu, Zhongxu Sun, Tianjian Ouyang, Wenzheng Chen
Publié 2026-07-14
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Mingchao Sun, Luyang Tang, Yu Liu, Xu Yan, Zhan Li, Yunwei Zhang, Fei Yu, Zengye Ge, Yumin Liu, Jiacheng Zhang, Yongchang Zhang, Jiawei Zhang, Zhicheng Liu, Zhongxu Sun, Tianjian Ouyang, Wenzheng Chen, Shixing Yang, Nianfei Fan, Guodong Sun, Huan Li, Zheng Zhou, Yongze Li, Yingliang Peng, Mengmeng Du, Yuan Liu, Haozhe Shi, Chunnuo Gong, Chengzhen Yu, Chunxue Jia, Yang Liu, Shiying Zeng, Junnan Lai, Hang Zhang, Ning Guo, Baoquan Chen, Mu Xu, Hongyu Pan

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédez une caméra magique capable de transformer une simple phrase, un selfie rapide ou une vidéo tremblante de votre téléphone en un monde 3D entièrement explorable dans lequel vous pouvez déambuler. C'est exactement ce que l'équipe du laboratoire AMAP CV d'Alibaba a construit avec ABot-3DWorld 0. Considérez cela comme un « traducteur universel » de la réalité : il prend tout ce que vous lui donnez — texte, une seule photo ou une série de vidéos — et en extrait un univers 3D haute définition et navigable.

Voici comment fonctionne cette sorcellerie numérique, décomposée en ses parties les plus fascinantes.

L'ingrédient secret : Le « Spatial Generative Primitive » (SGP)

La plupart des créateurs de 3D tentent de construire un monde pièce par pièce, comme si l'on empilait des briques LEGO. Mais ce système utilise un raccourci plus intelligent appelé le Spatial Generative Primitive (SGP). Imaginez le SGP comme un « instantané magique » qui contient deux éléments :

  1. Un panorama à 360 degrés (une photo qui s'enroule tout autour de vous).
  2. Un nuage de points qui cartographie la forme et la distance de tout ce qui se trouve sur cette photo.

Ce petit paquet est l'« ADN » du monde. Que vous partiez d'une instruction textuelle comme « une cabane chaleureuse » ou d'une vidéo d'une rue réelle, le système transforme d'abord cela en ce SGP. Si vous lui donnez une vidéo riche, il construit le SGP en mesurant soigneusement la géométrie réelle (sans deviner !). Si vous ne lui donnez qu'une phrase, il comble de manière créative les lacunes pour construire le SGP à partir de zéro.

Le voyage : Planifier la marche

Une fois que le système possède le SGP, il doit déterminer comment l'explorer. Au lieu de simplement faire pivoter une caméra en cercle, un « agent » (un planificateur numérique intelligent) observe le nuage de points et se demande : « Où puis-je marcher ? Qu'est-ce qui semble intéressant ? »
Il planifie un itinéraire qui accomplit trois choses à la fois :

  • Couvrir tout l'espace : Il s'assure qu'aucun coin ou porte cachée n'est oublié.
  • Trouver les éléments intéressants : Il repère des objets captivants (comme un panneau sympa ou un arbre) et zoome sur eux.
  • Maintenir la stabilité : Il veille à ce que le chemin soit fluide pour que la vidéo finale ne paraisse pas saccadée.

Le spectacle de magie : Créer la vidéo

C'est ici que commence le gros du travail. Le système prend cet itinéraire planifié et génère une vidéo panoramique à 360 degrés comme si une caméra volait réellement le long de ce trajet.

  • Le problème : Les générateurs de vidéos standards créent souvent des mondes 3D qui sont superbes image par image, mais qui s'effondrent dès que l'on bouge la tête (comme une peinture plate qui paraît étrange sous un autre angle).
  • La solution : Les auteurs ont entraîné leur générateur de vidéo avec une technique spéciale appelée Apprentissage par Renforcement 3D (3DRL). Considérez cela comme un coach de « vérification de la réalité ». Le coach regarde la vidéo et dit : « Hé, si je déplace la caméra de cette façon, ce bâtiment ne devrait pas se déformer comme de la gelée. » En s'entraînant sur ce feedback, le système apprend à créer des vidéos qui restent géométriquement cohérentes, même lorsque la caméra se déplace.

La touche finale : Transformer la vidéo en un monde

La vidéo est excellente, mais elle n'est encore qu'une vidéo. Pour en faire un véritable monde 3D dans lequel on peut voler, le système utilise un moteur de reconstruction appelé ABot-3DGS.

  • L'équipe de réparation : Parfois, la vidéo générée présente des zones floues ou des artefacts bizarres. Le système utilise une « équipe de réparation » (propulsée par un outil appelé FLUX) qui zoome sur ces zones, corrige les détails et accentue les textures. Il effectue cela en deux étapes, rendant le monde net et réel.
  • Le résultat : Le produit final est un monde en 3D Gaussian Splatting (3DGS). C'est une façon sophistiquée de dire qu'il s'agit d'un nuage de millions de petits points colorés et brillants qui agissent comme des pixels dans l'espace 3D. Vous pouvez voler à travers eux, et ils paraissent photoréalistes.

Ce que ce système ne fait pas (et pourquoi cela importe)

L'article est très clair sur ce qu'il évite. Il rejette explicitement l'idée de simplement juxtaposer des images plates ou d'utiliser des méthodes « riches en hallucinations » qui ignorent la géométrie d'origine.

  • Si vous lui donnez une vidéo d'une pièce réelle, il ne se contente pas de deviner à quoi ressemble la pièce de l'arrière. Il utilise un pipeline géométrique rigoureux pour garantir que le monde 3D correspond aux observations réelles.
  • Il ne repose pas sur des caméras 360 degrés réelles et instables (contenant des personnes ou des trépieds dans le champ). Au lieu de cela, il construit ses données d'entraînement en rendant des mondes 3D parfaits et propres à partir de zéro, afin que l'IA apprenne à partir d'exemples « parfaits » sans le désordre des secousses de caméras réelles.

La preuve : À quel point est-ce efficace ?

Les auteurs ne se sont pas contentés de dire que c'est impressionnant ; ils l'ont mesuré.

  • Meilleur que la concurrence : Testé contre d'autres systèmes de pointe comme Marble et HY-World 2.0, ABot-3DWorld 0 a montré une plus grande « fidélité de scène » (il ressemble davantage à la réalité) lorsqu'il reçoit des entrées riches comme des vidéos ou plusieurs photos.
  • Les chiffres : Après l'ajout du coach de réalité 3DRL, la cohérence 3D du système s'est considérablement améliorée. Par exemple, une métrique appelée PSNR (qui mesure la proximité de l'image avec l'original) est passée de 34,11 à 35,30. Le SSIM (similitude structurelle) est passé de 0,942 à 0,951.
  • Vitesse : Sur un ordinateur puissant équipé de quatre cartes graphiques haut de gamme (4×4090), l'ensemble du processus — de la vidéo au monde 3D final — prend environ 10 minutes.

La vue d'ensemble

Il ne s'agit pas seulement d'un jouet ; c'est un pont vers un nouveau type de carte. Puisqu'il est conçu par l'équipe derrière AMAP (un service de cartographie majeur), chaque monde qu'il crée peut être ancré à un lieu réel sur Terre. Vous pourriez regarder la photo d'un restaurant et instantanément « entrer » à l'intérieur, ou regarder un monument et voir un « portail temporel » qui vous permet de voir à quoi il ressemblait dans le passé.

Les auteurs suggèrent que cette approche — utiliser un « primitif » unifié pour gérer tout, du texte à la vidéo — pourrait être la clé pour rendre la création de contenu 3D aussi facile que de prendre un selfie, tout en gardant les mondes assez précis pour être réellement explorés. C'est une étape vers un futur où vous pourrez explorer n'importe quel espace 3D, réel ou imaginé, avec seulement quelques mots ou un seul clic.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →