← Derniers articles
💻 computer science

Forge4D: Feed-Forward 4D Human Reconstruction and Interpolation from Uncalibrated Sparse-view Videos

Forge4D est un modèle de type feed-forward qui permet une reconstruction et une interpolation instantanées et efficaces d'humains 3D dynamiques à partir de vidéos à vues éparses non calibrées en optimisant conjointement la reconstruction de 3D Gaussiennes en streaming avec une prédiction de mouvement dense auto-supervisée et une fusion sensible aux occlusions.

Auteurs originaux : Yingdong Hu, Yisheng He, Jinnan Chen, Weihao Yuan, Kejie Qiu, Zehong Lin, Siyu Zhu, Zilong Dong, Steven Hoi, Jun Zhang

Publié 2026-08-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yingdong Hu, Yisheng He, Jinnan Chen, Weihao Yuan, Kejie Qiu, Zehong Lin, Siyu Zhu, Zilong Dong, Steven Hoi, Jun Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez essayer de capturer une personne se déplaçant dans une pièce pour ensuite recréer instantanément ce mouvement sous n'importe quel angle, même un angle qu'aucune caméra n'a jamais vu, ou à un instant précis qui n'a jamais été enregistré. C'est le rêve de la reconstruction quadridimensionnelle : construire un jumeau numérique vivant et respirant qui existe non seulement dans l'espace, mais aussi dans le temps. Pendant des années, réaliser cela a nécessité soit un studio rempli de caméras synchronisées, soit des heures de traitement informatique lent rendant toute interaction en temps réel impossible. L'objectif a toujours été de transformer quelques clips vidéo épars en un monde 3D complet et fluide où une personne peut être vue de n'importe où, à n'importe quel moment, sans que le modèle numérique ne s'effondre ou ne devienne un amas flou.

Une équipe de chercheurs vient de franchir une étape significative vers la réalisation de ce rêve avec un nouveau système appelé Forge4D. Au lieu d'essayer de résoudre tout le problème du mouvement des formes 3D d'un seul coup, ce qui entraîne souvent de la confusion et des erreurs, ils ont divisé la tâche en deux tâches plus simples et connectées. Premièrement, le système construit un modèle 3D statique de la personne et de son environnement à partir de quelques flux vidéo non calibrés. Voyez cela comme la création d'une sculpture de haute qualité, figée dans le temps. Deuxيèmement, le système prédit exactement comment chaque infime partie de cette sculpture se déplace d'une seconde à l'autre. En séparant la forme du mouvement, les chercheurs ont trouvé un moyen de rendre le processus suffisamment rapide pour être utile en temps réel, même lorsque les caméras enregistrant la scène ne sont pas parfaitement alignées ou calibrées.

Le cœur de leur découverte réside dans la manière dont ils gèrent les données. Les méthodes précédentes tentaient souvent de traiter une séquence vidéo entière d'un coup, ce qui saturait la mémoire de l'ordinateur et ralentissait tout. Forge4D adopte une approche différente en traitant la vidéo comme un flux. Il traite les images les unes après les autres, utilisant un outil de mémoire spécial pour se souvenir de ce qui s'est passé dans les instants précédents sans avoir besoin de recharger tout l'historique. Cela permet au système de maintenir un sentiment constant d'échelle et de position à mesure que la personne se déplace, garantissant que le modèle numérique ne rétrécisse pas, ne grandisse pas ou ne s'éloigne pas pendant la lecture de la vidéo. C'est une méthode qui maintient la reconstruction stable et efficace, même lorsque les données d'entrée sont éparses et imparfaites.

Une fois que le système possède un modèle 3D stable, il est confronté au défi de prédire le mouvement. Puisqu'il n'existe pas de carte parfaite de la façon dont chaque point du corps humain se déplace dans le monde réel pour servir d'enseignant, les chercheurs ont inventé une nouvelle façon d'apprendre à l'ordinateur. Ils ont demandé au système de deviner le mouvement, puis ont tenté de déformer le modèle 3D vers l'avant dans le temps en fonction de cette supposition. Si le modèle déformé ressemblait à l'image suivante de la vidéo, la supposition était bonne. Si elle semblait incorrecte, le système ajustait sa compréhension du mouvement. Cette boucle d'autocorrection, combinée à une vérification de la manière dont la lumière et l'ombre se comportent habituellement, a permis à l'ordinateur d'apprendre la danse complexe du mouvement humain sans avoir besoin d'un script pré-écrit. Le système a également développé un moyen de gérer les parties du corps qui sont cachées de la vue, garantissant que le modèle numérique reste solide et ne scintille pas ou ne bugge pas lorsque la personne se tourne ou qu'un objet bloque la vue.

Les résultats de cette approche sont frappants. Lors de tests sur divers ensembles de données, incluant des scènes complexes où des personnes interagissent avec des objets, le système a produit des images plus nettes et plus réalistes que celles générées par les méthodes précédentes. Il a pu créer de nouvelles vues d'une scène sous des angles qui n'avaient jamais été filmés, et il a pu générer des mouvements fluides et naturels pour des moments dans le temps qui n'avaient jamais été capturés. Lors des tests, le système a été capable de produire ces images de haute qualité en moins d'un quart de seconde par image, une vitesse qui ouvre la porte à des applications interactives telles que la réalité virtuelle, la diffusion en direct et la communication immersive. Les chercheurs ont noté que, bien que le système fonctionne exceptionnellement bien pour les mouvements normaux, il peut éprouver des difficultés si le mouvement est extrêmement rapide ou si l'écart temporel entre les images est trop important, suggérant que l'hypothèse d'un mouvement fluide et continu a ses limites.

En fin de compte, ce travail démontre qu'il est possible de reconstruire des scènes humaines dynamiques à partir de vidéos simples et non calibrées, avec une vitesse et une qualité auparavant inaccessibles. En simplifiant le problème en étapes gérables et en apprenant à l'ordinateur à apprendre de ses propres prédictions, les chercheurs ont créé un outil qui nous rapproche d'un futur où les avatars numériques pourront être générés instantanément et avec lesquels on pourra interagir en temps réel. Le système ne se contente pas de capturer un instant ; il comprend le flux du temps au sein de cet instant, nous permettant de pénétrer dans la vidéo et de regarder autour de nous comme si nous y étions réellement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →