← Derniers articles
💻 computer science

Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation

Cet article présente Grounded-Exo2Ego, un cadre de diffusion vidéo à double branche qui combine l'ancrage géométrique avec une nouvelle branche d'ancrage sémantique et un algorithme de relocalisation de caméra pour générer de manière robuste des vidéos égocentriques à partir d'entrées exocentriques, atteignant des performances de pointe sur le jeu de données EgoExo4D grâce à une architecture améliorée et une génération de données synthétiques entièrement automatisée.

Auteurs originaux : Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello

Publié 2026-08-24
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous regardiez une vidéo d'une personne en train de cuisiner depuis l'autre côté de la cuisine. Vous voyez toute la scène : la cuisinière, le plan de travail, les mouvements du chef. Maintenant, imaginez pouvoir changer instantanément de perspective pour voir exactement ce que voit le chef, comme si vous portiez ses yeux. Cette capacité à transformer une vue à la troisième personne en une vue à la première personne est l'objectif d'un nouvel effort scientifique appelé génération de vidéos exocentrique-à-égocentrique. C'est une étape cruciale pour construire des robots capables d'apprendre en regardant des vidéos humaines et pour créer des expériences de réalité virtuelle immersives où les utilisateurs peuvent revivre des moments du point de vue d'une autre personne. Cependant, transformer une vidéo filmée de l'extérieur en une vue de l'intérieur est incroyablement difficile. Les outils classiques de vision par ordinateur, qui fonctionnent bien pour changer d'angles dans une scène statique, échouent souvent ici. Lorsque la caméra passe d'une vue large à un gros plan, l'ordinateur peine à deviner ce qui est caché derrière les objets ou à quoi la scène devrait ressembler sous un angle complètement différent, ce qui entraîne souvent des images déformées, floues ou incomplètes.

Une équipe de chercheurs de NVIDIA a développé un nouveau système appelé Grounded-Exo2Ego pour résoudre ce problème. Au lieu de s'appuyer sur les méthodes habituelles qui tentent de forcer une correspondance géométrique entre la vue extérieure et la vue intérieure, ils ont construit un cadre qui comprend à la fois la forme de la pièce et les objets spécifiques à l'intérieur. Les chercheurs ont découvert que les tentatives précédentes échouaient parce que la meilleure estimation par l'ordinateur de la forme 3D de la pièce était souvent erronée, en particulier pour les parties de la scène qui étaient cachées de la caméra d'origine. Lorsque l'ordinateur essayait d'utiliser ces cartes 3D défectueuses pour générer une nouvelle vue, le résultat était une vidéo pleine de trous et de surfaces déformées. Pour corriger cela, le nouveau système utilise une approche à double branche. Une branche agit comme un guide structurel, utilisant une carte 3D approximative de la scène pour indiquer à l'ordinateur où les murs et les sols devraient se trouver. La seconde branche, qui est l'innovation clé, agit comme un guide sémantique. Elle identifie des objets spécifiques dans la vidéo, tels qu'une personne, un vélo ou une marmite, et dit à l'ordinateur exactement à quoi ces objets devraient ressembler et où ils doivent se trouver, même si la carte 3D est incomplète ou brisée.

Les chercheurs ont également découvert un défaut caché dans la manière dont ces systèmes sont entraînés. Dans le monde réel, la caméra qu'une personne porte ne correspond pas parfaitement à la reconstruction 3D de la pièce effectuée par l'ordinateur. Ce décalage signifiait que lorsque l'ordinateur essayait d'apprendre à partir de données vidéo réelles, il essayait essentiellement d'apprendre à partir d'une carte déformée qui ne s'alignait pas avec la réalité qu'il était censé imiter. Pour résoudre cela, l'équipe a créé un nouveau processus qui réaligne la position de la caméra au sein de la carte 3D imparfaite de l'ordinateur avant le début de l'entraînement. Cela garantit que l'ordinateur apprend à partir d'une image cohérente. De plus, pour fournir au système des exemples parfaits pour apprendre, ils ont construit un moteur entièrement automatisé qui crée des milliers de vidéos synthétiques. Dans ces mondes générés par ordinateur, ils placent des personnages 3D animés dans diverses pièces et les enregistrent à la fois de l'extérieur et de l'intérieur, fournissant au modèle des données impeccables que les caméras du monde réel ne peuvent pas facilement capturer.

Lors de tests sur un ensemble de données exigeant de vidéos réelles présentant des activités telles que le sport, la cuisine ou la réparation de vélos, le nouveau système a nettement surpassé les méthodes existantes. Il a produit des vidéos plus nettes, plus précises et bien meilleures pour maintenir les objets à leur place correcte. Par exemple, alors que les anciennes méthodes échouaient souvent à reconstruire entièrement les personnes ou les plaçaient aux mauvais endroits, le nouveau système a réussi à générer des vues claires des sujets et de leurs environs. Les résultats ont montré qu'en combinant une compréhension approximative de l'agencement de la pièce avec une compréhension détaillée des objets qui s'y trouvent, et en s'entraînant sur des données soigneusement alignées et complétées par des exemples synthétiques, l'ordinateur pouvait enfin combler le fossé entre regarder une scène et voir à travers les yeux de quelqu'un d'autre. Ce travail suggère que pour que les machines puissent véritablement comprendre et reproduire les expériences humaines, elles doivent regarder au-delà de la simple géométrie et apprendre la signification des objets qu'elles tentent de restituer.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →