← Derniers articles
💻 computer science

Real-Time Human-Centric World Modeling for Upper-Body Human-Object Interaction

Cet article présente un modèle de monde centré sur l'humain en temps réel qui synthétise des interactions du haut du corps cohérentes en combinant une représentation implicite multi-échelle unifiée pour le mouvement humain continu avec des états discrets encodés par le langage pour un contrôle précis du contact avec les objets, atteignant une inférence de 25 FPS sur des GPU H100.

Auteurs originaux : Chaonan Ji, Jinwei Qi, Peng Zhang, Bang Zhang

Publié 2026-07-28
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Chaonan Ji, Jinwei Qi, Peng Zhang, Bang Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous regardez un film où le personnage principal peut tendre la main, saisir une tasse de café, prendre une gorgée et la reposer, tout en vous parlant. Pendant longtemps, les informaticiens ont excellé dans l'art de faire bouger le corps du personnage de manière réaliste, mais ils ont souvent eu du mal avec la partie « saisie ». Parfois, la main traversait la tasse comme un fantôme, ou la tasse changeait magiquement de forme lorsqu'elle était touchée. C'est le défi de l'« interaction humain-objet » : apprendre à un ordinateur non seulement comment une personne bouge, mais aussi comment elle touche physiquement et transforme le monde qui l'entoure.

Pour y parvenir, les chercheurs s'appuient généralement sur deux outils principaux. Premièrement, la génération de vidéo, qui est comme un artiste numérique capable de peindre des images animées à partir d'une description. Deuxièmement, la modélisation du monde, une façon sophistiquée de dire qu'un ordinateur tente de prédire comment une scène évolue au fil du temps. La grande question a été : peut-on combiner ces deux éléments pour créer un personnage qui ne se contente pas de danser sur place, mais qui interagit réellement avec des objets en temps réel, comme un personnage de jeu vidéo qui semble assez réel pour être touché ?

C'est précisément ce sur quoi une équipe de chercheurs de Tongyi Lab travaille. Ils ont construit un nouveau système qui agit comme un « modèle de monde centré sur l'humain en temps réel ». Voyez cela comme un marionnettiste numérique qui ne se contente pas de contrôler les membres de la marionnette, mais qui décide également si la marionnette tient un marteau ou si elle agite simplement la main dans le vide. Leur objectif était de créer un système capable de prendre une vidéo en direct d'une personne, l'image d'un objet (comme une tasse) et une commande simple (comme « saisir » ou « sans contact »), et de générer instantanément une vidéo où la personne interagit parfaitement avec cet objet.

L'équipe a découvert qu'en divisant le contrôle en deux parties distinctes, elle pouvait résoudre le problème bien mieux que les méthodes précédentes. La première partie est l'état humain continu, qui gère les mouvements fluides et harmonieux du corps, des mains et du visage. Imaginez cela comme la main du marionnettiste guidant les muscles de la marionnette. La seconde partie est l'état d'interaction discret, qui est comme un interrupteur simple indiquant au système : « Est-ce que la main touche l'objet en ce moment ? » ou « Est-elle en train de le tenir ? ». En utilisant une commande courte et spécifique pour cet interrupteur (comme les mots « saisir » ou « sans contact » au lieu d'une phrase longue et compliquée), l'ordinateur peut passer d'un état à l'autre instantanément et avec précision.

Le résultat est un système capable de générer ces interactions à une vitesse de 25 images par seconde avec un délai d'environ 1000 millisecondes. Cela signifie qu'il est assez rapide pour donner l'impression d'une conversation en direct ou d'un jeu vidéo en temps réel. Les chercheurs ont démontré que leur méthode crée des mouvements de mains plus réalistes et un meilleur contact avec les objets par rapport aux anciens systèmes, qui produisaient souvent des bugs étranges comme des objets flottants ou des mains qui ne se fermaient pas tout à fait autour de ce qu'elles étaient censées tenir. Ils ont également créé un ensemble de données spécial de plus de 30 000 exemples pour apprendre au système à quoi ces interactions devraient ressembler. Bien qu'ils n'aient pas prétendu résoudre tous les problèmes de l'univers, leurs expériences suggèrent que cette approche « continu-discret » est une étape significative vers la création d'humains numériques capables de véritablement interagir avec leur monde en temps réel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →