MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval
Cet article présente MRBench, un benchmark complet de recherche de mouvement humain par le texte comprenant des données diverses, équilibrées et multigranulaires pour remédier aux limites des ensembles de données existants, ainsi qu'un modèle léger sensible à la granularité qui améliore considérablement la généralisation inter-domaines et la performance de recherche à travers différents niveaux de description.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayiez d'apprendre à un robot à comprendre le mouvement humain, non pas seulement en le regardant, mais en écoutant la façon dont nous le décrivons. C'est le monde de la recherche de mouvement humain par le texte, un domaine où les ordinateurs tentent de faire correspondre une vidéo d'une personne qui danse ou marche avec les mots spécifiques utilisés pour décrire cette action. Voyez cela comme un bibliothécaire surpuissant qui ne se contente pas de regarder le titre du livre, mais qui comprend l'histoire à l'intérieur pour trouver la correspondance exacte à une requête telle que : « Montrez-moi la vidéo où la personne trébuche sur ses propres lacets. » Pendant longtemps, des scientifiques ont construit des bibliothèques de ces vidéos de mouvement et de leurs descriptions pour entraîner leurs robots. Cependant, il y a un piège : si la bibliothèque ne contient que des vidéos de personnes marchant en ligne droite dans une pièce blanche, et que les descriptions se résument toutes à « personne marche », le robot apprend une version très étroite et ennuyeuse du monde. Il pourrait être excellent pour trouver cette marche spécifique, mais il serait complètement perdu si vous lui demandiez de trouver quelqu'un faisant un salto arrière dans un parc ou un trébuchement maladroit dans une cuisine.
C'est exactement le problème qu'une équipe de chercheurs de l'Université Jiao Tong de Shanghai et de l'Académie de Zhongguancun de Pékin a décidé de s'attaquer. Ils ont réalisé que les anciennes bibliothèques de données de mouvement étaient trop simples, trop répétitives et ne reflétaient pas la réalité désordonnée et diversifiée de la façon dont les humains bougent réellement. Ils ont donc construit une toute nouvelle et massive bibliothèque appelée MRBench. Au lieu de simplement « marcher », leur bibliothèque comprend 3 390 mouvements différents allant de pas de danse en intérieur à des actions sauvages du monde réel capturées à partir de vidéos et même d'animations générées par ordinateur. Ils ont couvert 118 catégories différentes de mouvement, garantissant qu'aucun type de mouvement ne domine la collection. Mais ils ne se sont pas arrêtés aux vidéos ; ils ont également réécrit les descriptions. Ils ont créé trois niveaux de détail pour chaque mouvement : un résumé court et percutant (comme « personne tombe »), une description standard (comme « personne tombe en arrière sur le sol ») et un compte rendu ultra-détaillé et précis (comme « la personne commence debout, se penche en arrière, s'effondre et atterrit immobile »). Cela leur permet de tester si un ordinateur peut comprendre une commande simple par rapport à une histoire complexe et détaillée.
Lorsqu'ils ont mis leur nouvelle bibliothèque à l'épreuve, ils ont découvert que les anciens modèles informatiques populaires allaient avoir un réveil brutal. Ces modèles, qui semblaient intelligents lorsqu'ils étaient testés sur les anciennes bibliothèques simples, ont eu beaucoup de mal face à la diversité de MRBench. Ils étaient comme un étudiant qui avait mémorisé les réponses à un examen blanc spécifique, mais qui échouait lorsque les questions étaient formulées différemment ou portaient sur de nouveaux sujets. Les chercheurs ont découvert que ces modèles étaient très sensibles à la précision du texte ; ils étaient souvent confus lorsque la description n'était pas exactement ce à quoi ils étaient habitués. Pour correr cela, l'équipe a conçu un nouveau modèle léger qui agit comme un traducteur flexible. Il conserve une base solide pour comprendre les descriptions standard, mais ajoute des « adaptateurs » spéciaux qui peuvent rapidement s'ajuster pour comprendre les résumés courts ou les récits longs et détaillés sans perdre le fil. En testant cette nouvelle approche, ils ont montré qu'il est possible de rendre les ordinateurs meilleurs pour comprendre tout le spectre du mouvement humain et du langage, d'un simple « saut » à un compte rendu détaillé d'une routine de gymnastique, sans oublier comment gérer les bases.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.