← Derniers articles
🤖 machine learning

Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model

Dynin-Robotics introduit un modèle de diffusion unifié omnimodal qui traite le langage, la vision et les actions comme des jetons discrets pour apprendre conjointement la prédiction d'objectifs, la modélisation de la dynamique et la génération d'actions, atteignant des performances compétitives sur de multiples benchmarks grâce à la modélisation de trajectoire partagée et à la mise à l'échelle au moment du test.

Auteurs originaux : Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim, Geon Choi, Hyeonggeun Kim, Jaeyoung Do

Publié 2026-09-14
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim, Geon Choi, Hyeonggeun Kim, Jaeyoung Do

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les robots luttent depuis longtemps pour comprendre le monde de la même manière que les humains. Bien qu'une machine puisse être programmée pour déplacer son bras vers une coordonnée spécifique, elle échoue souvent lorsque la tâche nécessite de comprendre une instruction vague comme « donne-moi quelque chose pour couper le paquet ». Pour résoudre cela, des chercheurs construisent des systèmes qui connectent le langage, la vision et le mouvement physique en un seul cerveau. Ces systèmes, connus sous le nom de modèles vision-langage-action, tentent d'apprendre non seulement ce qu'est un objet, mais aussi comment il se comporte et comment le manipuler. Le défi résidait dans le fait que la plupart des approches actuelles traitent ces compétences séparément : une partie du système peut comprendre les mots, une autre peut reconnaître l'image, et une troisième peut calculer les commandes motrices. Cette séparation laisse souvent le robot confus lorsque le monde réel change ou lorsque les instructions sont formulées de manière inattendue.

Une équipe de chercheurs de l'Université Nationale de Séoul a introduit une nouvelle approche appelée Dynin-Robotics qui unifie ces compétences distinctes en un modèle cohérent. Au lieu de construire un cerveau de robot avec différents modules pour différentes tâches, ils ont créé un système unique qui apprend à prédire le futur de plusieurs manières à la fois. Imaginez un robot qui, lorsqu'on lui donne une tâche, ne se contente pas de calculer le prochain mouvement, mais imagine également à quoi ressemblera la scène après ce mouvement, quel devrait être l'état final de l'objectif, et comment décrire la tâche par des mots. En entraînant un seul modèle à gérer toutes ces prédictions simultanément, les chercheurs ont découvert que le robot devient bien meilleur pour suivre les instructions, même lorsque celles-ci sont formulées différemment de ce pour quoi il a été entraîné.

Le cœur de ce système est une méthode appelée diffusion masquée. En termes simples, il s'agit d'un processus d'apprentissage où le modèle se voit présenter une séquence d'informations — telle qu'une vidéo d'une tâche, une instruction écrite et les mouvements du robot — mais où certaines parties de cette séquence sont cachées ou « masquées ». Le travail du modèle est d'observer les parties visibles et de deviner ce que devraient être les parties cachées. Par exemple, il peut voir une image d'une tasse et les mots « ramasser la tasse », mais les données de mouvement sont cachées, il doit donc prédire le mouvement correct. Dans un autre scénario, il peut voir le mouvement et l'instruction, mais l'image finale de la tasse dans la main est cachée, il doit donc prédire le résultat. En pratiquant ces différents types de jeux de devinettes sur un ensemble massif de données de plus de 1,3 million de trajectoires de robots, le modèle acquiert une compréhension profonde de la façon dont le langage, la vision et l'action sont connectés.

Ce qui rend cette approche unique est que le même modèle peut passer instantanément d'un rôle à l'autre. Il peut agir comme une politique, décidant de l'action à entreprendre ensuite ; comme un modèle de monde, prédisant ce que la caméra verra après une action ; comme un prédicteur d'objectif, visualisant l'état de réussite final d'une tâche ; ou comme un enseignant, reconstruisant l'instruction originale à partir d'une vidéo du robot en train de travailler. Cette flexibilité permet au système d'utiliser ses propres prédictions pour améliorer ses performances. Par exemple, avant de décider comment bouger son bras, le robot peut d'abord prédire à quoi ressemble l'état final de l'objectif. Il utilise ensuite cet objectif prédit comme un guide pour affiner son plan d'action. Ce processus de projection vers l'avenir et d'ajustement du plan en temps réel aide le robot à gérer des tâches complexes qui nécessitent un alignement précis, comme insérer une fleur dans un vase ou empiler des blocs dans un ordre spécifique.

Les chercheurs ont testé ce système sur diverses références pour voir comment il se comportait par rapport aux autres modèles robotiques de pointe. Sur des tâches de simulation standard, le modèle a atteint un taux de réussite de 98,1 %, se plaçant parmi les meilleurs performeurs du domaine. Plus important encore, lorsqu'il a été testé sur des tâches où les instructions étaient modifiées pour être plus indirectes ou abstraites, le système a montré une capacité d'adaptation significative. Dans une série d'expériences, le modèle a été testé sur une tâche où il devait sélectionner un fruit sur la base d'une description telle que « quelque chose de naturellement sucré et juteux » plutôt que sur une commande directe comme « ramasser la pomme ». Alors que d'autres modèles peinaient face à ces changements de langage, Dynin-Robotics a maintenu un taux de réussite élevé, démontrant qu'il avait appris le concept sous-jacent de la tâche plutôt que de simplement mémoriser des phrases spécifiques.

Le système s'est également avéré efficace dans le monde réel. Les chercheurs ont déployé le modèle sur un bras robotique physique connu sous le nom de Franka Research 3. Dans une série de tests en conditions réelles impliquant la cueillette de fruits, le tri de cubes colorés et l'empilement de ceux-ci dans un ordre spécifique, le robot a atteint un taux de réussite moyen de 78,4 % à travers quatre différentes conditions de manipulation. Cette performance était particulièrement forte dans les tâches exigeant le suivi d'une séquence d'étapes, comme l'empilement de cubes selon un ordre de couleurs spécifié par l'utilisateur. La capacité de visualiser l'objectif et les étapes intermédiaires a permis au robot de corriger sa trajectoire s'il commettait une erreur, une capacité souvent absente des systèmes plus simples.

Au-delà de sa capacité à contrôler un robot, le modèle a démontré une capacité surprenante à comprendre et à générer des descriptions. Lorsqu'on lui montre une vidéo d'un robot effectuant une tâche, le système peut décrire avec précision ce qui se passe, en utilisant des verbes comme « prendre », « poser » et « plier », et en identifiant les objets par leur couleur et leur emplacement. Inversement, lorsqu'on lui donne une description de tâche, il peut générer une prédiction visuelle de ce à quoi ressemblera la scène finale. Ces capacités suggèrent que le modèle a construit une représentation interne riche du monde physique qui dépasse le simple contrôle moteur.

Pour rendre ce système assez rapide pour une utilisation en temps réel, les chercheurs ont également développé une méthode spécialisée pour exécuter le modèle. Comme le modèle fonctionne en affinant de manière itérative ses suppositions, il peut être lent s'il doit traiter chaque étape une par une. L'équipe a créé une technique qui permet au modèle de prédire et de s'engager sur plusieurs étapes de mouvement simultanément. Cette optimisation a accéléré le processus de prise de décision du robot de près de 30 fois par rapport à la méthode standard, rendant possible l'exécution de ce modèle complexe sur un matériel capable de suivre la vitesse d'un robot physique.

Les conclusions de ce travail suggèrent que traiter l'apprentissage robotique comme un problème de prédiction unifié est une stratégie puissante. En combinant la capacité de comprendre le langage, de prédire les changements visuels et de générer des actions en un seul cadre, les chercheurs ont créé un système plus robuste et adaptable que les modèles précédents. Le succès de Dynin-Robotics indique que lorsqu'un robot peut imaginer le futur et comprendre le contexte d'une tâche, il devient beaucoup plus capable de gérer la nature imprévisible du monde réel. Bien qu'il reste du travail à faire, notamment pour étendre ces capacités à des séquences d'actions plus longues et plus complexes, cette approche offre une voie prometteuse vers des robots qui peuvent véritablement comprendre et interagir avec leur environnement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →