← Derniers articles
💻 computer science

HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy

L'article propose HaWMPO, un cadre d'optimisation de politique basé sur un modèle de monde sensible aux hallucinations qui améliore les politiques robotiques généralistes en estimant et en supprimant les hallucinations de prédiction lors des déroulements imaginés, améliorant ainsi de manière significative les taux de réussite dans les tâches de manipulation complexes à long horizon sur des bancs d'essai et des robots réels.

Auteurs originaux : Zengjue Chen, Peidong Liu, Jiawei Li, Qi Wang

Publié 2026-09-10
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zengjue Chen, Peidong Liu, Jiawei Li, Qi Wang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les robots capables d'apprendre à accomplir une grande variété de tâches, de l'empilement de blocs au pliage de linge, sont depuis longtemps un objectif de l'intelligence artificielle. Pour y parvenir, les chercheurs ont développé des politiques « généralistes », qui sont essentiellement des systèmes semblables à un cerveau, entraînés pour comprendre le langage et la vision afin de décider comment un robot doit se déplacer. Cependant, enseigner ces systèmes dans le monde réel est lent, coûteux et risqué. Chaque fois qu'un robot tente une nouvelle action, il peut casser quelque chose ou s'endommager lui-même, ce qui rend le processus d'essais et d'erreurs dangereux. Pour résoudre ce problème, les scientifiques se sont tournés vers les « modèles de monde », qui sont des simulateurs numériques permettant aux robots de s'entraîner à l'intérieur d'un ordinateur. Ces modèles prédisent ce qui va se passer ensuite en fonction des actions actuelles, créant ainsi un espace sûr pour l'apprentissage. Pourtant, ces simulateurs numériques ne sont pas parfaits ; à mesure qu'ils prédisent l'avenir, ils commencent souvent à inventer des détails qui ne se sont jamais produits, un phénomène connu sous le nom d'« hallucination ». Si un robot apprend de ces scénarios fictifs, il pourrait apprendre à effectuer des actions qui fonctionnent dans l'ordinateur mais échouent complètement dans le monde réel.

Une équipe de chercheurs a développé une nouvelle méthode pour aider les robots à apprendre efficacement de ces simulations numériques imparfaites sans être induits en erreur par leurs erreurs. Ils appellent leur approche HaWMPO, un système conçu pour rendre les robots conscients du moment où leur terrain d'entraînement numérique leur ment. Au lieu de traiter chaque scénario imaginé comme étant d'égale valeur, le nouveau système inclut un composant spécial qui agit comme un inspecteur du contrôle de qualité. Cet inspecteur examine la séquence d'images générée par le simulateur et attribue un score indiquant la fiabilité de cette séquence. Si le simulateur commence à dériver dans la fantaisie, créant des images qui ne correspondent pas aux lois de la physique ou au résultat attendu, l'inspecteur le signale. Le système utilise ensuite cette information pour ajuster le processus d'apprentissage, disant effectivement au robot d'ignorer les parties de la simulation qui semblent trop peu fiables et de se concentrer sur les parties qui semblent réalistes.

Les chercheurs ont testé cette méthode en utilisant un ensemble standard de tâches robotiques dans un environnement informatique appelé LIBERO, qui consiste à déplacer des objets vers des emplacements spécifiques. Ils ont comparé leur nouveau système à d'autres méthodes qui utilisent des modèles de monde mais qui manquent de cette caractéristique de contrôle de qualité. Les résultats ont montré un avantage clair pour la nouvelle approche. Dans la simulation, le robot utilisant le système sensible aux hallucinations a atteint un taux de réussite de 63,7 %, ce qui est nettement supérieur à la méthode suivante la plus performante. L'amélioration était particulièrement notable dans les tâches nécessitant un raisonnement spatial et une manipulation d'objets, où la capacité du robot à distinguer les scénarios réels des faux l'a aidé à apprendre des stratégies plus robustes. Les chercheurs ont constaté qu'en pénalisant le robot lorsqu'il se fiait à des scénarios fortement hallucinés, le système l'empêchait d'apprendre de mauvaises habitudes qui ne fonctionneraient que dans une simulation défaillante.

Pour s'assurer que cette méthode fonctionnait en dehors de l'ordinateur, l'équipe l'a également testée sur un robot physique dans un environnement réel. Ils ont soumis le robot à deux défis spécifiques : placer un mouchoir dans une boîte et poser un casque audio sur un support. Sans le nouveau système, le robot réussissait ces tâches environ 60 % du temps pour la tâche du casque. Après l'application de l'entraînement sensible aux hallucinations, le taux de réussite est passé à une AUC de 0,8 en moyenne, le robot atteignant 85 % pour la tâche du mouchoir et 75 % pour la tâche du casque. Ce bond de performance démontre que les leçons apprises dans le monde numérique étaient réellement transférables au monde physique, car le robot avait appris à ignorer le bruit numérique qui confond habituellement ces systèmes. Les chercheurs ont noté que le système fonctionne en vérifiant constamment la cohérence du futur simulé, garantissant que le robot n'apprenne que des trajectoires qui semblent physiquement plausibles.

L'étude souligne que la clé d'un meilleur apprentissage robotique n'est pas seulement d'avoir un simulateur, mais d'avoir un moyen de lui faire confiance. En construisant un système capable de détecter quand une simulation perd pied avec la réalité, les chercheurs ont créé une voie plus stable pour l'amélioration des robots. Bien que les tests actuels aient été menés sur des tâches relativement courtes, ce succès suggère que cette approche pourrait être vitale pour des missions plus complexes et à long terme où un robot doit planifier de nombreuses étapes à l'avance. Ce travail confirme que pour que les robots deviennent de véritables assistants polyvalents, ils doivent apprendre à distinguer une prédiction utile d'un mensonge convaincant, une compétence que cette nouvelle méthode fournit en rendant le processus d'apprentissage lui-même conscient de ses propres limites.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →