← Derniers articles
💻 computer science

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force

Cet article propose MuSe, un cadre d'apprentissage continu multisensoriel qui adapte efficacement des politiques robotiques préentraînées uniquement basées sur la vision à de nouvelles modalités de force-couple grâce à une fusion multi-étapes et une relecture d'expérience, améliorant ainsi les performances sur les tâches riches en contacts sans oublier les capacités originales.

Auteurs originaux : Jaden Clark, Changhao Wang, Yihuai Gao, Seongheon Hong, Hojung Choi, Mark Cutkosky, Yifan Hou, Shuran Song

Publié 2026-07-01
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jaden Clark, Changhao Wang, Yihuai Gao, Seongheon Hong, Hojung Choi, Mark Cutkosky, Yifan Hou, Shuran Song

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez entraîné un robot pour être un chef étoilé, mais que vous ne l'ayez appris qu'en utilisant ses yeux. Il a appris à couper, remuer et dresser les plats en regardant des milliers de vidéos. Il est excellent pour voir ce qu'il doit faire, mais il ne sait pas quelle pression exercer ou quand quelque chose glisse.

Maintenant, imaginez que vous vouliez enseigner au robot une nouvelle compétence : le ressenti. Vous voulez qu'il utilise un capteur de force (comme un toucher sensible) pour manipuler des tâches délicates, comme essuyer un vase sans le casser ou visser une ampoule sans la fissurer.

Voici le problème : vous ne disposez pas d'une immense bibliothèque de vidéos incluant à la fois les "yeux" du robot et ses nouveaux capteurs de "toucher". Vous n'avez qu'un tout petit nouveau jeu de données avec ces nouveaux capteurs. Si vous essayez simplement d'enseigner au robot avec ces petites nouvelles données, il risque de s'embrouiller et d'oublier tout ce qu'il a appris par la vue. C'est ce qu'on appelle l'oubli catastrophique.

Ce document présente une solution appelée MuSe (Apprentissage Continuel Multisensoriel). Considérez MuSe comme un guide d'étude astucieux qui aide le robot à apprendre un nouveau sens sans oublier les anciens.

Voici comment fonctionne MuSe, en utilisant des analogies simples :

1. La connexion en "sens de circulation bidirectionnel" (Fusion multi-étapes)

Habituellement, quand on ajoute un nouveau sens à un robot, on se contente de l'ajouter à la fin, comme on ajouterait un accompagnement à un repas. MuSe est différent. Il crée une rue à double sens entre les yeux du robot et ses nouveaux capteurs de toucher.

  • Fusion précoce : Il mélange les données de "toucher" avec les données de "vue" dès le début, comme on mélange la farine et les œufs avant de cuire une pâte. Cela permet au robot de comprendre immédiatement comment le toucher et la vue sont liés.
  • Fusion tardive : Il vérifie également plus tard dans le processus, comme un goûteur qui ajuste l'assaisonnement à mi-cuisson.
  • Le résultat : Le robot ne fait pas que "voir" ou "sentir" ; il apprend une compréhension unifiée où la vue et le toucher s'entraident.

2. La "Boule de cristal du futur" (Prédiction multisensorielle du futur)

Pour s'assurer que le robot comprend vraiment le nouveau sens, MuSe ne lui demande pas seulement de "réaliser la tâche". Il lui demande de prédire l'avenir.

  • Le robot est entraîné à deviner : "Que vais-je voir dans la seconde qui vient ? Que vais-je ressentir dans la seconde qui vient ? Quelle action dois-je entreprendre ?"
  • L'analogie : Imaginez un conducteur apprenant à conduire sous la pluie. Au lieu de simplement conduire, on lui demande de prédire : "Si je tourne le volant maintenant, est-ce que la voiture va déraper ?" et "Est-ce que les essuie-glaces vont bien dégager l'eau ?"
  • En forçant le robot à prédire à la fois la scène visuelle et les signaux de force, il construit une carte interne profonde du fonctionnement du monde physique. Cela l'aide à généraliser, ce qui signifie qu'il peut utiliser ses nouvelles compétences de "toucher" même sur des tâches qu'il n'a pas encore rencontrées.

3. La "Révision par fiches de révision" (Rejeu d'expérience)

C'est la partie la plus critique pour empêcher le robot d'oublier. Lorsque le robot apprend les nouvelles compétences de "toucher", MuSe le force à continuer à pratiquer ses anciennes compétences de "vue" en même temps.

  • L'analogie : Imaginez un étudiant apprenant une nouvelle langue (le français) tout en essayant de garder ses compétences en espagnol bien aiguisées. S'il ne fait qu'étudier le français pendant un mois, il pourrait oublier l'espagnol. MuSe est comme un professeur qui dit : "Pour chaque heure passée à étudier le français, tu dois passer 30 minutes à réviser l'espagnol."
  • Dans le cas du robot, il mélange les petites nouvelles données de "toucher" avec les énormes anciennes données de "vue". Lorsqu'il voit une tâche où il n'a pas de données de toucher (parce que les anciennes données n'en avaient pas), MuSe masque simplement la partie "toucher" de la question et laisse le robot répondre en se basant uniquement sur la vue. Cela maintient les anciennes compétences vivantes.

Qu'ont trouvé les chercheurs ?

Les chercheurs ont testé cela sur un véritable bras robotique.

  • Transfert vers l'avant (Apprendre de nouvelles choses) : Le robot est devenu bien meilleur dans les tâches impliquant un contact (comme essuyer un vase ou insérer une cheville) grâce aux nouveaux capteurs de toucher. Il n'a pas seulement appris la tâche ; il a appris comment se frayer un chemin grâce au toucher.
  • Transfert vers l'arrière (Ne pas oublier) : De manière surprenante, après avoir appris à utiliser les capteurs de toucher, le robot est devenu meilleur dans ses tâches originales basées uniquement sur la vue. Il semble que l'apprentissage du "toucher" l'ait aidé à mieux comprendre la physique du monde, ce qui a rendu ses compétences de "vue" plus aiguisées.
  • Généralisation cross-modale : Même sur des tâches où on n'avait jamais montré les données de toucher au robot pendant l'entraînement, celui-ci pouvait toujours prédire quelles auraient été les forces exercées. Il a appris un concept général de "force" qu'il peut appliquer partout.

L'essentiel à retenir

MuSe montre que vous n'avez pas besoin d'un jeu de données massif et parfait pour chaque capteur possible pour entraîner un robot. Vous pouvez prendre un robot qui est déjà un expert de la vue, lui donner une petite quantité de nouvelles données de "toucher", et utiliser cette méthode d'entraînement spéciale pour le mettre à niveau. Le robot apprend le nouveau sens, conserve ses anciennes compétences, et devient en réalité plus intelligent globalement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →