← Derniers articles
💻 computer science

Sandwich-Residuals: Parameter-Efficient Test-time Adaptation of World Models

L'article introduit Sandwich-Residuals, une méthode d'adaptation au moment du test efficace en termes de paramètres pour les modèles de monde latents qui gèle les poids préentraînés et apprend uniquement de petites corrections résiduelles en ligne à l'aide d'erreurs de prédiction auto-supervisées, atteignant des taux de réussite nettement améliorés sous des changements de distribution tout en adaptant 97 à 99 % de paramètres de moins que les approches existantes.

Auteurs originaux : Krishnam Soni, Aditya Sehgal, Vedant Dave, Elmar Rueckert

Publié 2026-09-21
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Krishnam Soni, Aditya Sehgal, Vedant Dave, Elmar Rueckert

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les robots capables de planifier leurs propres mouvements s'appuient souvent sur une carte interne de la façon dont le monde fonctionne. Imaginez un bras robotique essayant de pousser un bloc à travers une table. Au lieu de simplement réagir à ce qu'il voit sur le moment, un robot intelligent construit un modèle mental qui prédit ce qui se passera s'il déplace son bras d'une certaine manière. Il apprend à dire : « Si je pousse ici, le bloc glissera là ». Ce modèle mental, souvent appelé modèle de monde, permet au robot de simuler des actions futures dans son esprit avant de bouger réellement, l'aidant ainsi à éviter les erreurs et à atteindre ses objectifs efficacement. Ces modèles sont généralement entraînés dans un environnement contrôlé, comme une simulation informatique, où l'éclairage est parfait et la physique est cohérente. Cependant, le monde réel est désordonné. Lorsqu'un robot entraîné dans une simulation est placé dans une nouvelle pièce avec un éclairage différent, ou lorsque la surface de la table devient glissante, la carte interne du robot peut devenir erronée. Les prédictions qu'il fait ne correspondent plus à la réalité, et le robot échoue à accomplir sa tâche. Pendant des années, la solution standard à ce problème a été de réentraîner des parties du cerveau du robot pendant qu'il travaille, en ajustant des millions de paramètres internes pour s'adapter aux nouvelles conditions. Ce processus est lourd, lent et nécessite que le robot réécrive constamment sa propre compréhension du mouvement des choses.

Une équipe de chercheurs a découvert une façon beaucoup plus légère de résoudre ce problème. Au lieu de demander au robot de réécrire l'intégralité de sa carte interne, ils ont découvert qu'il est souvent suffisant d'ajuster les bords où le robot lit ses entrées et écrit ses sorties. Dans une nouvelle étude, les chercheurs ont introduit une méthode qu'ils appellent « Sandwich-Residuals » (résidus en sandwich). Ils ont pris un robot qui avait déjà appris à se déplacer dans une simulation et ont complètement gelé son cerveau interne, empêchant ainsi l'un de ses millions de paramètres appris de changer. Ensuite, ils ont ajouté deux couches de logiciels très petites et flexibles : une qui modifie les informations arrivant dans le cerveau du robot, et une autre qui modifie les prédictions sortant de celui-ci. Ces petites couches agissent comme une garniture de sandwich, enveloppant le noyau gelé. À mesure que le robot essaie de bouger et commet des erreurs, ces petites couches apprennent à corriger les erreurs à la volée, sans jamais toucher au cerveau pré-entraîné et lourd à l'intérieur. Le robot apprend à dire : « Mon cerveau pense que le bloc ira ici, mais ma nouvelle couche de correction sait que le sol est glissant, donc je vais ajuster mon plan pour l'envoyer là ».

Les chercheurs ont testé cette idée sur une variété de tâches exigeantes, notamment la navigation dans des labyrinthes et la poussée d'objets de formes différentes. Ils ont comparé leur méthode à l'approche standard, qui consiste à mettre à jour le cerveau interne du robot, et à un robot qui n'effectue aucun ajustement du tout. Dans vingt-et-un scénarios de test différents, le robot utilisant la nouvelle méthode de « sandwich » a réussi à atteindre son objectif 65 % du temps. C'était une amélioration significative par rapport au robot non ajusté, qui ne réussissait qu'environ 49 % du temps. Plus important encore, la nouvelle méthode a performé presque aussi bien que l'approche standard qui réécrit le cerveau du robot, laquelle réussissait environ 68 % du temps. La différence cruciale réside dans l'efficacité. La méthode standard devait mettre à jour près de dix millions de paramètres pour s'adapter aux nouvelles conditions. La nouvelle méthode, en revanche, n'avait besoin d'ajuster qu'environ cent mille paramètres. Cela signifie que la nouvelle approche s'adapte en utilisant moins de trois pour cent de l'effort de calcul requis par l'ancienne méthode, tout en atteignant un niveau de réussite presque identique.

L'étude a également examiné ce qui se passe lorsque le robot est confronté à plusieurs problèmes à la fois, comme un changement d'éclairage combiné à un changement de la sensation de poids des objets. Dans ces situations « composées » difficiles, la nouvelle méthode est encore plus impressionnante. Elle a réussi 1,9 fois plus souvent que le robot non ajusté, tout en restant aussi efficace que la méthode lourde de mise à jour du cerveau. Les chercheurs ont constaté que le type de correction nécessaire dépendait du problème spécifique. Lorsque le robot naviguait dans un labyrinthe et que la physique du mouvement changeait, la couche qui corrigeait les prédictions du robot après qu'elles furent faites faisait l'essentiel du travail. Lorsque le robot poussait des objets et que le contrôleur devenait plus sensible, la couche qui ajustait les commandes d'entrée du robot était plus importante. En conservant les deux couches, le système pouvait gérer une grande variété de changements inattendus sans avoir besoin de savoir à l'avance quel genre de problème il rencontrerait.

Pour prouver que cette idée fonctionne au-delà des simples jeux de labyrinthe, les chercheurs l'ont également appliquée à une tâche plus complexe impliquant un bras robotique de style réel déplaçant un cube dans un espace tridimensionnel. Ils ont utilisé un type différent de cerveau de robot pour cette tâche, qui repose sur des motifs visuels plutôt que sur la conception précédente. Même avec cette architecture différente, le principe du « sandwich » a fonctionné. Le robot a pu s'adapter aux changements d'éclairage, d'angles de caméra et de force de ses propres moteurs. Dans chaque cas de test où les conditions changeaient, la nouvelle méthode améliorait les performances du robot par rapport à l'absence d'ajustement, alors que les autres méthodes faisaient parfois moins bien le robot. Cela suggère que la capacité de s'adapter ne nécessite pas toujours qu'un robot change fondamentalement sa compréhension du monde. Parfois, il suffit d'ajouter un petit filtre flexible qui aide le robot à interpréter correctement sa situation actuelle.

Les conclusions suggèrent un changement dans la façon dont nous pourrions construire les robots du futur. Pendant longtemps, l'hypothèse était que si l'environnement d'un robot changeait, son modèle interne de la physique devait être réécrit pour correspondre. Ce document montre que cette hypothèse n'est pas toujours nécessaire. Si la compréhension fondamentale du monde par le robot est encore majoritairement correcte, il peut simplement apprendre à ajuster ses entrées et ses sorties pour s'adapter à la nouvelle réalité. Cette approche est non seulement plus rapide et moins coûteuse, mais elle est aussi plus stable, car elle évite le risque que le robot n'oublie ce qu'il sait déjà en essayant d'apprendre quelque chose de nouveau. Bien que les expériences aient été menées dans des simulations informatiques, les résultats pointent vers un avenir où les robots pourront entrer dans de nouveaux environnements et commencer immédiatement à travailler, en utilisant de petits ajustements efficaces pour gérer les surprises du monde réel sans nécessiter une refonte massive de leur intelligence.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →