← Derniers articles
💻 computer science

MINERVA: How Small Can a Manipulation Policy Be and Still Solve LIBERO?

Le papier introduit MINERVA, une politique vision-langage-action extrêmement compacte de 0,54 M de paramètres qui atteint des performances proches de l'état de l'art sur le benchmark LIBERO, révélant que le seuil de capacité de la tâche est étonnamment bas tout en exposant des limitations critiques dans la robustesse du conditionnement par instruction et l'absence de bénéfice provenant du flow matching.

Auteurs originaux : Kohei Sendai, Tatsuya Matsushima, Yusuke Iwasawa

Publié 2026-09-04
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Kohei Sendai, Tatsuya Matsushima, Yusuke Iwasawa

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les robots apprennent à se déplacer avec une dextérité qui semblait autrefois impossible, ramassant des objets, empilant des blocs et suivant des commandes vocales simples. Cette progression est portée par un nouveau type d'intelligence artificielle qui combine la vision, le langage et l'action en un système unique. Ces systèmes, souvent appelés modèles vision-langage-action, agissent comme le cerveau d'un robot, observant une scène, comprenant une requête telle que « ramasse le bloc rouge », puis calculant les mouvements précis nécessaires pour accomplir la tâche. Pour entraîner ces cerveaux, les chercheurs utilisent un ensemble standard de défis connus sous le nom de benchmarks, qui servent de règle de mesure pour évaluer la performance d'un robot. Pendant des années, le benchmark le plus populaire pour la manipulation robotique a été une collection de quarante tâches différentes impliquant le déplacement d'objets dans un environnement simulé. La croyance prédominante dans le domaine était que, pour résoudre ces tâches efficacement, un robot a besoin d'un cerveau massif — un modèle numérique de plusieurs milliards de paramètres, ou réglages internes, qui nécessite un matériel informatique puissant et coûteux pour fonctionner.

Cependant, une équipe de chercheurs de l'Université de Tokyo s'est posé une question plus simple et plus pratique : de combien de taille le cerveau doit-il réellement être ? Si un robot est déployé pour effectuer un ensemble spécifique de tâches dans une usine ou une maison, il n'a pas besoin de comprendre toutes les langues du monde ou de reconnaître chaque objet qu'il n'a jamais vu auparavant. Il a seulement besoin de résoudre les tâches spécifiques pour lesquelles il a été engagé. Les chercheurs voulaient trouver la version la plus petite possible d'un cerveau de robot capable de résoudre parfaitement l'ensemble standard des quarante tâches. Ils cherchaient la quantité minimale de puissance de calcul requise pour accomplir le travail, un seuil qui déterminerait si un robot pourrait fonctionner sur une petite puce bon marché ou s'il aurait toujours besoin d'un serveur massif.

Pour trouver cette limite, l'équipe a construit une famille de politiques robotiques, qui sont les programmes dictant au robot comment se déplacer, et les a systématiquement réduites en taille. Ils ont commencé avec un modèle contenant près de dix millions de paramètres internes et l'ont réduit, étape par étape, en observant le moment où le robot commencerait à échouer. Ils ont supprimé les caractéristiques complexes courantes dans les modèles plus grands, telles que la capacité de lire des phrases en langage naturel ou d'utiliser des systèmes de vision pré-entraînés. Au lieu de cela, ils ont donné au robot une simple liste de quarante noms de tâches, représentés par des nombres, et une caméra qui apprend à voir à partir de zéro. Ils ont ensuite entraîné ces modèles sur les quarante tâches standard et les ont testés plus de deux mille fois pour voir la fréquence de leurs succès.

Les résultats ont révélé un plancher surprenant. Les chercheurs ont découvert qu'un modèle de seulement 0,54 million de paramètres était capable de résoudre les tâches avec un taux de réussite de 95,1 %. Ce minuscule modèle est presque aussi performant que les modèles les plus célèbres et les plus grands du domaine, qui contiennent des milliards de paramètres et sont des milliers de fois plus volumineux. La performance du robot ne s'améliorait pas de manière significative une fois que la taille du modèle atteignait environ un million de paramètres ; ajouter de la puissance de calcul au-delà de ce point produisait des rendements décroissants. À l'inverse, lorsque le modèle était réduit en dessous d'un quart de million de paramètres, la capacité du robot s'effondrait, particulièrement sur les tâches plus complexes et de longue durée. Cela suggère que pour cet ensemble spécifique de défis, le robot n'a pas besoin d'un cerveau géant ; il a seulement besoin d'un cerveau petit et efficace.

L'étude a également mis en lumière les parties du cerveau du robot qui comptent réellement. Les chercheurs ont testé différentes manières d'organiser le modèle et ont découvert que la ressource la plus critique était la partie qui traite l'information visuelle — les « yeux » du robot. S'ils retiraient trop de capacité au système visuel, le robot échouait, peu importe la puissance restante pour la partie planifiant les mouvements. Ils ont également découvert que les méthodes mathématiques complexes souvent utilisées pour générer des mouvements fluides et gracieux n'étaient pas nécessaires pour ce niveau de performance. Une méthode de calcul de mouvement plus simple et plus rapide fonctionnait tout aussi bien et permettait au robot de prendre des décisions en une fraction de seconde.

La découverte la plus frappante concerne la manière dont le robot comprend les instructions. Dans les modèles plus grands, le robot lit une phrase comme « ramasse la tasse » et tente de comprendre le sens des mots. Dans ce modèle minuscule, les chercheurs ont remplacé le langage par un simple code numérique. Lorsqu'ils ont brouillé ces codes afin que le robot reçoive le mauvais numéro pour une tâche, le taux de réussite du robot est tombé à près de zéro. Cela a prouvé que, sur ce benchmark spécifique, le robot ne « comprenait » pas vraiment le langage au sens général ; il mémorisait simplement quel motif visuel correspondait à quel code numérique. L'instruction n'était qu'une clé pour déverrouiller un comportement mémorisé spécifique.

Cette distinction a des implications profondes sur la façon dont les robots sont construits et utilisés. Les chercheurs ont montré que les taux de réussite élevés rapportés par les modèles géants sur ce benchmark sont largement une mesure de la capacité du robot à mémoriser les tâches spécifiques, plutôt que de sa capacité à généraliser à de nouvelles situations. Lorsqu'ils ont testé ces modèles minuscules contre des variations des tâches — comme un changement d'éclairage, de fond ou de forme des objets — le taux de réussite a chuté de manière spectaculaire, révélant que les modèles n'avaient pas appris la physique sous-jacente du monde, mais seulement l'apparence spécifique des tâches d'entraînement. Cependant, pour un robot déployé pour effectuer les mêmes quarante tâches chaque jour, cette mémorisation est exactement ce qui est nécessaire.

Le résultat pratique de cette recherche est une politique robotique incroyablement efficace. Le modèle de 0,54 million de paramètres peut fonctionner sur un ordinateur portable standard sans aucune carte graphique spécialisée, prenant des décisions en moins de dix millisecondes. C'est des centaines de fois plus rapide que les modèles de pointe actuels, qui prennent souvent des secondes pour planifier un seul mouvement. En prouvant qu'un modèle minuscule et spécialisé peut résoudre le benchmark standard, les chercheurs ont démontré que la voie vers des robots pratiques et abordables ne nécessite pas nécessairement la construction de cerveaux toujours plus grands. Il s'agit plutôt de trouver le cerveau le plus petit et le plus efficace adapté à la tâche spécifique, une découverte qui pourrait permettre de déployer des robots dans des foyers et des usines où l'espace, la puissance et le coût sont limités. L'étude ne prétend pas que ces petits modèles peuvent remplacer les systèmes à usage général nécessaires à l'exploration ouverte, mais elle établit fermement que pour un ensemble de tâches fixes, la capacité requise est bien moindre que ce qui était précédemment cru.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →