← Derniers articles
💻 computer science

PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration

PhysCaP est un nouvel agent qui améliore la manipulation robotique en intégrant une couche d'exploration informée par la physique et sans entraînement préalable dans les cadres de type « code-as-policy », permettant une recherche d'informations efficace et ciblée pour inférer des propriétés latentes d'objets telles que la masse et la rigidité grâce à un système de planification et de hiérarchisation à double agent.

Auteurs originaux : Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang, Chi-Pin Huang, Fu-En Yang, Min-Hung Chen, Yi-Ting Chen, Yu-Chiang Frank Wang, Shao-Hua Sun

Publié 2026-08-24
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang, Chi-Pin Huang, Fu-En Yang, Min-Hung Chen, Yi-Ting Chen, Yu-Chiang Frank Wang, Shao-Hua Sun

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les robots sont depuis longtemps les maîtres du monde visible. Si une tâche consiste à déplacer une tasse d'une table vers un évier, un robot moderne peut souvent voir la tasse, planifier un trajet et exécuter le mouvement avec une grâce impressionnante. Ce succès repose sur des politiques de vision-langage-action, des systèmes qui apprennent en observant les humains accomplir des tâches, puis en imitant ces mouvements. Cependant, ces systèmes opèrent avec une limite fondamentale : ils ne voient que ce qui est en surface. Ils ne peuvent pas ressentir le poids d'une canette pour savoir si elle est vide, ni sentir la fermeté d'un fruit pour savoir s'il est mûr. Dans le monde réel, de nombreuses tâches dépendent de ces propriétés physiques cachées. Un humain nettoyant une cuisine pourrait secouer une canette de soda pour entendre si elle est vide ou presser un avocat pour vérifier sa maturité, utilisant le toucher et le son pour combler les lacunes laissées par la vision. Sans cette capacité à rechercher activement des informations cachées, un robot reste aveugle aux détails mêmes qui déterminent si une tâche réussit ou échoue.

Des chercheurs de l'Université nationale de Taïwan et de NVIDIA ont développé une nouvelle approche pour combler ce fossé, créant un système qu'ils appellent PhysCaP. Ce système apprend au robot à agir comme un humain curieux, combinant la capacité de rédiger ses propres instructions avec une nouvelle capacité d'exploration physique. Au lieu de simplement regarder et copier, le robot est conçu pour poser des questions au monde physique. Face à une table d'objets où la réponse est cachée, le robot ne devine pas. Il décide d'interagir, soulevant ou pressant des objets pour recueillir les données spécifiques dont il a besoin. Le système est construit sur un cadre de « code-en-tant-que-politique » (code-as-policy), ce qui signifie que le robot génère du code informatique exécutable pour contrôler ses mouvements, lui permettant de raisonner à travers des étapes complexes, tout comme un humain planifiant une séquence d'actions. Ce qui rend PhysCaP unique est l'ajout d'une couche d'exploration informée par la physique. Cette couche permet au robot d'estimer des propriétés telles que la masse et la rigidité en utilisant uniquement le retour d'information de ses propres moteurs et articulations, sans avoir besoin de capteurs spéciaux comme une peau sensible au toucher ou des balances.

Le cœur de ce nouveau système est une conception à double agent qui gère l'équilibre délicat entre agir trop tôt et gaspiller du temps. Un agent, le Planificateur, observe la scène et décide si le robot dispose d'assez d'informations pour terminer le travail. Si l'information manque, le Planificateur crée une liste d'actions potentielles pour la trouver. Un second agent, le Priorisateur, examine ensuite cette liste et classe les actions en fonction d'indices visuels. Par exemple, si la tâche est de trouver une canette de soda vide parmi quatre, le Priorisateur remarque que deux canettes sont scellées et que deux autres ont des pailles qui dépassent. Il en déduit logiquement que les canettes scellées sont probablement pleines et donne la priorité à la vérification des canettes ouvertes en premier. Cela empêche le robot de gaspiller de l'énergie sur des objets peu susceptibles de détenir la réponse. Une fois que le robot a recueilli suffisamment de preuves, le système cesse l'exploration et exécute la tâche finale.

Pour tester cette idée, les chercheurs ont mis en place trois défis distincts sur une table réelle. Dans une tâche, un cube bleu était caché sous l'une de trois tasses, mais une tasse était trop petite pour contenir le cube. Un robot s'appuyant uniquement sur la vision aurait soulevé chaque tasse, mais PhysCaP a utilisé son raisonnement pour voir la différence de taille et a sauté la tasse impossible, ne soulevant que les candidats viables. Dans une autre tâche, le robot devait trouver une seule canette de soda vide parmi quatre. En utilisant sa capacité à mesurer le poids via le retour moteur, il a réussi à identifier la canette vide. Dans la troisième tâche, il devait choisir un avocat mûr parmi un groupe de fruits verts et sombres. En pressant les avocats sombres pour mesurer leur fermeté, il a sélectionné l'avocat mûr tout en ignorant le fruit dur et non mûr. Dans tous ces scénarios, le système a réussi là où les autres méthodes ont échoué. Les robots qui ne reposaient que sur la vision ne pouvaient pas résoudre les tâches car ils ne pouvaient pas voir les propriétés cachées. Les robots qui pouvaient mesurer les propriétés mais manquaient de raisonnement pour les prioriser finissaient par vérifier chaque objet, prenant beaucoup plus de temps et utilisant plus d'énergie.

Les résultats ont montré que PhysCaP pouvait accomplir ces tâches avec des taux de réussite élevés tout en interagissant avec beaucoup moins d'objets que ses concurrents. Lors des tests en conditions réelles, le système a trouvé le cube caché, la canette vide et l'avocat mûr avec nettement moins de contacts physiques et en moins de temps que les systèmes qui vérifiaient tout indistinctement. Les chercheurs ont également mené des simulations pour voir comment le système se comporterait dans un environnement numérique, et les résultats se sont confirmés : le système capable de raisonner sur ce qu'il faut mesurer et quand s'arrêter a surpassé les modèles qui tentaient simplement de deviner ou de tout vérifier. L'étude confirme que pour que les robots puissent véritablement opérer dans le monde réel, désordonné et imprévisible, ils doivent être capables de rechercher activement les vérités physiques que la vision seule ne peut révéler. En donnant aux robots la capacité de poser les bonnes questions et d'écouter les réponses que le monde physique fournit, cette recherche nous rapproche de machines capables de gérer les subtilités et les complexités tactiles de la vie humaine.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →