← Derniers articles
💻 computer science

Zetta ζ\zeta: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence

Le papier présente Zetta, un harnais incarné en boucle fermée qui permet une intelligence physique auto-évolutive en mettant à jour dynamiquement en ligne des critiques basés sur le code et des compétences de récupération, grâce à trois boucles séparées par des échelles de temps, atteignant des performances de pointe et des accélérations significatives de l'inférence sur des tâches de référence tout en démontrant un transfert zero-shot et des « Aha Moments » émergents.

Auteurs originaux : Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao

Publié 2026-08-18
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les robots sont capables depuis longtemps d'accomplir des tâches simples et répétitives dans les usines, mais leur donner la flexibilité nécessaire pour gérer la nature désordonnée et imprévisible d'un véritable foyer ou d'un atelier est resté l'un des défis les plus difficiles de l'intelligence artificielle. Pendant des années, les chercheurs ont tenté d'enseigner aux robots en les nourrissant de quantités massives de données vidéo, espérant que la machine apprendrait un ensemble d'instructions unique et parfait pour chaque situation possible. Cette approche, bien que puissante, échoue souvent lorsque le monde réel s'écarte même légèrement des vidéos d'entraînement ; un léger glissement d'une pince ou un changement de luminosité peut provoquer le gel ou le crash du robot. Une voie alternative a émergé, traitant les robots non pas comme des programmes statiques, mais comme des agents capables de réfléchir, de planifier et d'utiliser des outils. Cependant, même ces agents plus intelligents ont eu du mal à apprendre de leurs propres erreurs en temps réel. La plupart des systèmes fonctionnent en boucle : ils tentent une tâche, échouent, puis ne réfléchissent sur ce qui s'est mal passé qu'une fois la tentative entière terminée. Au moment où ils analysent l'erreur, le moment de la corriger est déjà passé, et l'interaction physique est déjà rompue.

Une équipe de chercheurs de l'Université Tsinghua et de Z-Trans AI a introduit un nouveau système appelé Zetta, qui change la façon dont les robots apprennent en comblant le fossé entre la pensée et l'action. Au lieu d'attendre la fin d'une tâche pour apprendre, Zetta permet à un robot de surveiller son propre état physique de manière continue pendant qu'il se déplace, détectant les erreurs dès qu'elles se produisent et les corrigeant immédiatement. Le système ne cherche pas à réentraîner le cerveau central du robot, qui reste fixe et stable. Au lieu de cela, il construit une couche de « critiques d'exécution » (runtime critics) — de petits moniteurs spécialisés qui surveillent les mains du robot et les objets qu'il touche. Si un critique remarque qu'une prise glisse ou qu'un objet est sur le point de tomber, il déclenche une compétence de récupération préprogrammée pour sauver la situation avant que le robot ne perde le contrôle. Cela crée une boucle d'auto-évolution où le robot s'améliore dans une tâche spécifique à mesure qu'il l'essaie, non pas en changeant sa compréhension fondamentale du monde, mais en accumulant une bibliothèque de méthodes éprouvées pour gérer les défaillances physiques.

Les chercheurs ont testé cette approche sur deux bancs d'essai majeurs pour la manipulation robotique : un ensemble de tâches impliquant le déplacement d'objets entre différents lieux et un ensemble plus complexe de tâches ménagères comme ouvrir des tiroirs ou allumer des appareils. Dans ces simulations, le système a débuté avec une politique de robot de base qui avait un taux de réussite d'environ 35 % sur les tâches les plus difficiles. À mesure que le système effectuait des milliers d'essais, il a commencé à identifier les moments précis où les choses tournaient mal. Il a regroupé ces échecs, a déterminé la cause profonde et a écrit un nouveau code pour les corriger. En seulement quelques cycles d'auto-correction, le taux de réussite sur les tâches difficiles a bondi à plus de 90 %. Le système n'a pas seulement eu de la chance ; il a démontré un schéma clair d'amélioration où il peinait pendant un certain temps, puis découvrait soudainement un principe physique clé — comme la nécessité de stabiliser une prise avant de soulever l'objet — et ses performances bondissaient. Les chercheurs appellent ces percées soudaines des « moments aha », où le robot comprend enfin la contrainte physique qui lui manquait.

Ce qui rend cette découverte particulièrement significative est que les compétences apprises par le robot n'étaient pas liées à un objet spécifique ou à une pièce spécifique. Lorsque les chercheurs ont appliqué les compétences que le robot avait apprises pour manipuler une bouteille de vin dans une tâche à une tâche complètement différente impliquant un contenant de fromage à la crème, le robot a réussi sans nouvel entraînement. Le système avait appris des principes généraux sur la façon de tenir, de déplacer et de placer des objets qui fonctionnaient à travers différents scénarios. Cela suggère que le robot n'était pas simplement en train de mémoriser un chemin vers un but, mais qu'il apprenait une compréhension plus profonde de la manière d'interagir avec le monde physique. Le système s'est également avéré incroyablement rapide, faisant tourner des simulations sur un cluster d'ordinateurs pour générer l'expérience nécessaire à l'apprentissage. En découplant la logique du robot du matériel exécutant la simulation, les chercheurs ont pu faire tourner le processus d'apprentissage plus de vingt fois plus vite que les méthodes précédentes, permettant au robot de faire évoluer ses compétences en quelques heures plutôt qu'en plusieurs jours.

Les chercheurs soutiennent que cette approche résout un problème fondamental de la robotique : l'incapacité des modèles actuels à réagir aux changements rapides du monde physique. Les grands modèles d'intelligence artificielle sont trop lents pour prendre des décisions à la vitesse requise pour rattraper un objet qui tombe ou ajuster une prise qui glisse. En gardant le cerveau principal figé et en ajoutant une couche réactive et rapide de critiques et de compétences de récupération, Zetta comble le fossé entre la planification de haut niveau et le contrôle physique de bas niveau. Le système a prouvé qu'il pouvait gérer des séquences d'actions complexes et longues, comme naviguer dans une cuisine, ouvrir un placard et placer un article à l'intérieur, en décomposant la tâche en étapes gérables et en ayant un filet de sécurité prêt pour chaque défaillance potentielle. Dans une étude de cas, un robot tentant de déplacer une bouteille vers un bol a initialement échoué de manière répétée car il la faisait tomber pendant le transport. Après quelques cycles d'auto-correction, le système a ajouté une vérification spécifique pour s'assurer que la prise était sûre avant de bouger, et le taux de réussite pour cette tâche est passé de 15 % à 95 %.

Le travail souligne également l'importance de l'infrastructure pour rendre ce type d'apprentissage possible. Pour faire évoluer les compétences d'un robot, le système doit effectuer des milliers d'essais pour trouver les rares moments où il échoue et analyser ces échecs. Les chercheurs ont construit un système spécialisé pour gérer cette charge de travail, leur permettant de lancer de nombreuses simulations simultanément sans ralentir. Cette infrastructure a été cruciale pour la vitesse du projet, permettant à l'équipe de collecter les données nécessaires pour entraîner les critiques et les compétences de récupération efficacement. Sans cette capacité à passer à l'échelle le processus d'apprentissage, la boucle d'auto-évolution aurait été trop lente pour être pratique. Les résultats suggèrent une nouvelle voie pour l'intelligence physique, une voie où les robots n'ont pas besoin d'être parfaits dès le départ, mais peuvent apprendre à être fiables par l'expérience, en affinant constamment leur capacité à gérer l'imprévu.

Les implications de cette recherche s'étendent au-delà de la simple amélioration de la capacité des robots à déplacer des objets. Elle offre un modèle de la manière dont l'intelligence artificielle peut interagir avec le monde physique de manière robuste et adaptable. En se concentrant sur la capacité à détecter et à se remettre des erreurs en temps réel, le système évite la fragilité qui a entravé les approches précédentes. Les chercheurs notent que, bien que leur travail actuel ait été mené en simulation, les principes qu'ils ont développés sont conçus pour être transférés à des robots réels. La prochaine étape pour l'équipe est de prendre ce harnais d'auto-évolution et de le tester sur des machines physiques, comblant ainsi le fossé entre la simulation numérique et le monde réel. Si elle réussit, cela pourrait mener à des robots qui ne sont pas seulement programmés pour accomplir une tâche, mais qui sont capables d'apprendre et d'améliorer leurs performances à chaque tentative, les rendant plus utiles et plus fiables dans les environnements humains.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →