← Derniers articles
💻 computer science

SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

Cet article introduit les programmes SUN (Semantically UNified) et le système Kuafu, qui font le pont entre le contrôle basé sur des modèles et les politiques apprises en synthétisant automatiquement des exécutables typés et ancrés dans le langage qui unifient la vérification par MPC et l'entraînement par RL, permettant ainsi une manipulation robuste à long terme sans récompenses denses manuelles ni démonstrations humaines.

Auteurs originaux : Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

Publié 2026-09-01
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les robots sont depuis longtemps les maîtres des usines, répétant le même mouvement précis des milliers de fois sans erreur. Mais lorsqu'on leur demande d'accomplir une tâche complexe et multi-étapes dans un environnement domestique désordonné et imprévisible — comme ouvrir un tiroir, sortir une bouteille et la poser sur une table — ils trébuchent souvent. La difficulté réside dans le fait de combler le fossé entre deux manières différentes de conceir le mouvement. L'une repose sur des règles mathématiques rigides pour calculer chaque angle d'articulation et chaque force, garantissant que le robot ne s'écrase pas, mais cette méthode est fragile et échoue si le monde change légèrement. L'autre approche utilise l'apprentissage par essais et erreurs, où un robot s'exerce jusqu'à maîtriser une tâche, mais cela nécessite souvent des milliers d'heures de démonstration humaine ou des récompenses soigneusement élaborées qui sont difficiles à concevoir. Pendant des années, ces deux méthodes ont fonctionné dans des silos séparés, les planificateurs rigides étant incapables de s'adapter et les apprenants incapables de comprendre la logique profonde de la tâche.

Des chercheurs de l'Université de Californie à Los Angeles et leurs collègues ont introduit un nouveau système appelé Kuafu qui tente de tisser ensemble ces deux approches. Au lieu de traiter les instructions du robot comme un ensemble éphémère d'objectifs ou un script rigide, ils ont créé un programme typé persistant qui agit comme une source de vérité unique pour l'ensemble du processus. Ce programme, qu'ils appellent un programme « Sémantiquement Unifié » ou programme SUN, est écrit de manière à ce qu'un ordinateur puisse comprendre les relations physiques entre les objets, comme la direction dans laquelle une poignée de tiroir fait face ou la distance dont une bouteille doit être soulevée. Crucialement, ce même programme est utilisé pour vérifier les actions du robot, pour lui apprendre à bouger et pour générer les données nécessaires à son apprentissage à partir de zéro. En maintenant la signification centrale de la tâche constante, de la phase de planification initiale jusqu'à la phase finale d'apprentissage, le système empêche le robot de s'éloigner de ce qu'il était réellement censé faire.

Le système commence par prendre une instruction linguistique simple d'un humain, telle que « ouvre le tiroir et place la tasse à l'intérieur ». Un agent d'intelligence artificielle lit cette instruction et construit le programme SUN en sélectionnant des blocs de construction prédéfinis qui décrivent des actions physiques et des contraintes. Il teste ensuite ce programme dans une simulation à haute fidélité, en utilisant une méthode de contrôle sophistiquée pour voir si la tâche est physiquement possible. Si la simulation révèle que les instructions sont défectueuses ou impossibles à exécuter, le système répare automatiquement le programme avant tout apprentissage. Ce processus de filtrage est vital car il garantit que le robot n'est jamais sollicité pour apprendre une tâche qui ne peut pas être réalisée, éliminant ainsi les mauvaises idées avant qu'elles ne gaspillent du temps et de la puissance de calcul.

Une fois le programme validé, le système l'utilise pour générer des milliers d'exemples réussis du robot accomplissant la tâche. Ces exemples ne sont pas de simples mouvements aléatoires ; ils sont guidés par le programme persistant, qui suit chaque étape de la tâche, du moment où la pince touche la poignée au moment où le tiroir est complètement ouvert. Le robot apprend ensuite de ces exemples, d'abord en imitant les mouvements réussis, puis en les affinant par un processus d'essais et d'erreurs strictement encadré par le programme original. Cela garantit que, bien que le robot apprenne à être flexible et réactif, il ne perd jamais de vue l'objectif ultime. Le résultat est une politique capable d'exécuter des tâches complexes à plusieurs étapes avec un niveau de fiabilité que les méthodes précédentes ne pouvaient atteindre.

Dans une série de tests impliquant neuf différentes tâches de manipulation, allant de l'empilement de cubes au réorientation de bouteilles et à l'ouverture de tiroirs, le système a démontré une amélioration significative par rapport aux méthodes existantes. Alors que d'autres approches reposant sur des récompenses éparses ou une planification en ligne peinaient à réussir plus d'un tiers du temps, ce nouveau système a atteint un taux de réussite de plus de 82 pour cent. Les chercheurs ont constaté que le système était particulièrement efficace pour gérer des tâches nécessitant de nombreuses étapes, maintenant ses performances même lorsque la complexité de la séquence augmentait. De plus, les données générées par ce système étaient d'une telle qualité qu'elles ont permis à un modèle d'apprentissage visuel de réussir dans 46 pour cent des essais, un chiffre qui est plus du double du taux de réussite des modèles entraînés sur des données issues d'autres méthodes de génération.

Le véritable test de tout système robotique est de savoir s'il peut passer de la sécurité d'une simulation informatique au monde réel. Pour vérifier cela, les chercheurs ont déployé les politiques entraînées sur des robots physiques fabriqués par Franka et Kinova, utilisant des caméras pour guider les actions du robot sans aucune connaissance préalable de la structure spécifique de la tâche. Sans aucun ajustement supplémentaire ou pratique en conditions réelles, les robots ont réussi à compléter 34,7 pour cent des essais physiques à travers diverses configurations. Ce transfert « zero-shot », où un robot entraîné entièrement en simulation fonctionne immédiatement sur une machine réelle, suggère que le programme persistant a réussi à capturer la logique essentielle de la tâche, permettant au comportement appris de se généraliser au monde physique.

Les chercheurs reconnaissent que cette approche présente des limites. Elle repose actuellement sur une bibliothèque prédéfinie d'actions physiques et nécessite une compréhension claire des objets de la scène, ce qui signifie qu'elle ne peut pas encore gérer des objets déformables comme des tissus ou des fluides sans une nouvelle programmation importante. De plus, le système progresse à travers les tâches dans une seule direction et ne peut pas revenir en arrière si une erreur physique survient, ce qui limite sa capacité à se rétablir de certains types d'erreurs. Cependant, les résultats établissent un nouveau principe pour l'apprentissage robotique : le fait de maintenir la signification sémantique d'une tâche cohérente à travers la planification, la vérification et l'apprentissage crée une base robuste pour l'automatisation. En s'assurant que la compréhension de la tâche par le robot ne dévie pas, le système comble le fossé entre le contrôle rigide et l'apprentissage flexible, offrant une voie vers des robots capables d'accomplir des tâches complexes de manière fiable dans le monde réel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →