SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation
L'article introduit SeeQ, un cadre qui entraîne des fonctions de valeur généralistes en prédisant de manière autorégressive des sous-tâches actives en langage naturel afin de surmonter les horizons d'assignation de crédit longs et d'améliorer le pilotage de politique sur des tâches de manipulation robotique complexes à long horizon utilisant des données hors ligne.
Article original placé dans le domaine public sous CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé technique : SeeQ : Entraînement de fonctions de valeur généralistes pour la manipulation robotique à long horizon
Énoncé du problème
Les politiques robotiques généralistes, souvent entraînées par apprentissage par imitation, peinent face aux tâches de manipulation complexes à long horizon. Ces tâches impliquent fréquemment plusieurs étapes ou nécessitent des tentatives répétées et une délibération sur des étapes spécifiques avant de réussir. Dans de tels contextes, les erreurs se cumulent au fil du temps et les comportements de récupération sont sous-représentés dans les jeux de données experts. Bien que les fonctions de valeur Q offrent un mécanisme pour orienter les politiques en classant les actions candidates, leur apprentissage pour les tâches à long horizon est difficile. Les approches standard se heurtent à trois obstacles majeurs :
- Horizons d'attribution de crédit longs : L'apprentissage à partir de récompenses au niveau de la tâche (succès/échec à la toute fin) nécessite de propager des signaux sur de longues séquences, ce qui rend les mises à jour de Bellman difficiles.
- Couverture des données : Les jeux de données hors ligne manquent souvent d'une couverture suffisante des paires état-action diverses rencontrées lors de trajectoires longues, rendant l'apprentissage par différence temporelle (TD) peu fiable.
- Fragilité : Sans un apprentissage de la valeur efficace, les politiques ne peuvent pas distinguer les actions qui progressent de celles menant à l'échec, particulièrement dans les tâches exigeant une grande précision ou comportant plusieurs étapes.
Les méthodes existantes soit évitent l'apprentissage TD (en utilisant des retours de type Monte Carlo, ce qui limite l'amélioration de la politique au-delà de la distribution des données), soit reposent sur un apprentissage TD sur l'horizon complet de la tâche, ce qui souffre de l'accumulation d'erreurs.
Méthodologie : SeeQ (Fonctions Q elicitées par sous-tâches)
Les auteurs proposent SeeQ, un cadre pour entraîner des fonctions de valeur Q généralistes qui raccourcissent l'horizon d'apprentissage en se concentrant sur la sous-tâche actuellement active plutôt que sur l'ensemble de la tâche.
Architecture de base et entraînement
SeeQ utilise un squelette de Modèle de Vision-Langage (VLM) pré-entraîné (spécifiquement un modèle PaliGemma de 3B) et introduit un processus d'entraînement en deux étapes :
- Pré-entraînement généraliste : Le modèle est pré-entraîné sur divers jeux de données de manipulation robotique en open-source (ex. : RoboCOIN) contenant des annotations de sous-tâches. Cette étape régularise la compréhension par le modèle de la progression de la tâche et du conditionnement de l'action à travers diverses formes physiques (embodiments).
- Finetuning en aval : Le modèle est affiné sur des tâches cibles spécifiques.
Innovations techniques clés
- Prédiction de valeur au niveau de la sous-tâche : Au lieu de prédire le retour vers l'achèvement final de la tâche, la fonction Q estime le retour attendu pour la sous-tâche active (). Cela réduit l'horizon de prédiction, rendant l'apprentissage TD plus stable et efficace.
- Décodage autorégressif de la sous-tâche : Pour éliminer le besoin d'annotations humaines ou de prédicteurs de sous-tâches externes lors du test, l'architecture de la fonction Q est modifiée pour prédire de manière autorégressive la sous-tâche active en langage naturel avant d'estimer sa valeur.
- Pendant l'entraînement, le modèle est supervisé par une perte de prédiction du jeton suivant sur les annotations de sous-tâches réelles.
- Lors de l'inférence, le modèle génère le texte de la sous-tâche () basé sur l'état actuel et l'instruction de la tâche, puis conditionne la prédiction de la valeur sur ce texte généré.
- Apprentissage TD-BoN (Temporal-Difference with Best-of-N) : L'objectif d'entraînement combine l'apprentissage TD au niveau de la sous-tâche avec une stratégie de mise à jour "Best-of-N".
- Des blocs d'actions candidats sont échantillonnés à partir d'une politique de base ().
- La valeur cible est calculée en utilisant le bloc d'actions ayant la valeur estimée la plus élevée parmi les candidats.
- Cette approche aligne la mise à jour d'entraînement avec la procédure d'orientation au moment du test et permet à la fonction Q d'évaluer des actions meilleures que celles observées dans le jeu de données.
- Pas de bootstrapping à travers les frontières : La cible TD ne réalise pas de bootstrapping à travers les frontières de sous-tâches. Si une sous-tâche se termine à l'intérieur de l'horizon du bloc d'actions, le terme de mise à jour est annulé, garantissant que la fonction de valeur reflète strictement la progression de la sous-tâche actuelle.
La fonction de perte totale combine la perte TD pour la valeur de la sous-tâche et la perte de prédiction du jeton suivant pour le texte de la sous-tâche :
Inférence au moment du test
Au déploiement, SeeQ oriente une politique de base () via une sélection Best-of-N :
- Étant donné un état et une instruction de tâche , le modèle prédit de manière autorégressive la sous-tâche active .
- La politique de base propose blocs d'actions candidats.
- La fonction Q évalue chaque bloc en le conditionnant sur , , et la sous-tâche prédite.
- Le bloc d'actions ayant le score le plus élevé est exécuté.
Contributions clés
- Formulation au niveau de la sous-tâche : L'article introduit une méthode pour reformuler l'apprentissage de valeur à long horizon en un apprentissage à court horizon au niveau de la sous-tâche, contournant efficacement les défis des récompenses éparses sur de longs horizons.
- Inférence de sous-tâche conditionnée par le langage : Une architecture novatrice qui prédit explicitement la sous-tâche active en langage naturel, supprimant le besoin de systèmes de prédiction de sous-tâches modulaires ou d'annotations humaines lors du test.
- Stratégie de pré-entraînement généraliste : Démontre que le pré-entraînement d'un squelette VLM sur des données robotiques diverses est crucial pour apprendre un conditionnement d'action robuste et réduire le surapprentissage de caractéristiques d'image spécifiques lors du finetuning en aval.
- Validation empirique : Évaluation étendue sur quatre tâches de manipulation bimanuelle réelle (suspendre une chemise, sceller un couvercle, emballer des courses, démonter des Lego) sur deux plateformes robotiques.
Résultats
Les auteurs ont évalué SeeQ sur quatre tâches réelles impliquant des objets déformables, un alignement précis et une coordination multi-étapes.
- Performance de l'orientation de la politique : SeeQ a considérablement amélioré les taux de réussite des politiques de base sur toutes les tâches.
- Suspension de chemise : Amélioration de 10/24 (41,7 %) à 22/24 (91,7 %).
- Scellage de couvercle : Amélioration de 10/24 (41,7 %) à 15/24 (62,5 %).
- Emballage de courses : Amélioration de 9/24 (37,5 %) à 17/24 (70,8 %).
- Démontage de Lego : Amélioration de 5/24 (20,8 %) à 10/24 (41,7 %).
- Globalement, le taux de réussite moyen est passé de 35,4 % à 66,7 % (une amélioration de 1,88x).
- Études d'ablation :
- Pré-entraînement : Supprimer le pré-entraînement sur les données robotiques a provoqué une chute significative des performances (de 22/24 à 8/24 sur la suspension de chemise), soulignant la nécessité de données diverses pour la généralisation.
- Conditionnement de sous-tâche : Le décodage explicite et le conditionnement sur la sous-tâche étaient critiques. Supprimer la prédiction de sous-tâche a conduit à une performance inférieure à la politique de base (8/24), tandis que l'ajout de la prédiction sans le conditionnement l'a améliorée à 15/24. Le SeeQ complet a atteint 22/24.
- Comparaison avec les baselines : SeeQ a surpassé la régression de Monte Carlo au niveau de la tâche, l'apprentissage TD au niveau de la tâche et le SARSA au niveau de la sous-tâche (qui utilise les actions du jeu de données pour les mises à jour plutôt que l'échantillonnage Best-of-N).
Signification et affirmations
L'article affirme que les valeurs au niveau de la sous-tâche fournissent une cible d'apprentissage plus efficace que les signaux de succès éparses à long horizon lors de l'entraînement de fonctions Q généralistes. En exploitant la décomposition naturelle des tâches de manipulation en jalons intermédiaires, SeeQ permet un apprentissage TD efficace sans l'accumulation d'erreurs typiquement associée aux longs horizons.
Les auteurs soulignent que leur approche permet un apprentissage de valeur généraliste qui peut être appliqué à de nouvelles tâches avec un finetuning minimal, à condition que les tâches puissent être décomposées en sous-tâches. L'utilisation explicite du langage pour prédire les sous-tâches aligne l'estimation de la valeur avec les capacités de génération de texte du VLM, améliorant la robustesse près des transitions de sous-tâches.
Le travail suggère que la combinaison d'objectifs d'apprentissage à court horizon et d'une inférence structurée par le langage est une voie viable vers une manipulation robotique à long horizon plus robuste, notamment en exploitant le pré-entraînement à grande échelle sur des données robotiques diverses. Les auteurs reconnaissent des limites, telles que l'ambiguïté des frontières de sous-tâches et la dépendance à la qualité des actions candidates de la politique de base, mais posent leur cadre comme une étape importante pour rendre les fonctions de valeur pratiques pour la robotique complexe du monde réel.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.