Test-Time Graph Search for Goal-Conditioned Reinforcement Learning
Ce papier introduit la recherche de graphe au moment du test (TTGS), un wrapper de planification léger et sans entraînement qui exploite la structure géométrique inhérente des politiques existantes d'apprentissage par renforcement conditionnées par un objectif hors ligne pour améliorer considérablement les taux de réussite sur des tâches à long horizon sans nécessiter de supervision supplémentaire ni de mises à jour de paramètres.