Test-Time Graph Search for Goal-Conditioned Reinforcement Learning
Este artigo apresenta a Busca em Grafo em Tempo de Teste (TTGS), um wrapper de planejamento leve e sem treinamento que aproveita a estrutura geométrica inerente de políticas existentes de RL condicionadas a objetivos offline para melhorar dramaticamente as taxas de sucesso em tarefas de longo horizonte, sem exigir supervisão adicional ou atualizações de parâmetros.