← Últimos artigos
🤖 machine learning

Recursive Value Learning for Long-Horizon Offline Goal-Conditioned RL

O artigo propõe o DCRL (Divide-and-Conquer RL), um método recursivo de aprendizado por reforço offline condicionado a objetivos que decompõe trajetórias em árvores binárias balanceadas para reduzir a profundidade de bootstrap e o acúmulo de erro, superando substancialmente as linhas de base planas e hierárquicas existentes em tarefas de longo horizonte.

Autores originais: Hyeonseong Jeon, Youngwoon Lee

Publicado 2026-09-03
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Hyeonseong Jeon, Youngwoon Lee

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo da inteligência artificial, existe um desafio específico conhecido como aprendizado condicionado por objetivos. Imagine ensinar um robô não apenas a andar, mas a caminhar até uma cadeira específica, ou até uma porta específica, ou até um interruptor de luz específico, usando apenas uma biblioteca de vídeos passados de outros robôs se movendo. O robô deve observar essas gravações antigas, descobrir como ir do ponto A ao ponto B e, então, tentar fazer isso sozinho. Isso funciona bem para trajetos curtos. Se o objetivo estiver a apenas alguns passos de distância, o robô consegue facilmente ligar os pontos. Mas quando a jornada é longa — exigindo centenas ou milhares de passos para alcançar um destino distante — o robô costuma se perder. Ele tem dificuldade em lembrar o início do caminho enquanto tenta planejar o fim e, pequenos erros em sua memória de passos curtos acumulam-se em erros massivos quando ele chega ao objetivo.

Este problema torna-se ainda mais difícil quando o robô não pode aprender experimentando coisas no mundo real. Em muitos cenários do mundo real, como operar máquinas pesadas ou navegar em uma fábrica complexa, cometer erros é muito perigoso ou caro. O robô deve aprender inteiramente a partir de um conjunto de dados fixo de experiências passadas, um campo conhecido como aprendizado por reforço offline. Pesquisadores sabem há muito tempo que, para resolver uma jornada longa, você deve compreender os segmentos mais curtos que a compõem. No entanto, métodos padrão para ensinar robôs a partir desses conjuntos de dados estáticos geralmente tentam aprender a jornada inteira de uma só vez, ou saltam aleatoriamente entre segmentos curtos e longos. Essa abordagem é como tentar ler um livro folheando páginas aleatórias; o robô acaba adivinhando o significado de um capítulo longo com base em uma frase que ainda não compreendeu totalmente, levando à confusão e ao fracasso.

Uma equipe de pesquisadores da Universidade Yonsei e da Universidade Nacional de Seul propôs uma nova maneira de ensinar esses robôs, chamada DCRL. Em vez de adivinhar todo o caminho de uma vez, o método deles decompõe cada jornada longa em uma hierarquia estruturada e passo a passo, muito parecido com organizar uma grande tarefa primeiro dominando as menores partes e depois combinando-as. Os pesquisadores pegaram um caminho longo de um conjunto de dados e o dividiram exatamente ao meio, depois dividiram essas metades novamente ao meio, continuando este processo até chegarem a passos individuais. Eles então ensinaram o robô a entender esses movimentos minúsculos de um único passo. Uma vez que o robô estivesse confiante sobre esses pequenos passos, ele usaria esse conhecimento para entender os segmentos ligeiramente mais longos, e depois os segmentos mais longos, construindo seu entendimento do chão para cima. Essa estratégia de "dividir para conquistar" garante que o robô nunca tente aprender uma rota longa e complexa até que já tenha dominado as rotas mais curtas que a compõem.

Os pesquisadores descobriram que essa abordagem estruturada resolveu dois grandes problemas que atormentavam os métodos anteriores. Primeiro, impediu que o robô fizesse suposições otimistas. Métodos antigos frequentemente olhavam para muitos pontos intermediários possíveis e escolhiam aquele que parecia melhor, esperando por um atalho. Mas, como os dados eram limitados, o robô frequentemente escolhia um ponto que parecia bom apenas devido a um erro em sua memória e, então, construía todo o seu plano sobre esse erro. O novo método evita isso seguindo estritamente o caminho real mostrado nos dados, dividindo-o exatamente no meio e aprendendo o valor daquela rota específica sem fazer suposições. Segundo, ao utilizar uma estrutura equilibrada em forma de árvore, o método organiza o aprendizado de modo que a influência de qualquer erro individual seja contida dentro de sua respectiva hierarquia.

Ao serem testados em uma variedade de tarefas difíceis, incluindo navegar um robô humanoide gigante através de um labirinto e resolver quebra-cabeças complexos, este novo método superou todas as abordagens anteriores. Nas cinco tarefas de longo horizonte mais desafiadoras disponíveis em seu benchmark, o novo método melhorou a pontuação média de sucesso de 55 para 64, superando até mesmo sistemas hierárquicos mais complexos que eram anteriormente considerados o estado da arte. Em um teste específico envolvendo um robô humanoide em um labirinto enorme, o novo método alcançou uma taxa de sucesso de 93 por cento, enquanto o segundo melhor método atingiu apenas 79 por cento. Talvez o mais impressionante seja que, em uma tarefa envolvendo um cubo que exigia oito movimentos separados para ser resolvido, o novo método foi o único que conseguiu completar a tarefa, alcançando uma taxa de sucesso de 5 por cento enquanto todos os outros métodos falharam completamente. Além disso, nos testes do conjunto de dados CALVIN, o método demonstrou sua eficácia ao obter sucesso em quatro subtarefas consecutivas.

Os pesquisadores também observaram que a ordem em que o robô aprende é fundamental. Enquanto métodos anteriores utilizam o aprendizado em ordem embaralhada, o DCRL demonstra que a abordagem "de baixo para cima" é essencial para o sucesso. O estudo sugere que, ao respeitar a dependência natural das jornadas longas em relação aos passos curtos, e ao organizar o processo de aprendizado para refletir essa dependência, os robôs podem aprender a navegar por caminhos muito mais longos e complexos do que nunca antes. Este trabalho não oferece apenas um novo algoritmo; ele fornece uma compreensão mais clara de como escalar a inteligência artificial para lidar com as tarefas longas e intrincadas que definem o mundo real.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →