← Últimos artigos
🤖 machine learning

HERAKLES: Hierarchical Skill Compilation for Open-ended LLM Agents

HERAKLES é um agente hierárquico que combina uma política de LLM de alto nível para selecionar submetas alcançáveis com um controlador de baixo nível que compila comportamentos bem-sucedidos em habilidades reutilizáveis, permitindo a exploração aberta e eficiente e a composição de habilidades em ambientes parcialmente observáveis com recompensas esparsas.

Autores originais: Thomas Carta, Clément Romac, Loris Gaven, Pierre-Yves Oudeyer, Olivier Sigaud, Sylvain Lamprier

Publicado 2026-07-22
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Thomas Carta, Clément Romac, Loris Gaven, Pierre-Yves Oudeyer, Olivier Sigaud, Sylvain Lamprier

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Busca pelo Robô Autodidata

Imagine um mundo onde os computadores não apenas seguem uma receita rígida escrita por um humano, mas em vez disso aprendem a cozinhar, construir e explorar por conta própria, tornando-se mais inteligentes a cada dia. Este é o sonho do "aprendizado de ponta aberta" (open-ended learning) na inteligência artificial. Por muito tempo, a IA tem sido como um aluno que memoriza um livro didático gigante, mas trava quando recebe uma pergunta que não está no livro. Os seres humanos reais, no entanto, são diferentes. Nós não apenas memorizamos; nós construímos uma biblioteca de habilidades. Quando aprendemos a andar de bicicleta, não aprendemos apenas a equilibrar; aprendemos a pedalar, esterçar e frear como ferramentas separadas que podemos misturar e combinar mais tarde para aprender a andar de motocicleta.

O artigo que você está prestes a ler aborda um problema específico neste campo: como ensinamos um agente de IA a continuar aprendendo para sempre sem ficar estagnado? A ideia central é o "aprendizado hierárquico". Pense nisso como uma empresa com um chefe e um trabalhador. O chefe (o cérebro de alto nível) não faz o trabalho pesado; em vez disso, ele divide grandes e assustadores projetos em tarefas menores e gerenciáveis para o trabalhador (o cérebro de baixo nível). O trabalhador realiza as tarefas e, uma vez que se torne muito bom nelas, essas tarefas tornam-se "habilidades" que o chefe pode simplesmente ordenar com uma única palavra. O artigo explora como construir um robô que possa fazer isso automaticamente, transformando um caos de novos desafios em uma caixa de ferramentas de habilidades organizada e nítida.


A História do HERAKLES: O Robô Que Constrói Sua Própria Caixa de Ferramentas

Conheça o HERAKLES, um novo tipo de cérebro robótico projetado para ser um aprendiz vitalício. Imagine que você é um jovem aventureiro tentando conquistar uma floresta vasta e misteriosa. No início, você só sabe dar um passo de cada vez. Se quiser alcançar uma montanha distante, terá que descobrir cada passo do zero, o que é exaustivo e lento. Você pode se cansar e desistir antes mesmo de chegar à primeira colina.

O HERAKLES resolve isso agindo como uma equipe inteligente com dois papéis distintos. O primeiro papel é o General (a política de alto nível), que é uma IA muito inteligente e versada em linguagem. O segundo papel é o Soldado (a política de baixo nível), que é um robô rápido e eficiente que realmente move o corpo e pega itens.

Aqui está como a mágica acontece:

1. O General Planeja, O Soldado Executa
Quando o General vê um grande objetivo como "Construir uma Picareta de Pedra", ele não tenta fazer tudo de uma vez. Em vez disso, ele observa o que o Soldado já consegue fazer. Talvez o Soldado saiba como "cortar madeira" e "colocar uma mesa". O General divide o grande objetivo: "Primeiro, corte a madeira. Depois, coloque uma mesa. Finalmente, fabrique a picareta". O General dá essas ordens menores ao Soldado.

2. O Truque da "Compilação de Habilidades"
É aqui que o HERAKLES fica realmente esperto. Toda vez que o Soldado termina com sucesso uma tarefa, como "cortar madeira", o General não apenas a esquece. Eles pegam toda essa sequência de movimentos e a "compilam" em uma habilidade única e reutilizável. É como se o Soldado aprendesse a andar de bicicleta e, de repente, o General pudesse apenas dizer "Vá para o rio" em vez de dizer "Pedale, esterce, equilibre, pedale, esterce..."

À medida que o robô aprende mais, sua caixa de ferramentas de habilidades cresce. O General começa a ter acesso a "opções" cada vez maiores. Em vez de dar 100 passos minúsculos para construir uma casa, o General pode apenas dizer "Construir uma parede" (uma habilidade que o Soldado já dominou) e "Construir um telhado" (outra habilidade dominada). Isso torna o robô muito mais rápido e eficiente.

3. O Filtro de Segurança
O General é inteligente o suficiente para saber o que o Soldado ainda não consegue fazer. Se o Soldado ainda não aprendeu a "fazer fogo", o General não pedirá que ele o faça, pois isso levaria apenas ao fracasso e à confusão. O sistema usa um "verificador de competência" especial para oferecer ao General apenas objetivos nos quais o Soldado tenha boas chances de sucesso. Isso mantém o processo de aprendizado fluido e evita que o robô fique travado em tarefas impossíveis.

O Que Eles Descobriram

Os pesquisadores testaram o HERAKLES em um mundo digital chamado Crafter, que é uma versão 2D de Minecraft onde você precisa coletar recursos e fabricar itens para sobreviver. O objetivo era ver se o HERAKLES conseguiria aprender tarefas cada vez mais difíceis ao longo do tempo sem precisar que um humano o ensinasse cada passo.

Eles compararam o HERAKLES com outros métodos de IA:

  • O Robô "Faz-Tudo": Um robô que tenta aprender cada passo minúsculo do zero todas as vezes. Este robô estagnou rapidamente porque tarefas complexas demoravam muito para serem aprendidas.
  • O Robô de "Cérebro Congelado": Um robô que usa um cérebro inteligente, mas mantém suas habilidades físicas fixas, nunca aprendendo novos truques físicos.
  • O Robô de "Código Oculto": Um robô que tenta aprender habilidades, mas usa um código secreto em vez de linguagem clara, tornando difícil combinar habilidades logicamente.

Os Resultados:
O HERAKLES foi o vencedor claro a longo prazo. Enquanto os outros robôs ficaram estagnados após aprender algumas tarefas fáceis (como apenas caminhar até uma árvore), o HERAKLES continuou melhorando. Ao final do treinamento (após 250.000 passos no jogo), o HERAKLES havia aprendido a fabricar itens complexos como uma picareta de pedra, enquanto os outros ainda lutavam com tarefas básicas.

O artigo sugere que o HERAKLES é muito melhor em "eficiência de amostragem", o que significa que aprende mais com menos tentativas. Ele também mostrou uma flexibilidade incrível. Quando os pesquisadores pediram ao HERAKLES para fazer coisas que ele nunca tinha visto antes, como "coletar 4 madeiras" em vez de apenas "coletar madeira", ou usar um sinônimo como "adquirir madeira" em vez de "coletar madeira", ele teve sucesso quase todas as vezes. Ele conseguiu até descobrir como fazer uma "espada de madeira" apenas percebendo que era muito semelhante à "picareta de madeira" que ele já havia aprendido a fazer.

Por Que Isso Importa

Os autores sugerem que este método é um grande passo para a criação de IAs que podem realmente crescer e se adaptar por conta própria. Ao permitir que a IA construa sua própria biblioteca de habilidades e depois use essas habilidades para enfrentar desafios ainda maiores, o HERAKLES evita a sensação de "estar travado" que assola muitos outros sistemas de aprendizado.

No entanto, o artigo também admite que existem limites. No momento, o General entende apenas texto, não imagens, portanto não pode ver o mundo diretamente. Além disso, o sistema precisa de uma lista de objetivos para começar; ele ainda não inventa os próprios objetivos. Mas a ideia de um robô que pode "compilar" suas próprias experiências em novas habilidades reutilizáveis é um conceito poderoso. Sugere um futuro onde agentes de IA não apenas memorizam o passado, mas constroem ativamente uma base para um futuro infinito de aprendizado.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →