← Últimos artigos
💻 computer science

Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning

O artigo apresenta o CrossHA, um modelo agêntico unificado treinado por meio de um novo pipeline que combina ajuste fino supervisionado e Otimização de Política de Grupo Relativa de Múltiplos Turnos para selecionar e alternar autonomamente entre espaços de ação heterogêneos, alcançando assim o estado da arte em desempenho e adaptabilidade em tarefas dinâmicas de longo horizonte dentro do ambiente Minecraft.

Autores originais: Kaichen He, Zihao Wang, Muyao Li, Anji Liu, Yitao Liang

Publicado 2026-06-05
📖 4 min de leitura☕ Leitura rápida

Autores originais: Kaichen He, Zihao Wang, Muyao Li, Anji Liu, Yitao Liang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a jogar o videogame Minecraft. No passado, os pesquisadores tinham que construir "cérebros" separados para diferentes partes do jogo. Um cérebro era bom em caminhar (usando comandos simples, passo a passo), outro era bom em clicar em menus (usando movimentos precisos de mouse) e um terceiro era bom em usar atalhos de alto nível (como "ir até a árvore mais próxima").

O problema era que esses robôs eram rígidos. Se uma tarefa exigisse caminhar e depois clicar em um menu, o robô ficaria confuso ou travado porque foi treinado para usar apenas um tipo de "linguagem" por vez.

A Grande Ideia: O Agente "Canivete Suíço"
Este artigo apresenta o CrossHA, um novo tipo de agente de IA que age como um mestre cuca com uma cozinha completa. Em vez de ser forçado a usar apenas uma colher ou apenas uma faca, o CrossHA aprende a observar o ingrediente (a tarefa) e decide instantaneamente: "Eu preciso de um corte grosseiro (um movimento simples) ou de uma fatia fina (um clique preciso) agora?"

É o primeiro modelo que pode alternar perfeitamente entre diferentes "linguagens de ação" sobre a marcha, sem que um humano precise dizer qual usar em cada etapa.

Como Eles o Ensinaram (A Receita de Treinamento)

Os pesquisadores não apenas despejaram dados no modelo; eles usaram um pipeline de treinamento de três etapas, semelhante à forma como um humano aprende uma habilidade complexa:

  1. A Fase de "Degustação" (Ajuste Fino Supervisionado):
    Primeiro, eles mostraram ao modelo milhares de exemplos de pessoas jogando o jogo usando métodos diferentes (algumas caminhavam, outras clicavam, outras usavam atalhos). O objetivo aqui era apenas ensinar ao modelo o "vocabulário" de todos esses diferentes métodos para que ele pudesse entender todos eles. Era como ensinar um aluno a ler inglês, espanhol e francês, mas ainda não pedir para ele escrever uma história.

  2. A Fase de "Sprint" (RL de Turno Único):
    Em seguida, eles deram ao modelo desafios curtos de um passo. Se o modelo tentasse resolver um problema usando a "linguagem" errada (por exemplo, tentando atravessar uma porta trancada em vez de clicar na maçaneta), ele recebia uma pontuação baixa. Se escolhesse a ferramenta certa para o trabalho, recebia uma recompensa. Isso ensinou o modelo a fazer escolhas rápidas e inteligentes sobre qual ferramenta escolher para um único momento.

  3. A Fase de "Maratona" (RL de Múltiplos Turnos):
    Finalmente, eles deixaram o modelo jogar partidas completas e longas. O objetivo não era apenas acertar um passo, mas completar toda a missão de forma eficiente. O modelo aprendeu que, às vezes, usar um método "rápido, mas grosseiro" é melhor para caminhar por um campo, mas mudar para um método "lento, mas preciso" é necessário para fabricar um item delicado. Ele aprendeu a equilibrar velocidade e precisão ao longo de uma longa jornada.

Os Resultados: Por Que Isso Importa

Os pesquisadores testaram este modelo em mais de 800 tarefas diferentes no Minecraft, variando desde derrubar árvores até fabricar itens complexos e lutar contra monstros.

  • O Jeito Antigo: Robôs treinados para usar apenas um método (como apenas caminhar) eram ótimos em caminhar, mas péssimos em fabricar itens. Eles eram como uma pessoa que só sabe correr, mas não sabe abrir uma porta.
  • O Jeito CrossHA: O novo modelo foi o melhor em tudo. Ele não apenas empatou as pontuações; ele se destacou porque sabia exatamente quando mudar de marcha.

A Analogia do "Motorista Inteligente":
Imagine dirigir um carro.

  • Um robô de ação fixa é como um motorista que só sabe dirigir em uma rodovia. Se ele pegar uma estrada de terra, ele bate. Se entrar em um estacionamento, ele se perde.
  • O CrossHA é como um motorista habilidoso que sabe quando trocar para uma marcha alta para a rodovia (eficiência) e quando trocar para uma marcha baixa e dirigir com cuidado em uma vaga apertada (precisão). Ele não precisa de um copiloto para dizer quando trocar de marcha; ele simplesmente sente a estrada e se adapta.

A Conclusão

O artigo afirma que, ao treinar um único modelo para dominar todas essas diferentes "linguagens de ação" e permitir que ele aprendesse através de aprendizado por reforço (tentativa e erro com recompensas), eles criaram um agente significativamente mais inteligente, flexível e eficiente do que os modelos anteriores que estavam presos ao uso de apenas um tipo de ação.

Eles provaram isso mostrando que o modelo era capaz de lidar com mais de 800 desafios em um jogo de mundo aberto complexo, superando todos os outros métodos existentes. O código e os modelos estão agora abertos para que outros possam usar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →