← Últimos artigos
🤖 AI

Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models

O Z-1 é um framework de pós-treinamento de aprendizagem por reforço que utiliza a Otimização de Política Relativa de Grupo (GRPO) em demonstrações publicamente disponíveis do RoboCasa para aumentar significativamente o desempenho e as taxas de sucesso de modelos de Visão-Linguagem-Ação baseados em fluxo sem exigir dados privados adicionais.

Autores originais: Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

Publicado 2026-07-01
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a cozinhar uma refeição complexa, como fazer café ou abrir uma gaveta difícil.

O Problema: O Robô "Copiador"
Até agora, a maioria dos treinadores de robôs usava um método chamado "Clonagem de Comportamento". Pense nisso como um aluno que aprende apenas assistindo aos vídeos perfeitos de um professor. O robô observa o professor ter sucesso e tenta copiar cada movimento exatamente.

  • A Falha: Se o aluno comete um erro minúsculo (como alcançar uma maçaneta um milímetro longe demais), o vídeo não mostra como corrigi-lo. O robô fica travado, não sabe como se recuperar e falha. Ele não consegue aprender com seus próprios erros porque nunca foi permitido cometê-los durante o treinamento.

A Solução: Z-1 (O Treinador de "Tentativa e Erro")
O artigo apresenta o Z-1, um novo sistema de treinamento que permite ao robô aprender fazendo, errando e tentando novamente. É como um treinador que deixa o aluno praticar na cozinha, errar e, depois, dá um feedback específico sobre como fazer melhor na próxima vez.

Veja como o Z-1 funciona, usando analogias simples:

1. O Ponto de Partida (SFT)

Primeiro, o robô recebe um "curso intensivo" assistindo a vídeos públicos de humanos realizando tarefas (como abrir portas ou usar uma pia). Isso dá a ele uma ideia básica do que fazer, semelhante a ler uma receita antes de cozinhar.

2. A "Prática em Grupo" (GRPO)

Em vez de deixar o robô praticar sozinho, o Z-1 usa um método chamado Otimização de Política Relativa de Grupo (GRPO).

  • A Analogia: Imagine um treinador enviando 8 alunos para a cozinha para fazer café ao mesmo tempo.
  • O Objetivo: O treinador não diz apenas "Bom trabalho" ou "Mau trabalho". Em vez disso, o treinador compara os 8 alunos entre si. Se 7 alunos derramarem o café, mas 1 aluno acertar, o treinador diz ao aluno bem-sucedido: "Você fez de forma diferente; continue fazendo o que fez". Isso ajuda o robô a descobrir exatamente qual movimento minúsculo fez a diferença.

3. Os Truques Inteligentes (Os Novos Módulos)

O artigo introduz quatro truques inteligentes para tornar essa prática eficiente e estável:

  • Prefixo Compartilhado (A Regra do "Mesmo Início"):

    • O Problema: Se o Aluno A começa andando para a esquerda e o Aluno B começa andando para a direita, comparar suas habilidades finais de fazer café é injusto. Eles tiveram pontos de partida diferentes.
    • A Correção: O Z-1 força todos os 8 alunos a começarem com os exatos mesmos primeiros movimentos (como caminhar até o balcão). Uma vez que todos estejam parados no balcão, eles se dividem e tentam diferentes formas de pegar a caneca. Isso garante que o robô aprenda a partir da parte crítica da tarefa (pegar o objeto), não do caminhar.
  • Ramificação Estruturada em Árvore (A Regra do "Caminho de Ramificação"):

    • O Problema: Às vezes, até a parte de "caminhar até o balcão" precisa de prática. Se forçarmos todos a começarem exatamente iguais, eles nunca aprenderão a corrigir uma caminhada ruim.
    • A Correção: O Z-1 usa uma estrutura de "árvore". Todos os alunos começam juntos, mas depois se dividem em pequenos grupos em diferentes pontos. Alguns se dividem cedo, outros mais tarde. Isso permite que o robô pratique a correção de pequenos erros, ao mesmo tempo em que mantém a prática organizada.
  • Decaimento de Recompensa Consciente do Sucesso (O "Bônus de Velocidade"):

    • O Problema: Se um robô leva 10 minutos para abrir uma porta ou 1 minuto para abrir a mesma porta, um sistema padrão pode dar a ambos um adesivo de "Bom Trabalho".
    • A Correção: O Z-1 dá um adesivo de "Bom Trabalho" maior para o robô que termina mais rápido. Ele não pune o lento, mas recompensa mais o rápido. Isso incentiva o robô a ser eficiente sem ter medo de tentar.
  • Treinamento Conjunto Seletivo (O Interruptor "Cérebro vs. Mãos"):

    • O Problema: Às vezes, o robô falha porque suas "mãos" (o especialista em ação) são desastradas. Outras vezes, ele falha porque seu "cérebro" (visão-linguagem) não consegue ver o botão claramente.
    • A Correção: Normalmente, o Z-1 treina apenas as "mãos" para manter a estabilidade. Mas se o robô continua falhando porque não consegue ver ou entender o objeto, o Z-1 inverte uma chave e treina o "cérebro" e as "mãos" juntos. É como perceber: "Ah, o aluno não é desastrado; ele apenas não consegue ver a maçaneta!" e ensiná-lo a olhar melhor.

Os Resultados

A equipe testou o Z-1 em 24 tarefas domésticas diferentes (como abrir gavetas, usar pias e fazer café).

  • Antes do Z-1 (Apenas assistindo vídeos): O robô tinha sucesso cerca de 67% das vezes.
  • Depois do Z-1 (Praticando com os novos truques): O robô teve sucesso em 80,6% das vezes.

Essa melhoria foi significativa o suficiente para superar outros modelos de robótica de alto nível atualmente no domínio público, mesmo que o Z-1 não tenha usado nenhum dado privado ou secreto — apenas vídeos públicos e suas próprias sessões de prática.

Em Resumo:
O Z-1 pega um robô que era apenas um copiador e o transforma em um solucionador de problemas. Ao deixá-lo praticar em grupos, começar do mesmo lugar, recompensar a velocidade e saber quando treinar seus olhos ou suas mãos, o robô aprende a lidar com os desafios bagunçados do mundo real de uma casa muito melhor do que antes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →