← Últimos artigos
⚡ electrical engineering

OmniRetarget: Interaction-Preserving Data Generation for Humanoid Whole-Body Loco-Manipulation and Scene Interaction

O OmniRetarget é um motor de geração de dados que preserva interações e que utiliza uma malha de interação para superar lacunas de incorporação e preservar relações críticas entre humanos, objetos e o ambiente, permitindo a criação eficiente de dados de treinamento de alta qualidade para habilidades robustas de loco-manipulação humanoide e parkour sem currículos de aprendizagem complexos.

Autores originais: Lujie Yang, Xiaoyu Huang, Zhen Wu, Angjoo Kanazawa, Pieter Abbeel, Carmelo Sferrazza, C. Karen Liu, Rocky Duan, Guanya Shi

Publicado 2026-06-17
📖 4 min de leitura☕ Leitura rápida

Autores originais: Lujie Yang, Xiaoyu Huang, Zhen Wu, Angjoo Kanazawa, Pieter Abbeel, Carmelo Sferrazza, C. Karen Liu, Rocky Duan, Guanya Shi

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você queira ensinar um robô a fazer parkour, carregar uma cadeira pesada montanha acima ou escalar uma parede. Você poderia tentar programar cada movimento muscular manualmente, mas isso é como tentar ensinar alguém a nadar escrevendo um livro de física sobre resistência da água. É difícil demais e muito lento.

Em vez disso, os pesquisadores por trás do OmniRetarget decidiram deixar o robô aprender observando um humano realizar os movimentos. Mas aqui está o detalhe: humanos e robôs são muito diferentes. Se você apenas copiar os movimentos de um humano para um robô, o robô pode acabar com os pés deslizando pelo chão (como se estivesse patinando no gelo), as pernas atravessando uma cadeira ou as articulações torcendo de formas impossíveis.

O OmniRetarget é um novo "tradutor mágico" que resolve esse problema. Veja como ele funciona, usando analogias simples:

1. A "Malha de Interação" (A Teia de Aranha Invisível)

Pense no humano, no robô, na cadeira e no chão como se estivessem conectados por uma teia de aranha invisível e elástica.

  • O Problema: Quando um humano se move, a teia se estica naturalmente. Se você apenas copiar a pose do humano para um robô, a teia se rompe ou rasga porque as partes do corpo do robô estão em lugares diferentes.
  • A Solução: O OmniRetarget constrói uma "malha de interação" digital (uma teia 3D) que conecta as articulações do humano aos objetos que ele toca. Ao converter o movimento humano para o robô, o sistema estica e encolhe essa teia para se ajustar ao corpo do robô, mas mantém a teia intacta.
  • O Resultado: Se a mão do humano estiver tocando uma cadeira, a mão do robô deve tocar a cadeira na nova versão. Se o pé do humano estiver firmemente plantado no chão, o pé do robô permanece plantado. Isso evita que o robô "atravesse" objetos ou escorregue.

2. O "Treinador Rigoroso" (Restrições Fortes)

No passado, esses sistemas de tradução eram como um treinador que dizia: "Tente parecer com o humano, mas não tem problema se você atravessar o chão um pouquinho".
O OmniRetrix é um treinador rigoroso. Ele utiliza um conjunto de regras inquebráveis (restrições matemáticas) que dizem:

  • "Seus pés não podem deslizar."
  • "Seu corpo não pode passar pela cadeira."
  • "Suas articulações não podem dobrar para trás."
    Ele resolve um quebra-cabeça complexo para encontrar uma maneira de o robô se mover que pareça com o humano, mas que obedeça a todas as leis da física.

3. A Fotocopiadora "Um-para-Muitos" (Aumento de Dados)

Normalmente, para ensinar um robô a pegar uma caixa vermelha, você precisa de um humano demonstrando o ato de pegar uma caixa vermelha. Para ensinar a pegar uma caixa azul, você precisa de uma nova demonstração.
O OmniRetarget é como uma fotocopiadora inteligente.

  • Você mostra a ele uma demonstração humana (ex: pegar uma caixa).
  • O sistema gera automaticamente centenas de novas variações: pegar uma caixa alta, uma caixa baixa, uma caixa em um lugar diferente ou até mesmo escalar uma plataforma mais alta.
  • Ele faz isso remodelando matematicamente a "teia de aranha" para se ajustar a esses novos cenários, mantendo a lógica central do movimento intacta. Isso cria uma biblioteca massiva de dados de treinamento a partir de apenas alguns vídeos humanos.

A Grande Vitória: Da Simulação para a Realidade

Os pesquisadores usaram este sistema para treinar um robô (o humanoide Unitree G1) usando Aprendizado por Reforço (um método de aprendizado por tentativa e erro).

  • O Treinamento: Como os dados eram tão limpos e fisicamente corretos, o robô precisou de apenas 5 regras simples (recompensas) para aprender. Ele não precisou de instruções complexas e bagunçadas para corrigir erros.
  • O Resultado: O robô aprendeu a fazer um percurso de parkour de 30 segundos que incluía carregar uma cadeira, pisar nela, saltar dela e rolar.
  • Transferência Zero-Shot: Esta é a parte mais impressionante. O robô aprendeu inteiramente em uma simulação de computador usando esses movimentos traduzidos. Quando o ligaram no mundo real, ele funcionou imediatamente sem qualquer ajuste extra. Ele não precisou "reaprender" como andar no concreto real; ele simplesmente sabia o que fazer.

Resumo

Em suma, o OmniRetarget resolve o "gap de incorporação" entre humanos e robôs. Ele pega os movimentos humanos, envolve-os em uma "teia" protetora e compatível com a física que garante que façam sentido para um robô, e então usa isso para gerar infinitos cenários de prática. Isso permite que robôs aprendam habilidades complexas e ágeis, como parkour e manipulação de objetos, rapidamente e transfiram essas habilidades do computador para o mundo real com sucesso.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →