← Últimos artigos
💻 computer science

Quadruped Parkour Learning: Sparsely Gated Mixture of Experts with Visual Input

Este artigo demonstra que arquiteturas de mistura de especialistas com portões esparsos (MoE) superam redes MLP tradicionais em tarefas de parkour robótico com visão, oferecendo melhor desempenho e eficiência computacional ao permitir que um robô quadrúpede Unitree Go2 transpõe obstáculos grandes com o dobro de sucesso.

Autores originais: Michael Ziegltrum, Jianhao Jiao, Tianhu Peng, Chengxu Zhou, Dimitrios Kanoulas

Publicado 2026-04-22
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Michael Ziegltrum, Jianhao Jiao, Tianhu Peng, Chengxu Zhou, Dimitrios Kanoulas

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um cachorro robô a fazer parkour. Ele precisa pular em caixas altas, correr por terrenos irregulares e não cair. O desafio é que o mundo real é bagunçado: a luz muda, o chão é diferente e o robô precisa pensar rápido.

Este artigo da Universidade College London (UCL) conta a história de como eles ensinaram esse robô (um modelo chamado Unitree Go2) a ser um verdadeiro atleta, usando uma técnica de inteligência artificial inspirada em como os grandes modelos de linguagem (como o que você está usando agora) funcionam.

Aqui está a explicação simplificada, usando analogias do dia a dia:

1. O Problema: O "Cérebro" Muito Lento

Antes, para fazer robôs andarem e pularem, os cientistas usavam uma arquitetura de rede neural chamada MLP (uma espécie de "cérebro" simples e linear).

  • A analogia: Imagine que esse cérebro é como um funcionário de escritório que precisa ler todas as páginas de um livro gigante para responder a uma única pergunta simples. Ele é inteligente, mas lento e gasta muita energia (computação) porque ativa tudo o que tem, mesmo que não precise de tudo para aquele momento específico.

2. A Solução: A "Equipe de Especialistas" (MoE)

Os autores decidiram usar uma arquitetura chamada Mistura de Especialistas com Portões Esparsos (MoE).

  • A analogia: Em vez de um único funcionário que faz tudo, imagine uma grande equipe de especialistas.
    • Temos 16 especialistas diferentes (um especialista em "pular", outro em "equilíbrio", outro em "subir escadas", outro em "luz forte", etc.).
    • Existe um Gerente (o Portão) que olha para a situação atual (ex: "o robô está prestes a pular uma caixa alta").
    • O Gerente escolhe apenas 4 especialistas para trabalhar naquele milissegundo e ignora os outros 12.
    • O resultado: O robô pensa muito mais rápido e gasta menos energia, porque só "liga" a parte do cérebro necessária para a tarefa imediata.

3. O Treinamento: Do Simulador para a Realidade

Ensinar um robô no mundo real é perigoso e caro (ele pode quebrar). Então, eles usaram dois truques:

  • Fase 1 (O Simulador Perfeito): O robô treina em um videogame (Isaac Gym). Lá, o robô sabe tudo: o peso exato de cada perna, o atrito do chão e a posição exata do centro de gravidade. É como treinar um atleta com óculos que mostram a trajetória perfeita da bola.
  • Fase 2 (O Mundo Real): Aqui, o robô perde os "óculos mágicos". Ele precisa aprender a adivinhar o peso e o atrito apenas olhando para o chão e sentindo o movimento do próprio corpo.
  • O Truque do Ruído: Para garantir que o robô não fique confuso quando sair do jogo para a vida real, eles adicionaram "ruído" (barulho, luzes estranhas, dados imprecisos) durante o treino. É como treinar um nadador em uma piscina calma e, de repente, jogá-lo em um mar com ondas e vento. Se ele aprender a nadar no mar agitado no simulador, no mundo real será fácil.

4. Os Resultados: Quem Ganhou?

Eles testaram o robô pulando em uma caixa de 32 cm (que é 80% da altura dele, um desafio grande).

  • O "Funcionário Solitário" (MLP Padrão): Mesmo com um cérebro grande, ele falhou na maioria das vezes. Quando conseguiu, foi lento e desajeitado, quase caindo.
  • A "Equipe de Especialistas" (MoE): O robô pulou com sucesso duas vezes mais do que o outro modelo.
  • A Comparação Justa: Para fazer o "Funcionário Solitário" ter o mesmo desempenho que a "Equipe", eles tiveram que aumentar o tamanho do cérebro dele até o limite máximo. Mas, ao fazer isso, o robô ficou 14% mais lento para pensar.
    • Resumo: A equipe de especialistas foi mais rápida, mais eficiente e mais inteligente, usando menos recursos.

5. O Que Eles Descobriram Sobre os "Especialistas"

Ao analisar o que os especialistas estavam fazendo, eles viram algo fascinante:

  • A locomoção (andar/pular) é cíclica (como o movimento de pedalar uma bicicleta).
  • Eles perceberam que certos especialistas "acordavam" em momentos específicos do ciclo de pulo. Um especialista cuidava da subida, outro da descida.
  • Havia um especialista que quase nunca era usado (o número 7), mas quando era, ele olhava especificamente para a profundidade da imagem (a câmera), sugerindo que ele era o "olho" da equipe para obstáculos visuais.

Conclusão Simples

Este trabalho mostra que, para robôs andarem em terrenos difíceis olhando para o mundo (com câmeras), não precisamos de um cérebro gigante que faz tudo ao mesmo tempo. Precisamos de um cérebro inteligente que saiba quem chamar para cada situação.

É como ter um time de futebol: você não coloca todos os 11 jogadores para chutar a bola ao mesmo tempo. Você escolhe o melhor jogador para a jogada específica. Isso torna o robô mais ágil, mais rápido e pronto para enfrentar o mundo real, seja em um laboratório ou em um parque de skate ao ar livre.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →