← Últimos artigos
💻 computer science

Scalable Behavior Cloning with Open Data, Training, and Evaluation

Este artigo apresenta o ABC, uma pilha totalmente de código aberto para clonagem de comportamento em manipulação robótica que apresenta o maior conjunto de dados de teleoperação até o momento (ABC-130K), um pipeline reprodutível de hardware e simulação com receitas de co-treinamento, e avaliações abrangentes de arquiteturas de Diffusion Transformer e Vision-Language-Action em tarefas destras complexas.

Autores originais: Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Mali
Publicado 2026-06-26
📖 4 min de leitura☕ Leitura rápida

Autores originais: Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Malik, Fred Shentu, Guanya Shi, Philipp Wu, Angjoo Kanazawa

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você queira ensinar um robô a realizar tarefas complexas, como dobrar uma caixa de papelão, separar peças de LEGO ou até mesmo puxar um cartão de crédito de uma carteira apertada. No passado, ensinar robôs era como tentar ensinar uma criança mostrando apenas uma foto única e borrada de uma tarefa e esperando que ela a compreendesse. Era caro, lento e, muitas vezes, o robô simplesmente desistia.

Este artigo apresenta o ABC, um enorme "kit de início" de código aberto para ensinar robôs a aprender observando humanos. Pense nisso como a "Wikipedia" ou o "YouTube" do treinamento de robôs, mas em vez de apenas vídeos, inclui as receitas reais, os utensílios de cozinha e a cozinha de testes para que qualquer pessoa possa experimentar.

Aqui está a divisão da sua "Estrutura ABC" usando analogias simples:

1. A Biblioteca: ABC-130K (O "Livro de Receitas")

Imagine uma biblioteca que não tem apenas uma ou duas receitas, mas sim 3.500 horas de filmagens de humanos realizando 130.000 tarefas diferentes.

  • O que há dentro: Humanos usando dois braços robóticos para fazer de tudo, desde trabalhos simples de "pegar e colocar" até tarefas de destreza super complicadas, como dobrar aviões de papel ou abrir uma caixa com uma chave.
  • Por que isso importa: Antes disso, a maioria dos dados de robótica era ou muito pequena, ou cara demais para coletar, ou estava trancada em cofres corporativos secretos. Esta é a maior coleção aberta do gênero, construída sobre um robô que custa cerca de US$ 8.000 (barato para um robô), tornando-a acessível para pesquisadores comuns, não apenas para gigantes da tecnologia.

2. O Cérebro: ABC-Models (Os "Alunos")

Os autores não apenas despejaram os dados; eles construíram dois tipos diferentes de robôs "estudantes" para aprender com ele e testaram qual estilo de aprendizagem funciona melhor.

  • O "Transformer de Difusão" (DiT): Pense nisso como um aluno que é muito bom em olhar para uma imagem e adivinhar o próximo passo, passo a passo, como se estivesse preenchendo um palavras cruzadas.
  • O "Visão-Linguagem-Ação" (VLA): Pense nisso como um aluno que consegue ler instruções, olhar para a imagem e entender o contexto de uma só vez.
  • O Experimento: Eles testaram esses alunos com diferentes "professores" (diferentes ângulos de câmera e entradas de linguagem). Eles descobriram que o aluno VLA aprendia mais rápido quando recebia mais poder computacional, enquanto o aluno DiT era mais eficiente com menos energia. Eles liberaram os cérebos "formados" (os pesos do modelo) para que qualquer pessoa possa usá-los.

3. O Simulador: ABC-Sim (O "Simulador de Voo")

Normalmente, para ver se um robô é inteligente, você precisa deixá-lo tentar a tarefa no mundo real. Se ele falhar, pode quebrar algo ou levar horas para ser reiniciado.

  • A Solução: Os autores construíram uma "realidade virtual" de simulador de voo para robôs. Eles criaram 400 horas de dados onde humanos teleoperaram robôs dentro de um jogo de computador.
  • A Magia: Eles provaram que, se um robô se sai bem neste videogame, é provável que ele se saia bem no mundo real. Isso é como dizer: "Se você consegue voar este avião no simulador, provavelmente está pronto para o céu real". Isso permite que pesquisadores testem suas ideias sem precisar de um robô físico ou arriscar danos.

4. O Teste de Direção: ABC-Eval (O "Exame de Direção")

Eles não apenas disseram "funciona"; eles realmente conduziram os robôs através de uma série de tarefas.

  • Os Resultados: Os robôs aprenderam com sucesso a dobrar caixas, separar itens e realizar tarefas delicadas, como inserir uma chave em uma fechadura.
  • O Truque "DAgger": Para a tarefa mais difícil (dobrar uma caixa), o robô continuava falhando. Os autores usaram uma técnica chamada DAgger. Imagine um instrutor de direção que deixa o aluno dirigir, mas no momento em que o aluno começa a bater, o instrutor assume o volante para corrigir, e então deixa o aluno tentar novamente. Ao coletar esses momentos de "correção", o robô aprendeu como se recuperar de erros e, eventualmente, dominou a dobra da caixa.

O Panorama Geral

Os autores estão dizendo: "Nós construímos todo o sistema escolar para o aprendizado de robôs. Temos os livros didáticos (dados), os professores (modelos), os exames práticos (simulação), os testes finais (resultados no mundo real). Estamos dando tudo isso de graça."

O objetivo deles é deixar de tornar o aprendizado de robôs um clube secreto para empresas ricas e iniciar um esforço comunitário onde todos possam aprender o "ABC" de ensinar robôs juntos. Eles não estão prometendo robôs que farão sua lavanderia amanhã, mas estão fornecendo a base para que os pesquisadores possam finalmente começar a construí-los.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →