Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
O artigo introduz o VLAct, uma abordagem de pré-treinamento contínuo centrada em representação para modelos de Visão-Linguagem-Ação que aproveita dados de múltiplas embodiment heterogêneas para alcançar transferibilidade e desempenho superiores através de diversas tarefas e robôs não vistos, mesmo sob orçamentos de computação modestos e dados de downstream limitados.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Os robôs há muito tempo lutam para aprender com a experiência da mesma forma que os humanos. Enquanto uma criança pode observar um pai despejando um copo de água e compreender o movimento, um robô normalmente requer milhares de instruções específicas e codificadas manualmente para realizar a mesma tarefa. Durante anos, cientistas tentaram resolver isso alimentando os robôs com quantidades massivas de dados, esperando que o puro volume os ensinasse como se mover. Essa abordagem baseia-se em modelos de Visão-Linguagem-Ação, que são sistemas computacionais capazes de ver uma imagem, entender uma frase e decidir sobre um movimento físico. A crença predominante era que, se você simplesmente coletasse dados de robôs suficientes, o sistema naturalmente se tornaria inteligente o suficiente para lidar com qualquer situação. No entanto, reunir dados de robôs é incrivelmente difícil e caro; ao contrário de fotos ou textos na internet, os movimentos dos robôs devem ser registrados no mundo físico real, muitas vezes por humanos guiando as máquinas. Essa escassez significa que até os maiores conjuntos de dados de robôs são minúsculos e esparsos em comparação com a vastidão do mundo físico.
Uma equipe de pesquisadores propôs agora um caminho diferente, sugerindo que a qualidade do que o robô aprende é mais importante do que a quantidade de dados que ele vê. Eles argumentam que, em vez de apenas memorizar movimentos específicos, o cérebro de um robô precisa aprender uma compreensão profunda e flexível de como objetos e ações se relacionam entre si. Ao focar nesta "representação" — o mapa interno que o robô constrói do mundo — eles criaram um novo método de treinamento que permite aos robôs generalizar muito melhor. O trabalho deles demonstra que, com uma maneira mais inteligente de ensinar o núcleo do cérebro do robô, um sistema pode aprender a realizar tarefas complexas em robôs que nunca viu antes, usando apenas uma fração dos dados anteriormente considerados necessários.
Os pesquisadores, trabalhando sob o nome VLAct, começaram com uma pergunta fundamental: por que os robôs falham em generalizar? Quando um robô é treinado em um conjunto específico de movimentos, ele frequentemente torna-se demasiado especializado, aprendendo a imitar os padrões exatos que viu, em vez de compreender a física subjacente da tarefa. Para investigar isso, a equipe observou como diferentes formas de ensinar um robô afetavam sua compreensão interna. Eles descobriram que, se um robô for treinado para prever ações usando apenas um método específico, ele fica "preso" a esse método. É como um aluno que aprende a resolver problemas matemáticos usando apenas uma fórmula específica; se o teste mudar o formato da questão, o aluno falha porque nunca aprendeu o conceito em si. Os pesquisadores descobriram que esse "aprisionamento" acontece quando o cérebro do robô é forçado a ajustar seu conhecimento em uma estrutura única e rígida durante o treinamento.
Para corrigir isso, a equipe desenvolveu uma nova receita de treinamento que mantém o cérebro do robô flexível. Eles começaram com um modelo de visão-linguagem poderoso, um tipo de inteligência artificial já treinada em vastas quantidades de imagens e textos da internet, que lhe confere uma compreensão ampla do mundo. Em vez de permitir que o treinamento do robô sobrescrevesse esse conhecimento amplo, eles protegeram as camadas inferiores do cérebro que lidam com o reconhecimento visual básico. Em seguida, introduziram uma técnica de treinamento única onde o robô era solicitado a prever os mesmos movimentos físicos usando três métodos matemáticos diferentes simultaneamente. Ao forçar o robô a satisfazer todos os três métodos ao mesmo tempo, os pesquisadores evitaram que ele se especializasse em apenas um. Essa abordagem garantiu que o robô aprendesse uma compreensão universal da ação, em vez de uma habilidade estreita ligada a uma única forma de calcular o movimento.
Além disso, a equipe abordou o problema de diferentes corpos de robôs. Um robô com dois braços move-se de forma diferente de um robô com um braço, e um robô com uma garra move-se de forma diferente de um com uma mão. Os métodos anteriores frequentemente tratavam essas diferenças como problemas separados, treinando um cérebro único para cada tipo de robô. A equipe VLAct, em vez disso, criou uma linguagem compartilhada para o movimento. Eles ensinaram ao robô que abrir uma garra em uma máquina é o mesmo conceito que abrir uma garra em outra, mesmo que a mecânica física difira. Eles alcançaram isso alinhando as partes da ação que são fisicamente semelhantes, como o abrir e fechar de uma mão, enquanto deixavam as partes únicas de cada corpo de robô separadas. Isso permitiu que o robô transferisse o que aprendeu sobre um tipo de máquina para um tipo completamente diferente de máquina que nunca havia encontrado.
Os resultados desta abordagem foram impressionantes. Quando testado em uma ampla gama de tarefas, o novo sistema superou consistentemente os modelos existentes, incluindo aqueles treinados em conjuntos de dados muito maiores. Em um benchmark de simulação chamado LIBERO-Plus, que testa o quão bem um robô lida com mudanças de iluminação, ângulos de câmera e posicionamento de objetos, o novo sistema alcançou uma taxa de sucesso de 82,6 por cento. Isso foi significativamente superior a outros sistemas líderes, provando que o robô aprendeu uma compreensão robusta da tarefa, em vez de apenas memorizar um cenário específico. Em outro benchmark chamado RoboTwin 2.0, que envolve dois braços robóticos trabalhando juntos, o sistema atingiu uma taxa de sucesso de 92,5 por cento, superando sistemas industriais de grande escala que dependem de dados proprietários e enorme poder computacional.
Talvez a evidência mais convincente do poder deste método tenha vindo de um teste envolvendo um robô humanoide que era completamente novo para os dados de treinamento. Os pesquisadores treinaram seu sistema com dados de braços robóticos padrão e depois pediram que ele controlasse um robô humanoide com pernas e um torso, uma máquina que nunca tinha visto antes. Usando apenas 20 por cento dos dados tipicamente necessários para treinar um robô para este corpo específico, o sistema desempenhou melhor do que um modelo de base treinado com 100 por cento dos dados. Isso sugere que o robô aprendeu um conceito fundamental de "como se mover" que poderia ser aplicado a qualquer corpo, em vez de apenas memorizar os movimentos específicos dos braços para os quais foi treinado.
Os pesquisadores também testaram seu sistema no mundo real, usando braços robóticos físicos para realizar tarefas como empilhar blocos, limpar mesas e dobrar roupas. Nestes experimentos do mundo real, o sistema continuou a superar o modelo de base, mostrando maior estabilidade e precisão. Ele lidou com sucesso com objetos novos que nunca tinha visto antes, como pegar uma pimenta em vez de uma cenoura, e gerenciou tarefas complexas de várias etapas, como pegar feijões com uma colher e despejá-los em uma tigela sem pular etapas. O sistema também se destacou na coordenação de dois braços para trabalharem juntos, como segurar uma tomada enquanto puxa um plugue, demonstrando um nível de sincronização que modelos anteriores tinham dificuldade em alcançar.
O que torna este trabalho particularmente significativo é que foi alcançado usando apenas dados de código aberto e uma quantidade modesta de poder computacional, especificamente uma configuração com 16 unidades de processamento gráfico. Isso contrasta com muitos dos sistemas de alto desempenho no campo, que dependem de conjuntos de dados proprietários e recursos computacionais de escala industrial massiva. Os pesquisadores mostraram que, ao focar em como o robô representa o mundo internamente, em vez de apenas aumentar a quantidade de dados, é possível construir robôs mais capazes e adaptáveis. Suas descobertas sugerem que o futuro do aprendizado robótico não reside na coleta de fluxos intermináveis de dados, mas no design de métodos de treinamento que ajudem o robô a construir uma compreensão mais profunda e flexível do mundo físico.
O estudo conclui que a maneira como um robô é ensinado é tão importante quanto o que lhe é ensinado. Ao preservar o conhecimento amplo de um cérebro pré-treinado e encorajar o robô a aprender ações de uma forma que não esteja ligada a um único método ou tipo de corpo, os pesquisadores podem criar sistemas que são muito mais capazes de lidar com a natureza imprevisível do mundo real. Esta abordagem oferece um caminho promissor para robôs de propósito geral que podem aprender novas tarefas rapidamente e se adaptar a novos ambientes sem exigir quantidades massivas de novos dados. O trabalho foi disponibilizado ao público, permitindo que outros cientistas construam sobre estas descobertas e explorem ainda mais como ensinar máquinas a se mover com a mesma flexibilidade e compreensão dos seres vivos.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.