GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture
O artigo apresenta o GigaBrain-0.7, um modelo de fundação incorporado que utiliza uma nova arquitetura de três sistemas e é treinado em mais de 37.000 horas de dados heterogêneos para alcançar taxas superiores de generalização zero-shot, seguimento de instruções e sucesso de tarefas através de diversos corpos robóticos em comparação com modelos anteriores de estado da arte.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine um mundo onde um robô pode olhar para uma mesa de cozinha desordenada, compreender um pedido falado para "colocar a maçã vermelha na tigela" e, então, descobrir exatamente como mover seu braço para fazer isso sem derrubar nada. Este é o sonho da inteligência artificial incorporada: máquinas que não apenas processam informações, mas interagem com o mundo físico. Durante anos, pesquisadores tentaram ensinar robôs mostrando-lhes milhares de vídeos de mãos humanas movendo objetos, esperando que a máquina aprendesse as regras da física e de causa e efeito. No entanto, um grande obstáculo permaneceu. Robôs são construídos de forma diferente; um pode ter dois braços, outro um único gripper, e um terceiro pode rolar sobre rodas. Dados coletados de um tipo de robô costumam confundir outro. Além disso, simplesmente assistir a um vídeo não ensina uma máquina a prever o que acontecerá em seguida se ela cometer um erro, ou como se recuperar quando uma tarefa dá errado. A questão era se poderíamos construir um único cérebro inteligente que entendesse a linguagem, visse o mundo e controlasse qualquer tipo de corpo robótico, tudo isso enquanto aprende com uma mistura massiva de diferentes experiências.
Uma equipe de pesquisadores apresentou agora um passo significativo à frente com um sistema chamado GigaBrain-0.7. Este não é apenas um programa único, mas um sistema coordenado projetado para lidar com a complexidade da interação no mundo real. Em vez de tentar forçar um robô a aprender tudo em um surto caótico, os pesquisadores organizaram o processo de aprendizagem em três partes distintas, mas conectadas, que trabalham juntas. A primeira parte atua como as mãos e os reflexos, assumindo o controle imediato dos motores do robô para executar ações. A segunda parte atua como o planejador e observador, olhando para a cena, compreendendo a instrução de linguagem e decompondo um grande objetivo como "limpar a mesa" em etapas menores e gerenciáveis, como "pegar a xícara" e "levá-la para a pia". A terceira parte é a adição mais inovadora: ela atua como um preditor e juiz. Ela imagina como será a cena daqui a alguns segundos se o robô continuar seu caminho atual e atribui uma pontuação a esse futuro para decidir se o robô está progredindo ou indo em direção a uma falha.
Para treinar este sistema, os pesquisadores não dependeram de uma única fonte de dados. Eles reuniram uma biblioteca massiva de mais de 37.000 horas de experiência. Esta coleção incluiu vídeos de robôs reais trabalhando em fábricas e casas, gravações de mãos humanas manipulando objetos de uma perspectiva em primeira pessoa e dados gerados por simulações de computador. Eles também usaram inteligência artificial para criar novos cenários de treinamento, expandindo efetivamente a variedade de situações das quais o robô poderia aprender. Ao alimentar o sistema com essa mistura diversificada de dados, os pesquisadores permitiram que o modelo aprendesse princípios gerais de movimento e interação, em vez de apenas memorizar truques específicos para um roboto específico. O sistema foi treinado para lidar com 16 tipos diferentes de corpos robóticos, desde máquinas de braços duplos até figuras humanoides, ensinando-o a adaptar sua compreensão de "esquerda" e "direita" ou "agarrar" e "soltar" com base no corpo específico que estava controlando.
Os resultados desta abordagem foram testados em robôs reais, tanto em ambientes industriais quanto domésticos. Quando solicitados a realizar tarefas que nunca haviam visto antes, o sistema mostrou uma capacidade notável de generalização. Em um teste, um robô foi solicitado a dobrar uma peça de roupa que foi jogada em uma pilha bagunçada, uma tarefa que exige que a máquina ajuste constantemente sua pegada conforme o tecido se desloca e muda de forma. Sem precisar ser retreinado para aquela camisa específica, o sistema manipulou com sucesso o objeto deformável. Em outro cenário, o robça foi solicitado a pegar uma colher de uma cor específica de um grupo de utensílios misturados, demonstrando que podia entender instruções de linguagem sutis e aplicá-las a novos objetos. O sistema também provou ser capaz de lidar com sequências longas de ações, como organizar uma mesa ou varrer arroz, onde o robô tinha que manter o senso do objetivo geral enquanto executava muitos pequenos movimentos.
Um achado fundamental foi que a capacidade do sistema de prever o futuro e avaliar seu próprio progresso fez uma diferença tangível nas taxas de sucesso. Quando os pesquisadores removeram a parte preditiva do sistema, o robô teve mais dificuldades com tarefas complexas, frequentemente ficando preso em ciclos de movimento repetitivo ou falhando em se recuperar de erros menores. Com o componente preditivo ativo, o robô conseguia antecipar que um determinado movimento levaria a uma colisão ou a uma queda, e ajustava seu curso antes que o erro acontecesse. Essa capacidade permitiu que o robô completasse tarefas difíceis, como embrulhar um presente ou separar cubos, com uma confiabilidade muito maior do que modelos anteriores. Os pesquisadores descobriram que, à medida que aumentavam a quantidade de dados de treinamento, o desempenho do robô melhorava consistentemente, sugerindo que o sistema estava realmente aprendendo com o volume e a variedade de suas experiências.
O estudo também destacou a importância de como diferentes tipos de dados são combinados. O sistema teve o melhor desempenho quando aprendeu com uma mistura de tentativas de robôs reais, demonstrações humanas e ambientes simulados. Cada fonte forneceu um tipo diferente de lição: robôs reais ensinaram ao sistema as restrições físicas de máquinas específicas, vídeos humanos mostraram como as pessoas interagem naturalmente com objetos e simulações permitiram que ele praticasse cenários raros ou perigosos com segurança. Ao misturar essas fontes, o sistema desenvolveu uma compreensão robusta de como o mundo funciona que poderia ser aplicada em diferentes corpos robóticos. Os pesquisadores observaram que, embora o sistema não seja perfeito e ainda enfrente dificuldades com as interações físicas mais complexas, ele representa uma mudança de construir robôs especializados para tarefas únicas para criar uma inteligência de propósito geral que pode se adaptar a novos desafios.
Em última análise, o GigaBrain-0.7 demonstra que aumentar a escala da quantidade e diversidade de dados de treinamento, combinado com uma arquitetura estruturada que separa planejamento, ação e predição, pode levar a robôs que são mais capazes e adaptáveis. O sistema não apenas segue um roteiro; ele entende o contexto de uma tarefa, antecipa as consequências de suas ações e aprende com sua própria experiência para melhorar ao longo do tempo. Embora ainda haja trabalho a ser feito antes que tais sistemas possam lidar com todas as situações possíveis em uma casa ou fábrica, esta pesquisa fornece um caminho claro a seguir. Ela sugere que o futuro da robótica não reside apenas em construir um hardware melhor, mas em criar um software mais inteligente e flexível que possa aprender com as vastas e variadas experiências do mundo físico.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.