← Últimos artigos
💻 computer science

MINERVA: How Small Can a Manipulation Policy Be and Still Solve LIBERO?

O artigo apresenta o MINERVA, uma política de visão-linguagem-ação altamente compacta de 0,54M de parâmetros que alcança um desempenho próximo ao estado da arte no benchmark LIBERO, revelando que o limite inferior de capacidade da tarefa é surpreendentemente baixo, ao mesmo tempo em que expõe limitações críticas na robustez do condicionamento de instrução e a falta de benefício do flow matching.

Autores originais: Kohei Sendai, Tatsuya Matsushima, Yusuke Iwasawa

Publicado 2026-09-04
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Kohei Sendai, Tatsuya Matsushima, Yusuke Iwasawa

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os robôs estão aprendendo a se mover com uma destreza que antes parecia impossível, pegando objetos, empilhando blocos e seguindo comandos verbais simples. Este progresso é impulsionado por um novo tipo de inteligência artificial que combina visão, linguagem e ação em um único sistema. Esses sistemas, frequentemente chamados de modelos de visão-linguagem-ação, atuam como o cérebro de um robô, observando uma cena, compreendendo um pedido como "pegue o bloco vermelho" e, em seguida, calculando os movimentos precisos necessários para completar a tarefa. Para treinar esses cérebros, os pesquisadores utilizam um conjunto padrão de desafios conhecidos como benchmarks, que servem como uma régua de medição para ver o quão bem um robô desempenha sua função. Durante anos, o benchmark mais popular para manipulação robótica tem sido uma coleção de quarenta tarefas diferentes envolvendo a movimentação de objetos em um ambiente simulado. A crença predominante no campo tem sido a de que, para resolver essas tarefas bem, um robô precisa de um cérebro massivo — um modelo digital com bilhões de parâmetros, ou configurações internas, que exige hardware de computação poderoso e caro para ser executado.

No entanto, uma equipe de pesquisadores da Universidade de Tóquio fez uma pergunta mais simples e prática: quão grande o cérebro realmente precisa ser? Se um robô for implantado para realizar um conjunto específico de trabalhos em uma fábrica ou em uma casa, ele não precisa ter a capacidade de entender todas as línguas do mundo ou reconhecer todos os objetos que nunca viu antes. Ele só precisa resolver as tarefas específicas para as quais foi contratado. Os pesquisadores queriam encontrar a menor versão possível de um cérebro de robô que ainda pudesse resolver o conjunto padrão de quarenta tarefas perfeitamente. Eles buscavam a quantidade mínima de poder computacional necessária para realizar o trabalho, um limiar que determinaria se um robô poderia rodar em um chip pequeno e barato ou se sempre precisaria de um servidor massivo.

Para encontrar esse limite, a equipe construiu uma família de políticas de robô, que são os programas que dizem ao robô como se mover, e as tornou sistematicamente menores. Eles começaram com um modelo contendo quase dez milhões de configurações internas e começaram a encolhê-lo, passo a passo, observando quando o robô começaria a falhar. Eles removeram recursos complexos que são comuns em modelos maiores, como a capacidade de ler frases em linguagem natural ou usar sistemas de visão pré-treinados. Em vez disso, deram ao robô uma lista simples de quarenta nomes de tarefas, representados por números, e uma câmera que aprendeu a enxergar do zero. Eles então treinaram esses modelos nas quarenta tarefas padrão e os testaram mais de duas mil vezes para ver com que frequência obtinham sucesso.

Os resultados revelaram um piso surpreendente. Os pesquisadores descobriram que um modelo com apenas 0,54 milhão de parâmetros foi capaz de resolver as tarefas com uma taxa de sucesso de 95,1 por cento. Este modelo minúsculo desempenhou quase tão bem quanto os modelos mais famosos e de maior escala no campo, que contêm bilhões de parâmetros e são milhares de vezes maiores. O desempenho do robô não melhorou significativamente uma vez que o tamanho do modelo atingiu cerca de um milhão de parâmetros; adicionar mais poder computacional além desse ponto gerava retornos decrescentes. Por outro lado, quando o modelo foi reduzido para menos de um quarto de milhão de parâmetros, a capacidade do robô colapsou, particularmente nas tarefas mais complexas e de longa duração. Isso sugere que, para este conjunto específico de desafios, o robô não precisa de um cérebro gigante; ele só precisa de um cérebro pequeno e eficiente.

O estudo também descobriu quais partes do cérebro do robô realmente importam. Os pesquisadores testaram diferentes maneiras de organizar o modelo e descobriram que o recurso mais crítico era a parte que processa informações visuais — os "olhos" do robô. Se eles removessem muita capacidade do sistema visual, o robô falhava, independentemente de quanta potência restasse para a parte que planejava os movimentos. Eles também descobriram que os métodos matemáticos complexos frequentemente usados para gerar movimentos suaves e fluidos não eram necessários para este nível de desempenho. Um método mais simples e rápido de calcular movimentos funcionou tão bem quanto e permitiu que o robô tomasse decisões em uma fração de segundo.

Talvez a descoberta mais marcante tenha sido como o robô entendia as instruções. Nos modelos maiores, o robô lê uma frase como "pegue a xícara" e tenta compreender o significado das palavras. Neste modelo minúsculo, os pesquisadores substituíram a linguagem por um código numérico simples. Quando eles embaralharam esses códigos, de modo que o robô recebesse o número errado para uma tarefa, a taxa de sucesso do robô caiu para quase zero. Isso provou que, neste benchmark específico, o robô não estava verdadeiramente "compreendendo" a linguagem em um sentido geral; ele estava simplesmente memorizando qual padrão visual correspondia a qual código numérico. A instrução era apenas uma chave para desbloquear um comportamento memorizado específico.

Essa distinção tem implicações profundas para a forma como os robôs são construídos e utilizados. Os pesquisadores mostraram que as altas taxas de sucesso relatadas pelos modelos gigantes neste benchmark são, em grande parte, uma medida de quão bem o robô memorizou as tarefas específicas, em vez de quão bem ele pode generalizar para novas situações. Quando testaram esses modelos minúsculos contra variações das tarefas — como mudar a iluminação, o fundo ou a forma dos objetos — a taxa de sucesso caiu drasticamente, revelando que os modelos não haviam aprendido a física subjacente do mundo, mas apenas a aparência específica das tarefas de treinamento. No entanto, para um robô que é implantado para realizar as mesmas quarenta tarefas todos os dias, essa memorização é exatamente o que é necessário.

O resultado prático desta pesquisa é uma política de robô que é incrivelmente eficiente. O modelo de 0,54 milhão de parâmetros pode rodar em um computador portátil padrão sem qualquer placa de vídeo especializada, tomando decisões em menos de dez milissegundos. Isso é centenas de vezes mais rápido do que os modelos de última geração atuais, que muitas vezes levam segundos para planejar um único movimento. Ao provar que um modelo pequeno e especializado pode resolver o benchmark padrão, os pesquisadores mostraram que o caminho para robôs práticos e acessíveis não requer necessariamente a construção de cérebros cada vez maiores. Em vez disso, requer encontrar o cérebro menor e mais eficiente que se ajuste ao trabalho específico, uma descoberta que poderia permitir que robôs fossem implantados em casas e fábricas onde o espaço, a energia e o custo são limitados. O estudo não afirma que esses modelos pequenos podem substituir os sistemas de propósito geral necessários para a exploração aberta, mas estabelece firmemente que, para um conjunto fixo de tarefas, a capacidade necessária é muito menor do que se acreditava anteriormente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →