← Últimos artigos
💬 NLP

EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

O artigo apresenta o "EmbodiedMidtrain", uma abordagem que preenche a lacuna entre Modelos Visão-Linguagem (VLMs) e Modelos Visão-Linguagem-Ação (VLAs) ao utilizar um motor de dados para selecionar e realizar um treinamento intermediário com dados de VLMs mais alinhados ao domínio robótico, resultando em um melhor desempenho em tarefas de manipulação.

Autores originais: Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong

Publicado 2026-04-23
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você quer ensinar um robô a fazer tarefas domésticas, como arrumar a mesa ou pegar uma xícara. Para isso, você precisa de um "cérebro" para o robô.

Neste artigo, os pesquisadores propõem uma nova maneira de criar esse cérebro, chamada EmbodiedMidtrain. Para entender como funciona, vamos usar uma analogia simples: o Chef de Cozinha e o Estágio.

O Problema: O Chef que nunca viu uma cozinha

  1. O VLM (O Chef Generalista):
    Imagine um chef de cozinha muito famoso e inteligente (chamado de VLM - Modelo de Visão e Linguagem). Ele leu milhões de livros de receitas, viu milhões de fotos de comida e sabe falar sobre gastronomia, história da culinária e até descrever pratos com palavras bonitas. Ele é ótimo em entender o mundo visual e linguístico.

    • No mundo real: Esses são os modelos de IA que já existem (como os que você usa para gerar imagens ou responder perguntas).
  2. O VLA (O Chef que precisa trabalhar):
    Agora, você quer que esse chef não apenas fale sobre comida, mas que pegue os ingredientes, corte o tomate e coloque no prato sem derrubar nada. Isso é o VLA (Modelo de Visão, Linguagem e Ação).

    • O problema: O chef generalista nunca treinou com as mãos. Ele sabe que um tomate é vermelho e redondo, mas não sabe a força exata que precisa fazer para pegá-lo sem esmagar. Se você tentar ensinar ele diretamente a trabalhar na cozinha, ele vai demorar muito e cometer muitos erros, porque ele está tentando aprender a "física" do trabalho a partir de "teoria" pura.

A Solução: O "Treinamento Intermediário" (Mid-training)

Os autores dizem: "Espera aí! Não vamos tentar ensinar o chef a trabalhar na cozinha direto. Vamos dar a ele um estágio intermediário antes."

É aqui que entra o EmbodiedMidtrain:

  1. O Grande Pulo do Gato (A Lacuna de Dados):
    Os pesquisadores descobriram que os dados que o chef leu (fotos de livros, receitas teóricas) são muito diferentes dos dados que ele precisa para trabalhar (vídeos de robôs pegando objetos). É como tentar aprender a pilotar um avião lendo apenas enciclopédias de aerodinâmica. Existe um "abismo" entre o que ele sabe e o que ele precisa fazer.

  2. O Filtro Inteligente (O Estagiário Esperto):
    Em vez de pegar todos os livros que o chef já leu e tentar ensiná-lo com eles, eles criaram um "filtro inteligente".

    • Imagine que você tem uma biblioteca gigante com 1 milhão de livros. A maioria é sobre história, poesia e ficção científica (dados gerais).
    • Mas, dentro dessa biblioteca, existem alguns capítulos específicos que falam sobre como segurar objetos, como julgar distâncias e como interagir com o mundo físico.
    • O EmbodiedMidtrain usa um pequeno "detector" (um classificador leve) para vasculhar essa biblioteca e selecionar apenas os trechos que são mais parecidos com o trabalho real de um robô.
  3. O Treino (Mid-training):
    Eles pegam esses trechos selecionados e fazem o chef estudar apenas eles por um tempo. Isso não é o treino final de robô, é um "aquecimento".

    • Resultado: O chef agora não é mais apenas um teórico. Ele leu sobre como segurar coisas, sobre espaço e movimento. Ele está "mentalmente preparado" para a cozinha.
  4. O Treino Final (Fine-tuning):
    Agora, quando você finalmente coloca o chef na cozinha para treinar a ação real (o VLA), ele aprende muito mais rápido e faz um trabalho muito melhor, porque sua base já foi ajustada para entender a física do mundo, não apenas a teoria.

Por que isso é incrível?

  • Economia de Recursos: O modelo deles é pequeno (1,1 bilhão de parâmetros), mas depois desse "treino intermediário", ele bate modelos gigantes (de 30 bilhões) que foram treinados com muito mais dinheiro e tempo. É como um atleta pequeno que, com o treino certo, ganha de um gigante.
  • Funciona para todos: Eles testaram esse método em diferentes "chefs" (modelos base) e funcionou para todos.
  • Não perde a inteligência: O modelo continua sendo inteligente em outras coisas (como responder perguntas), mas ganha uma "intuição" extra para mexer com o mundo físico.

Resumo em uma frase

O EmbodiedMidtrain é como dar a um robô um "curso intensivo de física e interação" antes de colocá-lo para trabalhar, selecionando apenas as lições mais úteis de uma biblioteca gigante, para que ele aprenda a mover seus braços com muito mais facilidade e precisão.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →