← Últimos artigos
🤖 AI

CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model

O CoTinyVLA é um modelo de Visão-Linguagem-Ação com menos de um bilhão de parâmetros que alcança o estado da arte em robustez no benchmark LIBERO-Plus ao alavancar técnicas de supervisão estruturada — incluindo entradas temporais de visão dupla, destilação de cadeia de pensamento hierárquica e aumento por paráfrase — em vez de aumentar o tamanho do modelo.

Autores originais: Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim

Publicado 2026-07-29
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde os robôs não são apenas máquinas sem mente seguindo códigos rígidos, mas companheiros úteis que entendem nossas palavras faladas e conseguem descobrir como mover seus próprios braços para realizar tarefas. Este é o sonho da "IA incorporada" (embodied AI), um campo onde os computadores aprendem a ver o mundo através de câmeras, entendem a linguagem humana e traduzem essas duas coisas em ações físicas. Por muito tempo, os robôs mais inteligentes precisavam de cérebros massivos — modelos de computador com bilhões de "neurônios" — para lidar com isso. Esses modelos gigantes eram como supercomputadores que precisavam de servidores enormes e caros para rodar, tornando impossível encaixá-los dentro de um pequeno robô que pudesse circular por uma casa ou ajudar em uma cozinha. A grande questão que os pesquisadores têm feito é: Podemos criar um robô que seja tão inteligente e confiável, mas pequeno o suficiente para caber em uma mochila?

Este artigo apresenta um novo céreio de robô chamado CoTinyVLA. Pense nele como um cérebro de robô minúsculo e super eficiente que consegue superar os modelos massivos e pesados que lideram o campo atualmente, tudo isso usando apenas uma fração da memória. Os pesquisadores não apenas encolheram o cérebro; eles ensinaram uma maneira melhor de pensar. Em vez de tentar memorizar cada situação possível, eles deram ao robô uma "folha de cola" para o raciocínio. Eles ensinaram o robô a decompor uma tarefa grande em um plano simples (como uma lista de tarefas) e então pensar em cada pequeno passo antes de se mover. Eles também lhe deram um par de olhos especial — um olhando de longe para ver o quarto inteiro e outro em seu pulso para ver exatamente o que sua mão está tocando — e o ensinaram a assistir a um vídeo curto dos últimos segundos para entender o movimento. O resultado é um modelo de robô com apenas 0,9 bilhão de parâmetros (minúsculo comparado aos gigantes de 7 bilhões de parâmetros) que pode lidar com situações reais complicadas e bagunçadas melhor do que modelos oito vezes maiores.

O Problema: Cérebros Grandes, Robôs Pequenos

Por anos, os melhores robôs para seguir instruções têm sido como tanques gigantes e pesados. Para entender um comando como "pegue a xícara azul e coloque-a sobre a mesa", esses robôs usam modelos de computador massivos com 3 a 7 bilhões de parâmetros. Embora esses modelos sejam incrivelmente inteligentes, eles também são enormes. Eles exigem cerca de 20 gigabytes de memória de computador apenas para rodar. Isso é como tentar colocar uma biblioteca inteira em uma mochila; simplesmente não cabe nos pequenos computadores alimentados por bateria encontrados em robôs móveis ou dispositivos de assistência.

Os pesquisadores queriam saber: Precisamos realmente de um cérebro tão gigante para ser inteligente? Ou podemos construir um robô pequeno e eficiente que seja tão bom quanto no manuseio da bagunça inesperada do mundo real?

A Solução: Um Cérebro Pequeno com uma Grande Estratégia

A equipe construiu o CoTinyVLA, um cérebro de robô com apenas 0,9 bilhão de parâmetros. Para tornar este modelo minúsculo tão forte quanto os gigantes, eles não apenas o alimentaram com mais dados; eles mudaram como ele aprendia e ao que prestava atenção. Eles usaram três truques principais, que chamam de "supervisão estruturada", para ensinar o robio a pensar melhor.

1. A Máquina do Tempo de "Dois Olhos"
Imagine tentar pegar uma bola. Se você vê apenas uma foto da bola, você não sabe se ela está vindo em sua direção ou se afastando. Você precisa ver um vídeo curto para entender o movimento.
O CoTinyVLA é ensinado a olhar para o mundo através de dois "olhos" diferentes ao mesmo tempo:

  • O Olho de Terceira Pessoa: Uma câmera olhando para o quarto inteiro para ver onde tudo está.
  • O Olho do Pulso: Uma câmera na mão do robô para ver exatamente o que a garra está tocando.
    Em vez de apenas olhar para o momento atual, o robô assiste a um curto "filme" dos últimos 16 quadros (8 de cada olho). Isso dá a ele uma sensação de tempo e movimento, ajudando-o a entender a rapidez com que as coisas se movem e para onde estão indo.

2. A Folha de Cola "Planejar e Pensar"
Este é o truque mais importante. Antes do robô se mover, ele é ensinado a escrever uma história.

  • O Plano: No início de uma tarefa, o robô escreve uma "lista de tarefas" de alto nível (ex: "Primeiro, pegue a xícara. Segundo, levante-a. Terceiro, coloque-a sobre a mesa"). Este plano permanece o mesmo para toda a tarefa.
  • O Pensar: Antes de cada pequeno movimento, o robô escreve uma nota rápida sobre o que está fazendo agora (ex: "Estou fechando minha garra", ou "Estou levantando a xícara").
    O robô aprende isso observando um robô muito maior e mais inteligente (um "professor" de 35 bilhões de parâmetros) resolvendo as mesmas tarefas. O robô minúsculo copia o processo de pensamento do professor. Isso ajuda o robô minúsculo a entender por que está fazendo algo, não apenas o que fazer.

3. O Jogo do "Parafrasear"
Robôs costem ficar confusos se você disser a mesma coisa de uma forma diferente. Se um robô for treinado apenas com a frase "pegue a xícara", ele pode travar se você disser "agarre a caneca".
Para corrigir isso, os pesquisadores ensinaram o robô com 40 instruções básicas, mas as expandiram para 800 versões diferentes. Eles trocaram palavras (como mudar "pegar" para "agarrar" ou "levantar"), mudaram as descrições dos objetos (como "tigela preta" para "tigela escura") e até adicionaram frases educadas como "Você poderia, por favor...". Isso ensinou o robô a entender o significado do comando, não apenas as palavras específicas.

Os Resultados: O Pequeno Vence Grande

Os pesquisadores testaram o CoTinyVLA no LIBERO-Plus, um conjunto de testes rigoroso projetado para ver quão bem os robôs lidam com mudanças no mundo. O teste inclui mais de 10.000 cenários diferentes onde as coisas estão bagunçadas: o robô começa em uma posição estranha, a iluminação muda, o fundo é diferente ou as instruções são formuladas de maneira estranha.

Os resultados foram surpreendentes. O CoTinyVLA, com seus minúsculos 0,9 bilhão de parâmetros, venceu os modelos mais fortes de 7 bilhões de parâmetros em todas as quatro categorias principais de teste:

  • Espacial: 90,8% de sucesso (superando os grandes modelos em 4,7 pontos).
  • Objeto: 87,3% de sucesso (superando os grandes modelos em 2,8 pontos).
  • Objetivo (Goal): 86,6% de sucesso (superando os grandes modelos por impressionantes 15,9 pontos).
  • Longo (Long): 80,7% de sucesso (superando os grandes modelos em 3,0 pontos).

A maior vitória foi na categoria "Objetivo", onde o robô minúsculo foi quase 16 pontos melhor que o melhor robô gigante. Isso é especialmente impressionante porque o CoTinyVLA roda em um computador que usa apenas 2,25 GiB de memória, o que é pequeno o suficiente para caber em muitos robôs do mundo real.

Por Que Isso Importa

O artigo mostra que você não precisa de um cérebro massivo para ter um robô inteligente. Ao ensinar um robô pequeno a "pensar" de forma estruturada (criando planos e verificando seus passos) e ao dar a ele o tipo certo de treinamento visual e de linguagem, ele pode lidar com o mundo real bagunçado e imprevisível melhor do que modelos muito maiores.

Os pesquisadores também descobriram que a parte do "Plano" no processo de pensamento é crucial. Se você remover a capacidade do robô de escrever um plano, sua taxa de sucesso cai de 40 a 45 pontos. Isso prova que o robô não está apenas adivinhando; ele está realmente usando o plano para guiar suas ações.

Em suma, o CoTinyVLA prova que, com os métodos de ensino corretos, um robô pequeno e eficiente pode ser tão capaz quanto um supercomputador gigante, aproximando-nos de ter robôs inteligentes e úteis em nossas casas e locais de trabalho.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →