← Últimos artigos
💻 computer science

OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning

O artigo apresenta o OneTwoVLA, um modelo unificado de visão, linguagem e ação que supera as limitações das abordagens de dois sistemas ao alternar adaptativamente entre raciocínio e execução, permitindo que robôs realizem tarefas complexas de manipulação de longo prazo com maior planejamento, recuperação de erros e interação natural.

Autores originais: Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

Publicado 2026-03-03
📖 4 min de leitura☕ Leitura rápida

Autores originais: Fanqi Lin, Ruiqian Nai, Yingdong Hu, Jiacheng You, Junming Zhao, Yang Gao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a cozinhar um prato complexo, como um Hotpot (fondue) ou um coquetel. Antigamente, a abordagem era dividir o cérebro do robô em duas partes separadas: uma "mente lenta" que pensava no plano e uma "mão rápida" que executava os movimentos. O problema? Elas não conversavam bem entre si. A mente pensava em algo que a mão não conseguia fazer, ou demorava tanto para pensar que a mão já tinha cometido um erro.

O OneTwoVLA é como dar a esse robô um único cérebro unificado que consegue ser, ao mesmo tempo, o chef experiente e o garçom ágil.

Aqui está a explicação simples, usando analogias do dia a dia:

1. O Cérebro Único (Um Sistema, Duas Funções)

Pense no robô como um motorista de táxi.

  • O "Sistema 1" (Agir): É o motorista dirigindo. Ele olha para a frente, vira o volante e acelera. É rápido e automático.
  • O "Sistema 2" (Raciocinar): É o motorista pensando no mapa. "Será que devo virar à esquerda? O trânsito está parado. Preciso mudar a rota."

Antes, esses dois papéis eram feitos por duas pessoas diferentes que não se entendiam. O OneTwoVLA é um único motorista que sabe quando deve apenas dirigir (agir) e quando deve parar, olhar o mapa e planejar (raciocinar).

2. A Decisão Inteligente: "Parar para Pensar"

A grande mágica do OneTwoVLA é que ele não perde tempo pensando o tempo todo.

  • Na maior parte do tempo: Ele age rapidamente, como um atleta em movimento.
  • Nos momentos críticos: Ele sabe exatamente quando parar. Imagine que você está montando um móvel. Você não precisa pensar em cada parafuso. Mas, quando chega na parte difícil ou se o parafuso não encaixa, você para, lê o manual e pensa: "Opa, isso não está certo. O que eu faço agora?".
    • O robô faz o mesmo: se ele derruba um ingrediente, percebe um erro ou precisa de ajuda de um humano, ele ativa o modo "Raciocínio", escreve um plano mental ("Vou pegar o copo de volta e tentar de novo") e só depois continua agindo.

3. O Treinamento: Aprendendo com a Realidade e com a Imaginação

Para ensinar esse robô, os pesquisadores usaram duas fontes de aprendizado:

  1. Dados Reais (O Prático): Eles gravaram humanos fazendo tarefas reais com robôs. Mas, em vez de apenas gravar o movimento, eles criaram um "diário de bordo" mental. Cada vez que o humano parava para pensar, o robô aprendia a escrever esse pensamento: "O óleo está aqui, a panela ali, agora vou derramar".
  2. Dados Sintéticos (A Imaginação): Como gravar milhões de horas de robôs é caro, eles usaram Inteligência Artificial para criar cenários virtuais. É como se o robô jogasse um videogame realista onde ele pratica cozinhar, misturar bebidas e organizar mesas em milhões de situações diferentes que nunca existiram na vida real. Isso ensina o robô a lidar com o inesperado (como encontrar um objeto que ele nunca viu antes).

4. O Que Ele Consegue Fazer?

Graças a essa mistura de "pensar e fazer", o OneTwoVLA mostrou habilidades impressionantes:

  • Planejamento de Longo Prazo: Consegue fazer uma receita de várias etapas (como fazer um coquetel Vodka Sunrise) sem esquecer o que já fez.
  • Recuperação de Erros: Se ele derruba o copo, ele não fica travado. Ele pensa: "Caiu. Vou pegar de novo com mais firmeza" e tenta de novo.
  • Interação Natural: Se você pedir para ele mudar a receita no meio do caminho ("Troque a vodka de laranja por limão"), ele entende, para o que está fazendo, ajusta o plano e continua.
  • Entender o Mundo: Ele consegue pegar o objeto certo mesmo se você disser "pegue o objeto para ver letras miúdas" (em vez de "pegue a lupa"), entendendo a função do objeto, não apenas o nome.

Resumo

O OneTwoVLA é um robô que parou de ser apenas um "braço mecânico" que segue ordens cegas. Ele agora tem uma mente integrada que sabe quando agir rápido e quando parar para pensar, aprendendo tanto com a prática real quanto com a imaginação criativa. É como transformar um robô que apenas "obedece" em um robô que "compreende".

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →