← Últimos artigos
💻 computer science

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

Este artigo introduz o **In-Context VLA**, um framework que aprimora modelos de Visão-Linguagem-Ação ao substituir a geração de cadeia de pensamento de forma livre pelo pós-treinamento em contexto sobre evidências perceptivas estruturadas e uso de ferramentas agênticas, permitindo, assim, o consumo de linguagem fundamentada para um controle de baixo nível superior e desempenho de estado da arte em tarefas de manipulação em simulação e no mundo real.

Autores originais: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

Publicado 2026-08-07
📖 3 min de leitura☕ Leitura rápida

Autores originais: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a fazer tarefas domésticas, como fazer um sanduíche ou arrumar um quarto bagunçado. Por muito tempo, cientistas tentaram ensinar essas máquinas mostrando vídeos de humanos realizando o trabalho e dizendo ao robô: "Copie exatamente o que você vê". Isso funciona bem para tarefas simples, mas é como tentar aprender uma nova língua apenas memorizando uma única frase rígida. Se você pedir ao robô para "pegar a caneca vermelha", mas depois disser "agarre aquele copo carmesim", o robô pode ficar confuso porque nunca aprendeu a entender o significado por trás das palavras, apenas a corresponder aos sons específicos que ouviu durante o treinamento.

Para corrigir isso, pesquisadores recentemente tentaram dar aos robôs uma etapa de "pensamento", semelhante à forma como os humanos conversam consigo mesmos antes de agir. Eles esperavam que o robô primeiro escrevesse um plano como: "Certo, a caneca está sobre a mesa e eu preciso mover minha mão para a esquerda", e então agisse. Isso é chamado de "Cadeia de Pensamento" (Chain-of-Thought). Mas aqui está a reviravolta: para robôs, falar demais antes de se mover na verdade os torna piores em suas tarefas. É como tentar dirigir um carro enquanto escreve um romance sobre a estrada; quando você termina sua frase, já perdeu a curva. O robô fica preso em um loop narrando seus próprios pensamentos em vez de realmente agarrar o objeto, e muitas vezes inventa fatos sobre onde as coisas estão porque está adivinhando em vez de observar.

Este artigo apresenta uma nova maneira de ensinar robôs chamada VLA-Talker. Em vez de forçar o robô a escrever seus próprios pensamentos, os pesquisadores dão ao robô um "assistente inteligente" que faz o olhar e o relatório por ele. Pense nisso como um robô com um par de óculos superpoderosos e um copiloto prestativo. Quando o robô precisa saber onde está uma colher, ele não adivinha ou escreve um parágrafo sobre isso. Em vez disso, ele instantaneamente pergunta ao seu copiloto (que usa ferramentas especiais, como câmeras de profundidade e detectores de objetos) para dizer: "A colher está 42 pixels à direita e um pouco abaixo da sua mão". O robô então lê esse relatório claro e factual e age imediatamente.

Os pesquisadores descobriram que este método é um divisor de águas. Ao permitir que o robô consuma uma linguagem clara e fundamentada de suas ferramentas, em vez de gerar seu próprio falatório confuso, o robô torna-se muito mais rápido e preciso. Em seus testes, essa abordagem não apenas funcionou melhor, como foi quase 4,6 vezes mais rápida do que os antigos métodos de "pensamento", porque o robô não perdeu tempo escrevendo ensaios antes de se mover. Eles testaram isso em simulações computacionais complexas e até em um robô real com forma humana, e ele consistentemente resolveu tarefas com as quais outros robôs tiveram dificuldade, provando que, às vezes, a melhor maneira de pensar é ouvir alguém que conhece os fatos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →