← Últimos artigos
🤖 AI

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

O TempoVLA introduz uma política de Visão-Linguagem-Ação controlável por velocidade que utiliza o Aumento de Trajetória de Velocidade Variável (VSTA) e condicionamento de velocidade explícito para permitir que robôs ajustem dinamicamente sua velocidade de execução tanto para trânsitos mais rápidos quanto para fases de contato mais lentas e precisas, superando assim as limitações de velocidade fixa dos modelos existentes.

Autores originais: Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

Publicado 2026-06-05
📖 4 min de leitura☕ Leitura rápida

Autores originais: Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um robô que aprendeu a realizar uma tarefa, como empilhar copos ou dobrar uma toalha, ao observar um humano fazê-lo uma única vez. O problema é que esse robô está preso em um mundo de "uma única velocidade". Se a demonstração humana foi lenta, o robô se moverá lentamente para sempre. Se a demonstração humana foi rápida, o robô voará pela aí para sempre. Ele não consegue decidir diminuir a velocidade para uma parte delicada do trabalho ou acelerar quando está apenas se movendo pelo espaço vazio.

O TempoVLA é um novo sistema que dá aos robôs um "botão de volume" para sua velocidade. Ele permite que um único cérebro robótico realize exatamente a mesma tarefa a 0,5x de velocidade (super lento e cuidadoso), 1x de velocidade (normal) ou 2x de velocidade (super rápido), tudo sob comando.

Eis como eles fizeram isso, dividido em duas partes simples:

1. O "Editor de Vídeo" (Lado dos Dados)

Antes de ensinar o robô, os pesquisadores tiveram que consertar os vídeos de treinamento. Eles criaram uma ferramenta inteligente chamada VSTA (Aumento de Trajetória de Velocidade Variável).

Pense em uma demonstração de robô como um filme.

  • Para torná-lo mais rápido: O editor pega vários quadros consecutivos e os funde em um grande salto. É como pular as partes chatas de um filme para chegar à ação.
  • Para torná-lo mais lento: O editor pega um grande movimento e o divide em muitos passos pequenos e lentos. É como adicionar efeitos de "câmera lenta" a uma cena específica.

Crucialmente, essa edição não altera o que o robô está fazendo (a semântica), apenas a velocidade com que ele faz. Eles pegaram uma demonstração original e a transformaram em uma biblioteca da mesma tarefa feita em seis velocidades diferentes.

2. O "Seletor de Velocidade" (Lado do Modelo)

Uma vez que o robô possui essa biblioteca de exemplos rápidos e lentos, eles ensinam ao robô um novo truque. Eles dão ao robô um "seletor de velocidade" simples (um número como 0,5, 1,0 ou 1,5) que ele pode visualizar enquanto trabalha.

  • Se você disser ao robô: "Faça isso a 1,5x de velocidade", o robô olha para seus dados de treinamento, vê os exemplos rápidos e prevê movimentos maiores e mais ousados.
  • Se você disser: "Faça isso a 0,5x de velocidade", o robô olha para os exemplos lentos e prevê movimentos minúsculos e cautelosos.

O robô não precisa ser treinado do zero para cada nova velocidade. Ele apenas aprende a ouvir o "seletor de velocidade" e ajustar seus movimentos musculares de acordo.

O Bônus do "Piloto Inteligente"

O artigo também mostra que você pode parear este robô com um "Piloto Inteligente" (um grande modelo de linguagem de IA). Em vez de você digitar manualmente "vá devagar", o Piloto Inteligente observa a transmissão da câmera do robô.

  • Cenário: O robô está alcançando uma mesa vazia.
    • Piloto Inteligente: "Caminho livre! Vá rápido!" (O robô acelera).
  • Cenário: O robô está prestes a pegar um copo frágil.
    • Piloto Inteligente: "Zona de perigo! Vá devagar!" (O robô reduz a velocidade ao mínimo).

Isso cria um robô que naturalmente acelera quando é seguro e desacelera quando precisa de precisão, sem intervenção humana.

O Que Eles Descobriram

  • Flexibilidade: O robô consegue alternar entre velocidades de forma fluida.
  • Melhor Desempenho: Surpreendentemente, treinar o robô nessas velocidades mistas na verdade o tornou melhor na velocidade normal (1x) do que robôs treinados apenas na velocidade normal. Parece que aprender a se mover em diferentes velocidades ajuda o robô a entender melhor a tarefa.
  • Limites: Existe um limite físico. Se você pedir ao robô para ir muito rápido (como 4x de velocidade), os motores físicos e os controladores do robô não conseguem acompanhar as instruções do cérebro, e ele começa a errar o alvo. Mas dentro de uma faixa razoável (0,5x a 1,5x), funciona perfeitamente.

Em resumo, o TempoVLA transforma um robo rígido de velocidade única em um trabalhador flexível que pode escolher seu próprio ritmo, tornando-o mais seguro para tarefas delicadas e mais rápido para tarefas rotineiras.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →