← Últimos artículos
🤖 AI

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

TempoVLA introduce una política de Visión-Lenguaje-Acción controlable en velocidad que aprovecha la Aumentación de Trayectorias de Velocidad Variable (VSTA) y el condicionamiento de velocidad explícito para permitir que los robots ajusten dinámicamente su velocidad de ejecución tanto para tránsitos más rápidos como para fases de contacto más lentas y precisas, superando así las limitaciones de velocidad fija de los modelos existentes.

Autores originales: Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

Publicado 2026-06-05
📖 4 min de lectura☕ Lectura para el café

Autores originales: Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un robot que aprendió a realizar una tarea, como apilar vasos o doblar una toalla, viendo a un humano hacerlo una sola vez. El problema es que este robot está atrapado en un mundo de "una sola velocidad". Si la demostración del humano fue lenta, el robot se mueve lentamente para siempre. Si la demostración del humano fue rápida, el robot se desplaza a toda velocidad para siempre. No puede decidir frenar para una parte delicada del trabajo o acelerar cuando solo se está desplazando por un espacio vacío.

TempoVLA es un nuevo sistema que le da al robot un "control de volumen" para su velocidad. Permite que un único cerebro robótico realice exactamente la misma tarea a 0.5x de velocidad (súper lento y cuidadoso), 1x de velocidad (normal) o 2x de velocidad (súper rápido), todo bajo demanda.

Así es como lo lograron, dividido en dos partes sencillas:

1. El "Editor de Video" (Lado de los Datos)

Antes de enseñar al robot, los investigadores tuvieron que arreglar los videos de entrenamiento. Crearon una herramienta ingeniosa llamada VSTA (Aumentación de Trayectorias de Velocidad Variable).

Piensa en una demostración de un robot como una película.

  • Para hacerlo más rápido: El editor toma un grupo de fotogramas consecutivos y los fusiona en un gran salto. Es como saltarse las partes aburridas de una película para llegar a la acción.
  • Para hacerlo más lento: El editor toma un movimiento grande y lo divide en muchos pasos pequeños y lentos. Es como añadir efectos de "cámara lenta" a una escena específica.

Crucialmente, esta edición no cambia lo que el robot está haciendo (la semántica), solo qué tan rápido lo hace. Tomaron una demostración original y la convirtieron en una biblioteca de la misma tarea realizada a seis velocidades diferentes.

2. El "Dial de Velocidad" (Lado del Modelo)

Una vez que el robot tiene esta biblioteca de ejemplos rápidos y lentos, le enseñan un nuevo truco. Le dan al robot un "dial de velocidad" simple (un número como 0.5, 1.0 o 1.5) que puede ver mientras trabaja.

  • Si le dices al robot: "Haz esto a velocidad 1.5x", el robot mira sus datos de entrenamiento, ve los ejemplos rápidos y predice movimientos más grandes y audaces.
  • Si le dices: "Haz esto a velocidad 0.5x", el robot mira los ejemplos lentos y predice movimientos diminutos y cautelosos.

El robot no necesita ser reentrenado desde cero para cada nueva velocidad. Simplemente aprende a escuchar el "dial de velocidad" y ajustar sus movimientos musculares en consecuencia.

El Bono del "Piloto Inteligente"

El artículo también muestra que puedes emparejar este robot con un "Piloto Inteligente" (un modelo de lenguaje de IA de gran tamaño). En lugar de que tú escribas manualmente "ve más despacio", el Piloto Inteligente observa la transmisión de la cámara del robot.

  • Escenario: El robot está estirándose a través de una mesa vacía.
    • Piloto Inteligente: "¡Camino despejado! ¡Ve rápido!" (El robot acelera).
  • Escenario: El robot está a punto de agarrar una taza frágil.
    • Piloto Inteligente: "¡Zona de peligro! ¡Ve más despacio!" (El robot reduce la velocidad hasta casi detenerse).

Esto crea un robot que acelera naturalmente cuando es seguro y desacelera cuando necesita precisión, todo sin intervención humana.

Lo Que Encontraron

  • Flexibilidad: El robot puede cambiar de velocidad con éxito sobre la marcha.
  • Mejor Rendimiento: Sorprendentemente, entrenar al robot con estas velocidades mixtas lo hizo mejor en la velocidad normal (1x) que a los robots entrenados solo en velocidad normal. Parece que aprender a moverse a diferentes velocidades ayuda al robot a entender mejor la tarea.
  • Límites: Existe un límite físico. Si le pides al robot que vaya demasiado rápido (como a 4x de velocidad), los motores físicos y los controladores del robot no pueden seguir las instrucciones del cerebro, y comienza a fallar en su objetivo. Pero dentro de un rango razonable (0.5x a 1.5x), funciona perfectamente.

En resumen, TempoVLA convierte a un robot rígido de una sola velocidad en un trabajador flexible que puede elegir su propio ritmo, lo que lo hace más seguro para tareas delicadas y más rápido para tareas rutinarias.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →