← Últimos artículos
💻 computer science

FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference

FlashVLA es un marco de decodificación de acciones por flujo unificado que permite una inferencia VLA asíncrona y rápida mediante el mantenimiento de un búfer de acciones de múltiples fragmentos con atención causal por fragmentos, logrando una frecuencia de control de más de 30 Hz al tiempo que garantiza una ejecución robótica fluida y temporalmente consistente.

Autores originales: Zekai Li, Jiaming Tang, Zhijian Liu

Publicado 2026-08-28
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zekai Li, Jiaming Tang, Zhijian Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los robots que pueden ver, comprender y moverse con una destreza similar a la humana han sido durante mucho tiempo el santo grial de la automatización. Durante años, los investigadores han construido sistemas que pueden identificar una taza sobre una mesa o seguir una orden verbal de "levántala". Sin embargo, convertir esa comprensión en un movimiento físico fluido y en tiempo real ha seguido siendo un cuello de botella persistente. La dificultad central reside en el tiempo: un robot debe observar constantemente el mundo, procesar esa imagen, decidir qué hacer a continuación y luego mover su brazo, todo ello en una fracción de segundo. Si el proceso de pensamiento tarda demasiado, el robot se queda atrás, actuando sobre información desactualizada y perdiendo su objetivo. Este retraso es particularmente agudo en la nueva generación de cerebros robóticos, conocidos como modelos de Visión-Lenguaje-Acción. Estos sistemas son potentes porque combinan la capacidad de ver y leer con la capacidad de planificar movimientos, pero también son lentos. A menudo funcionan dividiendo un movimiento en pequeños fragmentos y refinando cada fragmento mediante una serie de cálculos repetitivos y lentos antes de enviar la orden al motor. El resultado es un robot que vacila, tartamudea o se mueve con un desfase que hace imposibles las tareas delicadas.

Para resolver esto, un equipo de investigadores de la Universidad de California en San Diego y el MIT introdujo un nuevo marco llamado FlashVLA, diseñado para permitir que estos cerebros robóticos piensen y se muevan simultáneamente en lugar de secuencialmente. Imagine una línea de montaje de una fábrica donde un trabajador espera a que un producto terminado sea inspeccionado por completo antes de comenzar con el siguiente; la línea se detiene constantemente. FlashVLA cambia el flujo de trabajo para que el trabajador esté siempre manejando una etapa diferente del producto al mismo tiempo, asegurando un flujo constante y continuo. En términos técnicos, los investigadores reemplazaron el antiguo método de decodificar un movimiento completo a la vez por un enfoque de "transmisión" (streaming). En lugar de esperar a que un plan de movimiento completo sea perfecto antes de actuar, el sistema mantiene un búfer de varios planes de movimiento en diferentes etapas de finalización. Algunos planes están casi terminados y listos para ser ejecutados, mientras que otros apenas están comenzando y aún se están refinando. El sistema actualiza todos estos planes a la vez, en un solo paso, y envía inmediatamente el más terminado a los motores del robot. Esto permite que el robot siga moviéndose mientras la computadora todavía está descifrando los siguientes pasos, ocultando eficazmente el tiempo que toma pensar.

El impacto de este cambio es dramático. En sus pruebas, los investigadores descubrieron que este método de transmisión redujo el tiempo requerido para generar una sola acción hasta veinte veces en comparación con el enfoque estándar. En una sola tarjeta gráfica, el sistema logró una frecuencia de control de al menos treinta veces por segundo, una velocidad que resulta instantánea para un observador humano. Más importante aún, esta velocidad no se produjo a costa de la precisión. Debido a que el sistema procesa estos fragmentos de movimiento juntos, los pasos futuros aprenden naturalmente de los pasos que están a punto de suceder en este momento. Esto crea un movimiento suave y continuo que evita los movimientos bruscos y desarticulados que suelen afectar a los robots que intentan actuar sobre información antigua. En entornos simulados y pruebas en el mundo real con brazos robóticos, el nuevo sistema igualó o superó la tasa de éxito de los modelos tradicionales más lentos, mientras funcionaba significativamente más rápido.

Los investigadores también descubrieron que este método hacía que los robots fueran sorprendentemente mejores en tareas largas y complejas. Cuando un robot tiene que realizar una secuencia de acciones que toma mucho tiempo completar, la capacidad del nuevo sistema para mirar hacia adelante y recordar el pasado inmediato le ayudó a mantenerse en el camino. En un conjunto de experimentos que involucraban tareas de largo alcance, la tasa de éxito aumentó en más de treinta y seis puntos porcentuales en comparación con el mejor método anterior. Esto sugiere que la forma en que el sistema conecta sus acciones actuales con sus planes futuros crea una especie de memoria a corto plazo que ayuda al robot a navegar por secuencias complicadas sin perderse. El equipo probó estas ideas en varios montajes robóticos, incluyendo sistemas de un solo brazo y de dos brazos, y encontró que las mejoras de velocidad y fluidez se mantuvieron constantes en diferentes tipos de hardware y diferentes tipos de tareas.

Lo que hace que este trabajo sea particularmente significativo es que resuelve dos problemas a la vez: la lentitud del cálculo y el desajuste entre lo que el robot ve y dónde se encuentra realmente. Los intentos previos para solucionar la lentitud a menudo hacían que el robot actuara sobre datos obsoletos, mientras que los intentos para solucionar el desajuste de datos a menudo requerían cálculos complejos y adicionales que ralentizaban al robot nuevamente. FlashVLA elimina este compromiso al estructurar el proceso de pensamiento en sí mismo para que sea continuo. Los investigadores demostraron que, simplemente cambiando la forma en que el robot procesa sus planes de movimiento —manteniendo un búfer rotativo de planes en varios estados de preparación—, podían lograr un nivel de fluidez que antes era inalcanzable. El resultado es un robot que puede reaccionar rápidamente, moverse con suavidad y manejar tareas de manipulación complejas con una fiabilidad que acerca un paso más el sueño de una automatización ágil en el mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →