← Últimos artículos
💻 computer science

DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting

DriftingVLA es un modelo nativo de visión-lenguaje-acción de un solo paso que utiliza un objetivo de deriva de distribución con Deriva Temporal por Dimensión para generar bloques de acción completos en una sola pasada hacia adelante, logrando un rendimiento de vanguardia en tareas de referencia mientras ofrece una aceleración de 3.36 veces sobre los métodos convencionales basados en flujo de múltiples pasos.

Autores originales: Yuxuan Gao, Shiqi Zhang, Yedong Shen, Yifan Duan, Wenhao Yu, Xin Zhang, Siyuan Cao, Jiajun Deng, Yanyong Zhang

Publicado 2026-09-01
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Yuxuan Gao, Shiqi Zhang, Yedong Shen, Yifan Duan, Wenhao Yu, Xin Zhang, Siyuan Cao, Jiajun Deng, Yanyong Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los robots que pueden ver, comprender el lenguaje y moverse con una fluidez similar a la humana han sido durante mucho tiempo el sueño de la inteligencia artificial. Durante años, los investigadores han construido sistemas que combinan una poderosa comprensión visual y lingüística con la capacidad de controlar brazos robóticos. Estos sistemas, conocidos como modelos de visión-lenguaje-acción, actan como el cerebro del robot, recibiendo lo que la cámara ve y las palabras que un humano pronuncia, para luego decidir cómo mover las articulaciones del robot para completar una tarea. Sin embargo, un cuello de botella significativo ha frenado a estas máquinas para lograr una verdadera capacidad de respuesta en tiempo real. Para generar una secuencia de movimientos fluida, estos modelos dependen tradicionalmente de un proceso complejo de múltiples pasos. Imagine intentar dibujar un círculo perfecto realizando pequeñas y vacilantes correcciones en cada uno de los puntos a lo largo de la línea; el robot tiene que calcular una trayectoria, dar un paso, revisar su trabajo y luego dar otro paso, repitiendo este ciclo muchas veces por cada movimiento que realiza. Si bien este método produce resultados de alta calidad, es lento, introduciendo un retraso que hace que el robot se sienta torpe e insensible en un mundo dinámico.

Un equipo de investigadores ha introducido ahora un nuevo enfoque que cambia fundamentalmente la forma en que estos robots planifican sus movimientos, permitiéndoles generar una secuencia completa de acciones en un solo instante. Su trabajo, centrado en un sistema que llaman DriftingVLA, reemplaza el lento proceso de corrección iterativa con un método que aprende a predecir todo el movimiento futuro a la vez. En lugar de calcular una trayectoria paso a paso durante la tarea real, el sistema aprende una conexión directa entre un punto de partida aleatorio y el movimiento final deseado durante su fase de entrenamiento. Este cambio permite al robot saltarse los cálculos repetitivos por completo durante su despliegue, pasando directamente a la acción correcta. En pruebas que involucran tareas de manipulación complejas, este nuevo método no solo igualó la precisión de los sistemas antiguos y más lentos, sino que también hizo que el robot fuera más de tres veces más rápido, reduciendo el tiempo que tarda en decidir un movimiento de más de doscientos milisegundos a menos de setenta.

El núcleo de este avance reside en cómo los investigadores enseñaron al robot a comprender la relación entre sus diferentes partes móviles. Un brazo robótico no solo se mueve en una sola línea; tiene múltiples articulaciones y grados de libertad que deben trabajar en conjunto, como moverse hacia adelante, rotar y abrir una pinza. Los intentos previos de acelerar estos sistemas a menudo trataban todo el movimiento como un gran bloque o lo dividían en momentos diminutos y desconectados en el tiempo. El nuevo enfoque, sin embargo, reconoció que cada dirección específica de movimiento —como el levantamiento vertical de una pinza o la rotación de una muñeca— tiene su propio ritmo y patrón estadístico único. Los investigadores desarrollaron una técnica llamada Per-Dimension Temporal Drifting (Desplazamiento Temporal por Dimensión), que trata el historial completo de cada dirección de movimiento individual como una unidad separada para ser aprendida. Esto permite al sistema comprender los matices específicos de cómo debe abrirse una pinza o cómo debe girar una muñeca, sin forzar estos diferentes movimientos a conformarse a una única regla matemática rígida.

Crucialmente, este método no sacrifica la capacidad del robot para coordinar sus extremidades. Aunque el sistema aprende los patrones de cada dirección de movimiento por separado, sigue generando todo el plan de acción como un todo unificado. El cerebro del robot, que comprende el lenguaje y la visión, permanece intacto y continúa guiando al experto en acción que produce los movimientos. Al entrenar al sistema para refinar sus predicciones a través de muchos escenarios de "qué pasaría si" simultáneamente, los investigadores se aseguraron de que la decisión de un solo paso sea tan precisa como el resultado de un cálculo lento de múltiples pasos. Esto significa que el robot aún puede realizar tareas delicadas, como verter líquido de un contenedor a otro o apilar bloques con dos brazos trabajando en sincronía, sin la vacilación que afectaba a los modelos anteriores.

Los investigadores probaron este nuevo sistema tanto en entornos simulados como en el mundo real para ver si la velocidad venía acompañada de una pérdida de fiabilidad. En una serie de simulaciones desafiantes que involucraban tareas como recoger objetos y reorganizarlos, el nuevo sistema alcanzó una tasa de éxito de casi el 98,3 por ciento, superando ligeramente a los mejores modelos existentes de múltiples pasos. Al trasladarse a un entorno del mundo real con brazos robóticos físicos, el sistema mantuvo su ventaja, teniendo éxito en el 77,67 por ciento de los ensayos a través de seis tareas diferentes, incluyendo desafíos de coordinación de un solo brazo y de dos brazos. Este rendimiento fue notablemente superior al de otros métodos de un solo paso que intentaban acelerar los sistemas antiguos simplemente acortando su proceso de cálculo, lo que a menudo resultaba en una caída significativa de la precisión. El nuevo método demostró que, al cambiar la forma en que el sistema aprende, en lugar de solo cómo calcula, es posible lograr tanto velocidad como precisión.

Más allá de las cifras brutas, el estudio destacó las ganancias de eficiencia que se obtienen al eliminar el bucle de cálculo repetitivo. En el mundo real, donde cada fracción de segundo cuenta, el nuevo sistema redujo el tiempo requerido para generar un bloque de movimiento de 227,61 milisegundos a 67,67 milisegundos. Esto representa una aceleración de más de tres veces, eliminando efectivamente el retraso que hace que los robots se sientan desconectados de su entorno. Si bien el proceso de entrenamiento requirió un poco más de potencia informática para manejar los múltiples escenarios de "qué pasaría si" durante la fase de aprendizaje, este costo es una inversión de una sola vez. Una vez entrenado, el robot opera con una eficiencia de un solo paso, ligera y que no demanda recursos adicionales. El trabajo demuestra que el futuro de la robótica receptiva puede no residir en construir computadoras más rápidas para ejecutar algoritmos más lentos, sino en rediseñar los algoritmos mismos para que sean inherentemente directos e inmediatos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →