← Últimos artículos
💻 computer science

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

Este artículo presenta la Optimización de Políticas Basada en Deriva (DBPO, por sus siglas en inglés), un marco de dos etapas que permite políticas generativas nativas de un solo paso para el control robótico al internalizar el refinamiento iterativo en el entrenamiento y permitir el aprendizaje por refuerzo en línea, logrando así un rendimiento de alta frecuencia y baja latencia que supera a las bases existentes de difusión de múltiples pasos y de un solo paso.

Autores originales: Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

Publicado 2026-09-01
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los brazos robóticos son cada vez más comunes en fábricas y laboratorios, encargados de tareas delicadas como el ensamblaje de componentes electrónicos o la clasificación de objetos. Para que estas máquinas funcionen bien, necesitan un "cerebro" que pueda decidir exactamente cómo mover sus articulaciones basándose en lo que ven sus cámaras. Este proceso de toma de decisiones ocurre en una fracción de segundo, una y otra vez, a medida que el robot reacciona a un mundo cambiante. El desafío es que el mundo real es desordenado e impredecible. Una sola vista de un bloque sobre una mesa podría permitir varias formas diferentes y válidas de agarrarlo, dependiendo de los movimientos previos del robot o de ligeros cambios en la iluminación. Para manejar esta incertidumbre, los investigadores han desarrollado sistemas que no solo eligen una única respuesta, sino que aprenden un rango de posibles acciones buenas. Los sistemas más exitosos hasta la fecha utilizan un método que funciona como un escultor lento y cuidadoso: comienzan con una suposición aleatoria y la refinan gradualmente, paso a paso, hasta que la acción parece perfecta. Si bien este enfoque produce movimientos de alta calidad, es lento. El robot tiene que ejecutar su cerebro informático muchas veces por cada movimiento que realiza, creando un retraso que lo hace demasiado lento para tareas rápidas en tiempo real o para aprender nuevas habilidades mediante el ensayo y error.

Un equipo de investigadores ha encontrado ahora una forma de hacer que estos cerebros robóticos inteligentes sean igual de capaces pero vastamente más rápidos. Desarrollaron un nuevo sistema que produce los mismos planes de acción de alta calidad y múltiples opciones en un solo instante, en lugar de tomar docenas de pasos para refinarlos. En su trabajo, demostraron que al cambiar la forma en que el robot aprende durante el entrenamiento, pudieron enseñarle a saltarse el lento proceso de refinamiento por completo. En lugar de aprender a corregir sus errores después de cometerlos, el robot aprende a acertar a la primera. Al ser probado en un conjunto de doce tareas robóticas diferentes, este nuevo método logró una tasa de éxito promedio más alta que los sistemas más lentos anteriores, reduciendo el tiempo necesario para tomar una decisión de cien cálculos informáticos a solo uno. Esta aceleración no es solo una mejora teórica; en un robot físico de doble brazo en un laboratorio real, el nuevo sistema completó el 82 por ciento de sus tareas, en comparación con el 59 por ciento del mejor método de un solo paso anterior, todo ello reaccionando lo suficientemente rápido como para controlar el robot en tiempo real.

El núcleo de este avance reside en cómo el robot aprende de los ejemplos. Los métodos tradicionales que producen acciones de alta calidad suelen depender de un proceso llamado eliminación iterativa de ruido (denoising). Imagine a un robot intentando encontrar la mejor manera de recoger una taza. Los sistemas antiguos podrían comenzar con una posición de la mano completamente aleatoria y luego empujarla lentamente hacia la taza, revisando su trabajo, dando otro pequeño empujón, y repitiendo este ciclo muchas veces hasta que la mano esté en el lugar perfecto. Esto asegura que el robot encuentre una buena solución, pero toma tiempo. El nuevo enfoque, que los investigadores llaman una política basada en la deriva (drift-based policy), invierte esta lógica. En lugar de refinar la respuesta durante el momento de la acción, el robot aprende a interiorizar todo el proceso de corrección mientras está siendo entrenado. Durante el entrenamiento, se le muestran al sistema muchos ejemplos de movimientos exitosos y se le enseña a predecir cómo una suposición aleatoria derivaría hacia una correcta. Aprende a absorber estas correcciones en sus propios ajustes internos para que, cuando finalmente sea desplegado, no necesite dar esos pasos lentos e incrementales. Simplemente emite la acción final y corregida de inmediato.

Para demostrar que esta idea funciona, los investigadores probaron su sistema en una gran variedad de desafíos. Comenzaron con un conjunto estándar de doce tareas de simulación que implicaban empujar bloques, levantar objetos y manipular herramientas. Los sistemas más antiguos de varios pasos requerían que la computadora ejecutara su red cien veces para decidir un solo movimiento. El nuevo sistema realizó el mismo trabajo con una sola ejecución. El resultado fue un sistema que no solo era cien veces más rápido, sino también ligeramente más exitoso en general, logrando una tasa de éxito promedio del 83 por ciento en comparación con el 79 por ciento de los métodos más lentos. Esto demostró que la velocidad no se produjo a costa de la calidad; el robot era igual de bueno en la tarea, pero era mucho más eficiente.

Los investigadores llevaron el sistema más allá para ver si podía manejar entornos tridimensionales más complejos donde el robot ve el mundo como una nube de puntos en lugar de una imagen plana. Lo probaron en treinta y siete tareas diferentes, que iban desde la manipulación simple de objetos hasta tareas de destreza difíciles como usar un martillo o girar un pomo de puerta. En estas pruebas, el nuevo sistema superó nuevamente a los métodos existentes líderes diseñados para la velocidad de un solo paso. Logró una tasa de éxito promedio del 88.4 por ciento, superando por un margen significativo al siguiente mejor sistema de un solo paso. Esto demostró que el método era lo suficientemente robusto como para manejar la complejidad de la visión 3D del mundo real sin necesidad del lento refinamiento de múltiples pasos que anteriormente se había considerado necesario para trabajos tan difíciles.

Sin embargo, un robot que es bueno copiando demostraciones humanas no siempre es bueno resolviendo nuevos problemas o recuperándose de los errores. Para abordar esto, los investigadores añadieron una segunda etapa a su marco de trabajo, permitiendo que el robot aprenda mediante el aprendizaje por refuerzo en línea. Este es un proceso en el que el robot intenta mejorar su rendimiento interactuando con el entorno y recibiendo retroalimentación sobre su éxito, en lugar de solo copiar videos antiguos. El desafío aquí es que los algoritmos de aprendizaje estándar suelen requerir que el sistema calcule la probabilidad de cada acción posible, lo cual es difícil para estos generadores rápidos de un solo paso. El equipo resolvió esto creando una interfaz especial que permitía al robot aprender de sus experiencias manteniendo intacta su naturaleza rápida de un solo paso. Descubrieron que este enfoque permitía al robot perfeccionar sus habilidades de manera efectiva, mejorando su desempeño en tareas para las cuales inicialmente había sido entrenado solo con demostraciones humanas.

La prueba final llevó el sistema fuera de la simulación por computadora y a un robot físico en un laboratorio real. Montaron el sistema en un robot de doble brazo, similar a un humano, y les pidieron que realizara tareas como levantar un bloque, transportar una lata y mover objetos entre los dos brazos. El robot tenía que reaccionar a la información visual de las cámaras en tiempo real, sin intervención humana. El sistema operó con un retraso promedio de solo 9.5 milisegundos desde que veía el mundo hasta que movía el brazo, una velocidad lo suficientemente rápida para el control de alta frecuencia. En una serie de pruebas, el robot completó con éxito 123 de 150 intentos, una tasa de éxito del 82 por ciento. En comparación, el mejor sistema de un solo paso anterior logró tener éxito en solo 89 de 150 intentos, o un 59 por ciento. Los fallos que ocurrieron se debieron principalmente a problemas físicos, como el deslizamiento del objeto o la colisión de los dos brazos, más que a un fallo del sistema de toma de decisiones en sí.

Este trabajo sugiere que el compromiso entre velocidad e inteligencia en el control robótico no es tan fijo como parecía anteriormente. Al trasladar la carga del refinamiento del momento de la acción al tiempo de aprendizaje, es posible crear controladores robóticos que sean altamente capaces e increíblemente rápidos. Los investigadores han demostrado que un robot no necesita pasar tiempo pensando en sus opciones paso a paso para tomar una buena decisión; puede aprender a tomar la decisión correcta instantáneamente. Esto abre la puerta a robots que pueden operar a la velocidad de los reflejos humanos, aprendiendo y adaptándose en tiempo real a los entornos complejos e impredecibles de nuestro mundo. El código para este nuevo sistema se ha puesto a disposición de otros investigadores, permitiendo a la comunidad construir sobre esta base de control generativo rápido.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →