← Últimos artículos
🤖 AI

HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface

HIL-UMI introduce un marco de trabajo sin robots y con el humano en el bucle para modelos de Visión-Lenguaje-Acción post-entrenamiento que aprovecha una Interfaz de Manipulación Universal de mano y una puntuación de energía guiada por la política para recolectar datos dirigidos de manera eficiente y refinar los estimadores de ventaja, superando así las limitaciones del ajuste fino supervisado estático y permitiendo una mejora iterativa y escalable sin el despliegue de robots físicos.

Autores originales: Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai Li, Hui Shen, Hao Dong

Publicado 2026-09-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai Li, Hui Shen, Hao Dong

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los robots son cada vez más capaces de comprender el mundo a través de la vista y el lenguaje, aprendiendo de vastas cantidades de datos para realizar tareas complejas. Sin embargo, persiste una brecha significativa entre lo que estos sistemas de inteligencia artificial aprenden de forma general y lo que realmente pueden hacer en una cocina, un taller o una fábrica específica. Cuando un robot se despliega en un entorno real, a menudo encuentra situaciones que nunca ha visto, lo que provoca errores que pueden acumularse hasta que la tarea falla. Para solucionar esto, los investigadores recurren tradicionalmente al "ajuste fino supervisado", un proceso en el que los humanos demuestran las acciones correctas en el propio robot y la máquina aprende a imitarlas. Si bien esto ayuda, es lento, costoso y a menudo pasa por alto los momentos específicos donde es más probable que el robot falle, porque el robot solo aprende de los ejemplos que se le dieron, no de los errores que comete mientras intenta resolver el problema por su cuenta.

Un equipo de investigadores ha desarrollado un nuevo enfoque llamado HIL-UMI que cambia la forma en que los robots aprenden de los humanos, eliminando la necesidad de que el robot esté presente durante la fase de entrenamiento. En lugar de observar a un robot luchar y luego corregirlo, este método utiliza un dispositivo portátil y manual que parece una pinza robótica pero que es sostenido por un operador humano. El operador realiza la tarea con este dispositivo mientras un programa informático, que ejecuta el "cerebro" actual del robot, observa la misma transmisión de video e intenta adivinar qué hará el humano a continuación. El sistema no mueve al robot; simplemente compara los movimientos reales del humano con sus propias predicciones. Cuando el humano hace algo que la computadora no esperaba, el sistema marca ese momento como una oportunidad de aprendizaje y lo registra. Esto permite que el robot aprenda de sus propios puntos ciegos sin tener que intentar físicamente la tarea ni arriesgarse a fallar.

El núcleo de este método consiste en un bucle continuo de observación y refinamiento. A medida que el humano demuestra una tarea, la computadora verifica constantemente si sus propias predicciones coinciden con las acciones del humano. Si la suposición de la computadora es muy diferente de lo que el humano está haciendo, el sistema sabe que está en un "punto ciego": una situación que el robot no comprende bien. En ese punto, se le pide al humano que continúe la demostración y el sistema guarda ese segmento específico de datos. Los investigadores también añadieron una segunda capa de inteligencia: una forma de juzgar qué tan bien progresa la tarea. Si el sistema piensa que la tarea va mal, incluso si el humano se está moviendo correctamente, registra ese momento para ayudar a la computadora a aprender cómo juzgar mejor el éxito. Al combinar estos dos tipos de datos, el robot no solo aprende qué hacer, sino qué acciones son más útiles para terminar el trabajo.

Para probar esta idea, los investigadores la aplicaron a cuatro tareas distintas del mundo real utilizando un brazo robótico estándar. Las tareas variaron desde doblar una toalla y limpiar una mesa hasta apilar cubos y estampar un papel con alta precisión. En cada caso, el robot comenzó con un conjunto básico de instrucciones y luego pasó por varias rondas de entrenamiento utilizando el nuevo método manual. Los resultados mostraron una mejora clara sobre los métodos tradicionales. Mientras que las técnicas de entrenamiento estándar a menudo alcanzan un techo donde añadir más datos no ayuda, el nuevo método permitió que el robot mejorara consistentemente con cada ronda de entrenamiento. El robot aprendió a manejar secuencias de acciones largas y complicadas, así como movimientos delicados y precisos, de manera más efectiva que antes.

Uno de los hallazgos más sorprendentes fue la velocidad con la que este nuevo método recopila información útil. Los métodos tradicionales que requieren que un robot se mueva físicamente y sea corregido por un humano son lentos y difíciles de escalar. En contraste, se encontró que el enfoque manual es más de cinco veces más rápido en la recopilación de los datos necesarios. Esto se debe a que el operador humano puede mover el dispositivo libremente sin esperar a que un robot se reinicie o a que un humano intervenga físicamente en una máquina pesada. El sistema identificó con éxito los momentos exactos en los que el robot necesitaba ayuda, centrando el entrenamiento en las partes más difíciles de la tarea en lugar de perder tiempo en las partes que el robot ya comprendía.

El estudio sugiere que este enfoque ofrece un camino escalable para enseñar nuevas habilidades a los robots en diferentes ubicaciones y por diferentes personas. Debido a que el entrenamiento ocurre en un dispositivo manual, múltiples operadores podrían potencialmente recopilar datos simultáneamente en diferentes lugares, alimentando todos al mismo proceso de aprendizaje del robot. Los investigadores descubrieron que, al centrarse en las brechas específicas del conocimiento del robot y utilizar un sistema que recompensa el progreso, pudieron crear un robot que es más confiable y eficiente. Este trabajo apunta hacia un futuro donde los robots puedan adaptarse a nuevos entornos de manera rápida y segura, sin la necesidad de pruebas físicas repetitivas, costosas y lentas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →