← Últimos artículos
🤖 machine learning

REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs

REFAC-VLA es un marco de trabajo de vigilia/sueño que aprende programas motores reutilizables y tipados mediante el agrupamiento de fragmentos de acción a través de un núcleo de equivalencia conductual y un modelo de mundo latente, logrando un rendimiento de vanguardia en tareas LIBERO de largo horizonte mediante un decodificador condicionado por una biblioteca y un objetivo de entrenamiento que prioriza la calidad del agrupamiento sobre la capacidad del modelo.

Autores originales: Riyaaz Shaik, Chandru Venkataraman

Publicado 2026-09-02
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Riyaaz Shaik, Chandru Venkataraman

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los robots están mejorando en su capacidad para ver el mundo y moverse a través de él, pero todavía tienen dificultades con el tipo de tareas complejas y de múltiples pasos que los humanos manejan con facilidad. Cuando una persona prepara un sándwich, no piensa en cada uno de los espasmos musculares necesarios para agarrar el pan, untar la mantequilla o cortar el tomate. En su lugar, confía en una biblioteca mental de acciones familiares —agarrar, untar, cortar— que puede encadenar en diferentes órdenes. Los modelos actuales de inteligencia artificial para robots suelen carecer de esta capacidad para organizar el comportamiento. Tienden a generar comandos brutos, momento a momento, sin agruparlos en habilidades reutilizables y bien definidas. Esto dificulta que puedan planificar con antelación tareas largas o que expliquen lo que han aprendido. Los investigadores están intentando ahora enseñar a las máquinas a construir sus propias bibliotecas internas de habilidades, permitiéndoles descomponer trabajos complicados en piezas más pequeñas y manejables que puedan ser reutilizadas y combinadas.

Un equipo de investigadores de Apple ha desarrollado un nuevo sistema llamado REFACTOR-VLA que intenta resolver este problema enseñando a un robot a descubrir sus propias habilidades sin etiquetas humanas. El sistema funciona en dos fases alternas, de forma muy parecida a como un humano podría practicar un nuevo movimiento y luego descansar para dejar que el cerebro organice la memoria. En la primera fase, el robot aprende a predecir qué sucederá después si realiza una cierta secuencia de movimientos. Construye un modelo mental del mundo, comprendiendo cómo sus acciones cambian el entorno. En la segunda fase, el sistema analiza la vasta cantidad de datos de movimiento que ha recolectado e intenta encontrar patrones. Se plantea una pregunta simple pero difícil: ¿producen dos secuencias de movimientos diferentes el mismo resultado? Si un robot mueve su brazo en un círculo para recoger una taza, o mueve su brazo en línea recta para hacer lo mismo, el sistema necesita reconocer que ambos caminos logran el mismo objetivo.

Para responder a esto, los investigadores crearon una herramienta especial que mide el resultado de las acciones en lugar de solo su apariencia. En lugar de mirar el video bruto del robot moviéndose, el sistema simula la acción en su modelo mental aprendido para ver dónde termina el robot y qué recompensa obtiene. Si dos caminos de movimiento distintos conducen al mismo estado final y a la misma recompensa, el sistema los trata como equivalentes. Luego, agrupa estos caminos similares en una única habilidad reutilizable. Una vez que se forma un grupo, el sistema intenta escribir un programa simple y estructurado que describa el patrón común de esa habilidad. Este programa se añade entonces a una biblioteca. El robot puede usar esta biblioteca más tarde para planificar nuevas tareas, recurriendo a estas habilidades preempaquetadas en lugar de calcular cada pequeño movimiento desde cero.

Los investigadores probaron este enfoque en un conjunto estándar de tareas robóticas que involucran el movimiento de objetos en un entorno simulado. Descubrieron algo sorprendente sobre cómo aprenden estos sistemas. Una creencia común en la inteligencia artificial es que hacer un modelo más grande y complejo siempre conduce a un mejor rendimiento. Sin embargo, cuando los investigadores aumentaron el tamaño de su modelo de mundo de aproximadamente 188 millones de parámetros a 430 millones, el sistema funcionó peor en todas las pruebas. El modelo más grande no logró organizar las habilidades correctamente, lo que sugiere que simplemente añadir más potencia de cómputo no es la solución.

En cambio, la clave del éxito residía en cómo se entrenaba el modelo. Los investigadores descubrieron que añadir un tipo específico de objetivo de aprendizaje durante la fase inicial de entrenamiento mejoraba drásticamente los resultados. Este objetivo ayudó al sistema a distinguir entre diferentes tareas de manera más clara, permitiéndole agrupar movimientos similares de manera mucho más efectiva. Con este cambio, el sistema superó a los métodos más fuertes existentes en las cuatro principales suites de pruebas, mejorando su puntuación promedio por un margen significativo. El sistema construyó con éxito una biblioteca de tres habilidades distintas y reutilizables para una tarea específica, y un robot que utilizaba esta biblioteca fue capaz de reescribir cada una de las demostraciones que había visto utilizando estas nuevas habilidades.

El estudio también reveló que la capacidad del sistema para encontrar estas habilidades depende en gran medida del tipo de datos que analiza. Si bien el sistema creó con éxito una biblioteca de instrucciones basadas en el lenguaje, tales como "recoger el objeto y colocarlo en la cesta", falló al intentar encontrar patrones reutilizables en los comandos motores brutos en sí mismos. Esto sugiere que el sistema es mejor comprendiendo los objetivos de alto nivel de una tarea que los detalles físicos de bajo nivel de cómo moverse. Los investigadores midieron la consistencia de sus resultados a través de muchas ejecuciones de entrenamiento diferentes y encontraron que el sistema descubría de manera fiable agrupaciones de habilidades similares, con un alto grado de acuerdo entre diferentes versiones del modelo.

Este trabajo demuestra que la forma en que un robot organiza sus experiencias es más importante que el tamaño bruto de su cerebro. Al centrarse en los resultados de las acciones y utilizar un método estructurado para agruparlas, el sistema puede construir una biblioteca de habilidades que le ayuda a abordar tareas complejas y de larga duración. El sistema puede construir una biblioteca de habilidades que le ayuda a abordar tareas complejas y de largo plazo. Los hallazgos desafían la idea de que más grande es siempre mejor y apuntan hacia un futuro donde los robots puedan aprender a pensar en términos de acciones reutilizables, tal como hacen los humanos. Los investigadores han puesto su código y sus datos a disposición de los demás, permitiendo que otros verifiquen estos resultados y construyan sobre este nuevo enfoque de aprendizaje robótico.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →