← Últimos artículos
💻 computer science

SWIM: Vision-Language-Grounded Soft Whole-Body Interactive Manipulation

SWIM es un marco de trabajo basado en visión, lenguaje y anclaje que permite a los robots continuos blandos realizar manipulación interactiva de cuerpo completo compleja mediante la integración de una política VLA basada en difusión con propiocepción visual blanda para generar secuencias de actuación ejecutables que aprovechen la complacencia intrínseca para una ejecución física robusta.

Autores originales: Tingcong Liu, Aye Phyu Phyu Aung, Junjie Xiong, Siyi Ma, Bo An, Ke Wu, Senthilnath Jayavelu

Publicado 2026-09-16
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tingcong Liu, Aye Phyu Phyu Aung, Junjie Xiong, Siyi Ma, Bo An, Ke Wu, Senthilnath Jayavelu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la robótica, existe una división clara entre las máquinas construidas con marcos metálicos rígidos y aquellas creadas con materiales suaves y flexibles. Los robots rígidos, como los brazos que se ven en las fábricas de automóviles, se mueven con una certeza precisa y preprogramada, pero tienen dificultades cuando necesitan meterse en espacios estrechos o manipular objetos delicados e irregulares sin aplastarlos. Los robots blandos, por el contrario, están hechos de materiales complacientes que pueden doblarse, estirarse y retorcerse como el tejido vivo. Esta flexibilidad les permite envolverse alrededor de objetos y adaptar su forma a su entorno, ofreciendo una solución potencial para tareas en espacios confinados o para interactuar de forma segura con los humanos. Sin embargo, esta misma flexibilidad crea un nuevo problema: controlar un cuerpo que puede deformarse de innumerables maneras es increíblemente difícil. Cuando un humano da una orden sencilla como "recoge eso", un robot rígido puede calcular una única trayectoria para mover su mano. Un robot blando, con todo su cuerpo capaz de cambiar de forma, tiene que averiguar cómo contorsionar toda su estructura para lograr el mismo objetivo, una tarea que requiere comprender no solo el objeto, sino también la compleja geometría del propio robot en tiempo real.

Investigadores han desarrollado recientemente un nuevo sistema llamado SWIM para resolver este desafío específico, enseñando a un robot blando a comprender el lenguaje y las escenas visuales para realizar manipulación de cuerpo completo. El equipo se centró en un robot con forma de espiral impulsado por cables, similar a cómo los músculos tiran de los huesos, lo que le permite enrollarse, alcanzar y envolverse alrededor de objetos. La dificultad central que abordaron fue que los métodos anteriores a menudo intentaban controlar estos robots centráéndose solo en la punta del brazo, ignorando la forma compleja del resto del cuerpo. Este enfoque fallaba porque la posición de la punta no describe completamente cómo está doblado el resto del robot o cómo está tocando el mundo. Para solucionar esto, los investigadores crearon un sistema de aprendizaje que observa la forma de todo el cuerpo del robot, la escena visual y una instrucción hablada, todo al mismo tiempo. Entrenaron este sistema en un entorno simulado donde el robot podía practicar miles de veces, aprendiendo a predecir una secuencia de movimientos de cables que lograría un objetivo, como guardar un objeto, alcanzar un objetivo o agarrarlo.

Una innovación clave en su método es una técnica que llaman "propiocepción visual suave". En términos sencillos, esto significa que el robot aprende a "ver" la forma de su propio cuerpo a partir de una imagen de cámara, complementando su conocimiento interno de la tensión de los cables. Durante el entrenamiento, el sistema utilizó el vector de longitud de tendón actual como una entrada propioceptiva para comprender su configuración, mientras que también se le mostraron las coordenadas exactas de varios puntos a lo largo del cuerpo del robot en la simulación. Al obligar al modelo computacional a predecir dónde estaban esos puntos, el sistema aprendió a mantener un mapa mental de la geometría del robot. Esto le permitió entender que, para alcanzar un objeto específico, el robot podría necesitar curvar su sección media de manera diferente a como lo haría para guardar algo. Además, en lugar de intentar predecir una única trayectoria perfecta hacia un objetivo, el sistema aprendió a predecir un rango de movimientos exitosos posibles. Esto es crucial porque, con un cuerpo blando, a menudo hay muchas formas diferentes de envolverse alrededor de un objeto, y el sistema necesitaba ser lo suficientemente flexible como para elegir cualquier opción válida en lugar de quedarse estancado en un plan rígido.

Los investigadores probaron este enfoque de dos maneras: primero en una simulación por computadora y luego en el robot físico real. En la simulación, el sistema tuvo un éxito notable, completando tareas de empaquetado el 100% de las veces, alcanzando objetivos el 96% de las veces y agarrando objetos el 88% de las veces. Estos resultados fueron significativamente mejores que otros métodos que no utilizaban la conciencia de la forma del cuerpo o el modelo de predicción flexible. Sin embargo, la verdadera prueba llegó cuando trasladaron el sistema al mundo real. Cuando intentaron ejecutar el cerebro del robot directamente en la máquina física, conectándolo a la cámara y a los motores en tiempo real, el rendimiento cayó dramente. El robot falló al agarrar objetos en el 75% de los intentos, debido principalmente a que los ligeros retrasos en el procesamiento y las diferencias entre la simulación y la realidad causaron que el robot actuara basándose en información desactualizada.

Para superar esto, los investigadores introdujeron una estrategia de despliegue ingeniosa. En lugar de pedirle al robot que piense y reaccione en tiempo real mientras se mueve, hacen que planee toda la secuencia de movimientos en una simulación virtual primero. El robot observa el mundo real, crea un gemelo digital de la escena y luego ejecuta la tarea en su mente, generando una lista completa de comandos. Una vez que esta secuencia completa está lista, el robot la ejecuta sin detenerse a mirar o pensar de nuevo. Debido a que el cuerpo del robot es naturalmente blando y flexible, puede lidiar con pequeños golpes y variaciones de contacto por sí mismo sin necesidad de una corrección constante por computadora. Cuando utilizaron este método de "planificar y luego ejecutar", las tasas de éxito del robot físico se dispararon de nuevo al 100% para el empaquetado, 80% para el alcance y 75% para el agarre. Esto demostró que, al combinar una comprensión profunda de la propia forma del robot con una estrategia que aprovecha su flexibilidad física natural, los robots blandos pueden ser guiados por lenguaje sencillo para realizar tareas complejas de cuerpo completo que antes eran inalcanzables.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →