← Últimos artículos
💻 computer science

HumanCLAW: Can Vision-Language Models Act Through a Body?

Este artículo presenta HumanCLAW, un marco que desacopla la toma de decisiones de los modelos de visión y lenguaje de la ejecución motora para evaluar la inteligencia encarnada, revelando que los modelos actuales fallan en tareas físicas de largo alcance principalmente debido a una falta de autoconciencia encarnada más que a la capacidad de reconocimiento.

Autores originales: Siyao Li, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng Tang, Po-Chen Wu, Ivan Shugurov, Lingni Ma, Michael Zollhoefer, Sizhe An, Abhay Mittal, Amy Zhao, Ranjay Krishna, Manling Li
Publicado 2026-07-30
📖 4 min de lectura☕ Lectura para el café

Autores originales: Siyao Li, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng Tang, Po-Chen Wu, Ivan Shugurov, Lingni Ma, Michael Zollhoefer, Sizhe An, Abhay Mittal, Amy Zhao, Ranjay Krishna, Manling Li, Ziwei Liu, Chuan Guo

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot brillante y superinteligente a jugar a un videojuego. Pero este no es un juego cualquiera; es un juego donde el robot tiene que controlar un cuerpo físico real que puede tropezar, caerse, chocar contra las paredes y volcar jarrones. En el mundo de la inteligencia artificial, existen dos tipos principales de "cerebros" para los robots. Un tipo es como un piloto que se ha memorizado millones de rutas de vuelo específicas; es excelente haciendo exactamente lo que ha visto antes, pero si el viento sopla de forma diferente, podría estrellarse. El otro tipo es un "Modelo de Visión y Lenguaje" (VLM). Piensa en esto como un robot con una biblioteca masiva de libros y una cámara por ojos. Puede leer una historia, mirar una imagen y comprender ideas complejas como "busca el sofá rojo y siéntate en él". Es increíble razonando y hablando, pero nunca ha movido un cuerpo antes.

La gran pregunta que los científicos se están haciendo ahora es: ¿Puede este robot con mucha cultura teórica hacer cosas en el mundo real? ¿Puede tomar una idea de alto nivel como "ve a la cocina" y convertirla en los minúsculos movimientos musculares de una fracción de segundo necesarios para caminar sin caerse? Normalmente, cuando un robot falla, es difícil saber si el "cerebro" tomó una mala decisión (como caminar hacia una pared) o si el "cuerpo" simplemente no pudo hacer el trabajo (como perder el equilibrio). Para resolver este misterio, los investigadores necesitaban una forma de separar el pensar del mover, para poder ver exactamente dónde se quedaba atascado el cerebro del robot.

Aquí es donde entra en juego un nuevo estudio llamado HumanCLAW. Los investigadores construyeron un campo de pruebas especial para ver si estos cerebros de IA inteligentes podían controlar un cuerpo de apariencia humana en un mundo físico. No entrenaron a la IA para moverse; solo le dieron una cámara, una meta y una lista de movimientos básicos como "caminar hacia adelante", "girar" o "sentarse". Luego, dejaron que la IA intentara navegar a través de 41 casas virtuales diferentes para encontrar objetos y sentarse en ellos.

Los resultados fueron un golpe de realidad. Incluso los modelos de IA más inteligentes y avanzados de la actualidad fallaron casi todas las veces. El mejor modelo solo tuvo éxito en aproximadamente el 16,8% de los intentos. Eso significa que falló más del 83% de las veces.

Aquí está la parte extraña: la IA no estaba fallando porque fuera "ciega". Cuando el objeto objetivo (como un sofá) aparecía realmente en la pantalla, la IA casi siempre lo reconocía. Sabía lo que estaba mirando. El problema no era la visión; era saber dónde estaba.

Los investigadores descubrieron que estos modelos de IA sufren un caso severo de "amnesia corporal". Son como un fantasma que puede ver perfectamente los muebles, pero no tiene idea de dónde están sus propias piernas. Cuando la IA intentaba caminar, a menudo seguía caminando incluso después de haber llegado al sofá, o se detenía demasiado pronto, pensando que había llegado cuando todavía estaba lejos. Cuando intentaba sentarse, a menudo simplemente bajaba su cuerpo al aire vacío, sentándose en la nada porque no se daba cuenta de que el sofá no estaba directamente debajo de ella. También caminaba directamente hacia las paredes o tropezaba con obstáculos sin siquiera darse cuenta de que los había golpeado.

El estudio muestra que, aunque estos modelos de IA son increíbles describiendo el mundo, son terribles entendiendo su propio lugar en él. Pueden decirte cómo es una silla, pero no pueden averiguar cómo sentarse en ella sin caerse. Los investigadores concluyen que, para hacer robots que realmente puedan actuar en el mundo real, no solo necesitamos enseñarles a ver, sino a "sentir" dónde está su cuerpo y cómo interactúa con el mundo que los rodea. Hasta que no resolvamos este problema de la "autoconciencia corporal", incluso los cerebros de IA más inteligentes seguirán siendo fantasmas torpes en una máquina física.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →