← Últimos artículos
💻 computer science

GaussVLA: Geometry-Aware Spatial Reasoning for Vision-Language-Action Model

GaussVLA es un modelo de Visión-Lenguaje-Acción basado en Mamba y de eficiencia de parámetros que mejora el razonamiento espacial mediante la introducción de un Tokenizador Espacial Gaussiano para convertir características 2D en tokens gaussianos 3D compactos y un módulo de Cadena de Pensamiento con Conciencia de Profundidad para un razonamiento geométrico estructurado, logrando un rendimiento de vanguardia en el benchmark LIBERO con solo 200 millones de parámetros.

Autores originales: Md Selim Sarowar, Md Tanvir Islam, Sungho Kim, Sangtae Ahn

Publicado 2026-08-27
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Md Selim Sarowar, Md Tanvir Islam, Sungho Kim, Sangtae Ahn

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los robots que pueden aprender a manipular objetos observando a los humanos se han convertido en un objetivo central de la inteligencia artificial moderna. Durante años, los investigadores han dependido de modelos que tratan la vista de una cámara del mundo como una cuadrícula plana de cuadrados de colores, muy parecida a una fotografía digital. Estos modelos son excelentes para reconocer qué objetos están presentes y comprender comandos de lenguaje, pero tienen dificultades para comprender la forma física y la posición de esos objetos en un espacio tridimensional. Ven una taza como un patrón de píxeles, no como un objeto sólido situado sobre una mesa con una altura y orientación específicas. Esta limitación dificulta que los robots realicen tareas que requieren un manejo preciso, como recoger un objeto frágil o navegar por un espacio de trabajo desordenado, porque el robot carece de un verdadero sentido de la geometría.

Para cerrar esta brecha, un equipo de investigadores ha desarrollado un nuevo sistema llamado GaussVLA, diseñado para dar a los robots una comprensión más intuitiva del mundo físico. En lugar de depender de imágenes planas, este sistema convierte los datos visuales en una colección de pequeñas formas tridimensionales que flotan en el espacio, cada una de las cuales porta información sobre dónde está un objeto, qué tamaño tiene y qué tan seguro está el robot de esa información. Al combinar esta comprensión geométrica con una nueva forma de "pensar" a través de problemas espaciales antes de moverse, los investigadores crearon un controlador de robot que es tanto altamente preciso como sorprendentemente pequeño. En las pruebas, este sistema superó a modelos mucho más grandes y complejos, lo que sugiere que dotar a un robot de un mejor sentido del espacio es más importante que simplemente hacer su cerebro más grande.

El núcleo del problema reside en cómo "ven" actualmente los robots. Los sistemas tradicionales descomponen una imagen de la cámara en una larga lista de parches planos, tratando cada parte de la imagen como igualmente importante, independientemente de si es una pared lejana o una herramienta justo frente al robot. Si bien esto funciona para tareas simples, falla cuando el robot necesita juzgar distancias o el ángulo de una superficie. Otros intentos de solucionar esto han consistido en añadir mapas de profundidad, que son esencialmente números únicos que le dicen al robot a qué distancia se encuentra cada píxel. Sin embargo, estos mapas de profundidad a menudo carecen de información sobre la orientación de la superficie o de qué tan confiable es esa medición de distancia, dejando al robot adivinando cuando el entorno cambia.

Los investigadores abordaron esto introduciendo una nueva forma de procesar datos visuales llamada Tokenizador Espacial Gaussiano (Gaussian Spatial Tokenizer). Imagine tomar la imagen plana y elevar cada parche de ella hacia el aire, convirtiéndolo en una pequeña nube 3D difusa. Cada una de estas nubes tiene un punto central, un tamaño y una forma que describe la geometría local del objeto que representa. Crucialmente, el sistema también asigna una puntuación de confianza a cada nube, diciéndole al robot qué tan seguro está de ese fragmento del mundo 3D. Esto permite que el robot se concentre en las partes más fiables de la escena, como el borde de una mesa o el asa de una taza, mientras ignora las áreas inciertas. Esta transformación convierte una imagen plana en un mapa tridimensional estructurado sobre el cual el robot puede razonar.

Una vez que el robot tiene este mapa 3D, aún debe decidir qué hacer. Los sistemas anteriores a menudo intentaban trazar un plan generando una larga lista de pensamientos basados en texto antes de moverse, un proceso que es lento y a menudo está desconectado de la acción física real. El nuevo sistema utiliza un enfoque diferente llamado Cadena de Pensamiento Consciente de la Profundidad (Depth-Aware Chain-of-Thought). En lugar de escribir una larga historia, el robot utiliza un pequeño conjunto de preguntas enfocadas para escanear rápidamente su mapa 3D y extraer las relaciones espaciales más importantes necesarias para la tarea. Se pregunta a sí mismo, por ejemplo, dónde está el objeto objetivo en relación con la mano del robot, y utiliza esa respuesta para guiar su movimiento directamente. Este método no es una generación de texto lenta y paso a paso, sino un proceso de razonamiento rápido y estructurado que ocurre en sincronía con la decisión de movimiento del robot.

Todo el sistema está construido sobre una arquitectura de base conocida como Mamba, la cual está diseñada para procesar la información de manera mucho más rápida y eficiente que los modelos estándar utilizados en la mayor parte de la inteligencia artificial actual. Esta eficiencia es vital porque permite que el robot tome decisiones en tiempo real sin necesidad de una computadora masiva. Los investigadores probaron su sistema en una variedad de tareas simuladas, incluyendo el movimiento de objetos, el apilamiento de bloques y el seguimiento de instrucciones complejas. En estas pruebas, el nuevo sistema alcanzó una tasa de éxito del 93.5 por ciento en un estándar de referencia, superando a otros modelos líderes que son significativamente más grandes. En un conjunto específico de tareas diseñadas para probar el razonamiento espacial, logró una puntuación perfecta del 100 por ciento.

Lo que hace que estos resultados sean particularmente impactantes es el tamaño del sistema. Mientras que muchos de los modelos competidores requieren miles de millones de parámetros para funcionar, este nuevo sistema opera con solo 200 millones de parámetros. Esto significa que es aproximadamente un 97 por ciento más pequeño que algunos de los modelos más grandes en uso actualmente, y aun así realiza mejor las tareas que requieren la comprensión del espacio físico. Los investigadores también probaron el sistema en un brazo robótico real en un laboratorio físico. Incluso ante desafíos del mundo real como el ruido de la cámara y la colocación ligeramente distinta de los objetos, el sistema mantuvo un alto nivel de éxito, demostrando que la comprensión geométrica 3D aprendida en simulación podía transferirse al mundo real.

El estudio también exploró qué sucede cuando el sistema es desafiado con cambios inesperados, como diferentes iluminaciones o colores de objetos. Aunque el sistema mostró una robustez sólida, los investigadores señalaron que todavía enfrenta dificultades cuando el entorno cambia drásticamente, indicando que aún hay trabajo por hacer para lograr que los robots sean adaptables a todos los escenarios posibles del mundo real. Sin embargo, los resultados demuestran claramente que la clave para una mejor manipulación robótica no es solo tener más datos o un modelo más grande, sino dotar al robot de una comprensión tridimensional estructurada del espacio que ocupa. Al convertir las imágenes planas en nubes 3D y utilizar un razonamiento enfocado para navegar por ellas, los investigadores han mostrado un camino claro hacia robots que puedan manejar el mundo físico con mayor destreza y fiabilidad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →