← Últimos artículos
💻 computer science

Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

Este artículo presenta Space Tokens, un marco ligero y agnóstico de la modalidad que mejora las capacidades de razonamiento espacial de los modelos de visión y lenguaje mediante la destilación de la geometría 3D y los atributos de los objetos en tokens latentes continuos para el procesamiento de cadena de pensamiento, logrando un rendimiento de vanguardia en evaluaciones de referencia espacial sin requerir módulos adicionales durante la inferencia.

Autores originales: Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai

Publicado 2026-08-12
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a navegar por una sala de estar desordenada. Le muestras una foto de un sofá, una mesa de centro y un gato. Un robot básico podría decir: "Veo un sofá". Pero para poder recoger un juguete sin volcar la mesa, el robot necesita saber mucho más: ¿Qué tan grande es el sofá? ¿A qué distancia está de la pared? ¿El gato está sentado sobre la mesa o debajo de ella? Esta es la diferencia entre simplemente ver y realmente comprender el espacio. En el mundo de la inteligencia artificial, esto se llama "inteligencia espacial". Durante mucho tiempo, las computadoras fueron excelentes reconociendo objetos, pero pésimas para entender cómo esos objetos encajan entre sí en un espacio 3D. Para solucionar esto, los científicos han intentado dos cosas principales: o hacer que el cerebro de la computadora (el modelo) sea enorme y costoso, o añadir herramientas especiales de alta potencia solo para medir distancias. Ambos métodos funcionan, pero son lentos y pesados.

Ahora, un equipo de investigadores ha ideado un truco ingenioso llamado "Space Tokens" (Tokens Espaciales). Piensa en un modelo de IA estándar como un estudiante haciendo un examen. Normalmente, si el estudiante necesita saber cómo medir una habitación, tiene que traer un transportador y una cinta métrica (herramientas extra) o memorizar una enciclopedia masiva de geometría (un cerebro gigante). Este nuevo artículo sugiere un enfoque diferente: ¿qué pasaría si el estudiante pudiera simplemente pensar en medidas? Los investigadores descubrieron una forma de enseñar a la IA a crear "notas mentales" invisibles dentro de su propio proceso de pensamiento. Estas notas, o "tokens", actúan como pequeños susurros continuos de geometría que la IA puede usar para razonar sobre el tamaño, la distancia y la forma sin necesidad de herramientas adicionales ni de un cerebro más grande. Es como darle a la IA un sentido del espacio integrado que puede usar mientras habla, haciéndola más inteligente respecto al mundo físico sin ralentizarla.

El Problema: Cerebros Grandes vs. Herramientas Pesadas

Imagina que tienes un amigo muy inteligente que es excelente describiendo imágenes. Le muestras una foto de una cocina y te puede decir: "Eso es una nevera y eso es un tostador". Pero si le preguntas: "¿Puedo meter una caja de pizza gigante entre la nevera y el tostador?", podría equivocarse porque no "siente" realmente el espacio.

Para solucionar esto, los científicos han intentado dos caminos principales. El primero es el "escalado", que es como decirle al amigo que lea todos los libros de la biblioteca y memorice cada posible disposición de una habitación. Esto funciona, pero requiere un cerebro masivo que tarda una eternidad en ejecutarse. El segundo camino son las "herramientas especializadas", que es como darle al amigo un medidor láser y un escáner 3D cada vez que mira una foto. Esto es preciso, pero es lento, costoso, y el amigo no puede usarlo si tiene prisa o si las herramientas no están disponibles.

Los autores de este artículo se hicieron una pregunta simple: ¿Podemos enseñar al amigo a simplemente "conocer" el espacio en su cabeza, sin necesidad de la biblioteca o del medidor láser?

La Solución: Space Tokens

Los investigadores introdujeron un método llamado Space Tokens. En lugar de añadir hardware nuevo o hacer que el modelo de IA sea enorme, enseñaron a la IA a generar "tokens" especiales (que son solo pequeñas piezas de datos) que representan el espacio 3D.

Piensa en estos tokens como notas adhesivas invisibles que la IA pega en sus propios pensamientos.

  1. Notas a nivel de escena: Algunas notas describen toda la habitación. Capturan la forma del suelo, la posición de las paredes y la profundidad de la habitación.
  2. Notas a nivel de objeto: Otras notas describen artículos específicos. Contienen información sobre dónde está un objeto, qué tan grande es y hacia qué dirección está orientado.

La magia es que estas notas son "continuas", lo que significa que no son solo etiquetas simples como "grande" o "pequeño". Son como coordenadas y medidas precisas que la IA puede usar para hacer matemáticas en su cabeza. La IA aprende a crear estas notas observando ejemplos de un modelo "maestro" (un sistema de reconstrucción 3D muy inteligente) y luego practicando hasta que puede hacerlo por su cuenta.

Cómo Enseñaron a la IA

El entrenamiento ocurrió en tres etapas, como un videojuego con tres niveles:

  • Nivel 1: Aprendiendo el lenguaje del espacio. Se le mostró a la IA imágenes y se le enseñó a generar las "notas adhesivas" (tokens) que coinciden con la geometría 3D de la escena. Aprendió a alinear sus pensamientos internos con las formas 3D precisas del mundo.
  • Nivel 2: Pensar con las notas. Una vez que la IA supo cómo hacer las notas, le enseñaron a usarlas para responder preguntas. La obligaron a mirar las notas y decir: "Debido a que la nevera está a 2 metros, la caja de pizza no cabrá". Esto se llama razonamiento de "Cadena de Pensamiento" (Chain-of-Thought), pero ahora los pensamientos incluyen datos espaciales.
  • Nivel 3: Mejorar con la práctica. Finalmente, utilizaron una técnica de Aprendizaje por Refuerzo. La IA intentaba responder preguntas y, si acertaba el tamaño o la distancia, recibía una "recompensa". Si se equivocaba, aprendía del error. Esto ayudó a la IA a ser aún más aguda en el uso de sus notas espaciales.

Qué Encontraron

Los resultados fueron impresionantes. Los investigadores probaron su nuevo método en un benchmark llamado VSI-Bench, que es una prueba difícil de comprensión espacial.

  • Cuando aplicaron esto a un modelo llamado Qwen3-VL-8B, la puntuación aumentó un 4.3%.
  • Cuando lo aplicaron a un modelo más fuerte llamado SenseNova-SI-1.3, la puntuación aumentó un 1.3%.

Pero la verdadera victoria estuvo en tareas específicas. El nuevo método se convirtió en el mejor del mundo adivinando el tamaño de los objetos (acertando el 79.2% de las veces) y el tamaño de las habitaciones (acertando el 75.7% de las veces). Estas son tareas que normalmente requieren herramientas 3D pesadas, pero este método lo hizo solo usando sus "notas adhesivas" internas.

Por Qué Esto Importa

La parte más emocionante es que la IA no necesitó cambiar su cerebro ni cargar con herramientas extra. Simplemente aprendió a pensar de manera diferente. Los investigadores también demostraron que estas "notas adhesivas" son reales. Pudieron decodificarlas de nuevo en formas 3D y ver que la IA realmente había aprendido la geometría de la habitación. No estaba solo adivinando; tenía una comprensión genuina del espacio.

Esto sugiere que no necesitamos construir modelos de IA más grandes, más lentos o más caros para que sean espacialmente inteligentes. Solo necesitamos enseñarles cómo crear y usar estas notas espaciales internas. Es una forma más ligera, rápida y flexible de dar a las máquinas la capacidad de navegar por nuestro mundo 3D, lo cual es un gran paso adelante para cosas como robots que necesitan moverse por nuestras casas o coches que necesitan conducir de forma segura.

En resumen, el artículo muestra que al darle a la IA una forma de "pensar en 3D" usando simples tokens internos, podemos hacer que sea mucho mejor comprendiendo el mundo físico sin hacerla más pesada o lenta. Es un pequeño cambio en cómo piensa la IA lo que conduce a un gran salto en lo que puede hacer.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →