← Últimos artículos
💻 computer science

3D Primitives are a Spatial Language for VLMs

Este artículo introduce primitivas geométricas 3D expresadas en código como un lenguaje espacial potente para Modelos Visión-Lenguaje, demostrando mediante el benchmark SpatialBabel, la estrategia de inferencia Code-CoT sin entrenamiento y el método de ajuste fino auto-supervisado S3^{3}-FT que esta representación intermedia mejora significativamente el razonamiento espacial y se generaliza a través de diversas arquitecturas de VLM sin requerir etiquetas humanas.

Autores originales: Junze Liu, Kun Qian, Florian Dubost, Kai Zhong, Arvind Srinivasan, Nan Chen, Anping Wang, Sam Zhang, Alejandro Mottini, Qingjun Cui, Tian Wang

Publicado 2026-05-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Junze Liu, Kun Qian, Florian Dubost, Kai Zhong, Arvind Srinivasan, Nan Chen, Anping Wang, Sam Zhang, Alejandro Mottini, Qingjun Cui, Tian Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un robot muy inteligente y artístico que puede mirar una foto de una habitación y describírtela. Pero aquí está lo extraño: si le preguntas a este robot, "¿Cuántas sillas hay en esta foto?", podría adivinar mal y decir "cinco" cuando solo hay tres. Parece confundido.

Sin embargo, si le pides a ese mismo robot que escriba un programa informático para construir esa habitación exacta usando formas simples (como cubos, esferas y cilindros), lo hace de manera fantástica. Escribe un código que coloca exactamente tres cubos en los lugares correctos. Conoce la respuesta perfectamente, pero simplemente no puede decirlo en inglés sencillo.

Este artículo, titulado "Los primitivos 3D son un lenguaje espacial para los VLM", explora esta extraña contradicción y la utiliza para hacer que estos robots sean más inteligentes.

Aquí tienes el desglose de su descubrimiento y solución, usando analogías simples:

1. El Problema: El Robot "Bilingüe"

Los investigadores descubrieron que los Modelos de Lenguaje y Visión (VLM) son como personas que son fluidas en un lenguaje secreto (código) pero luchan con un lenguaje común (inglés) cuando se trata del espacio.

  • La Paradoja: El robot puede construir un modelo 3D perfecto de una escena usando código (como instrucciones de LEGO), pero si le haces una pregunta simple sobre esa misma escena, alucina (inventa cosas).
  • La Prueba (SpatialBabel): Crearon una prueba gigante llamada SpatialBabel. Imagina darle al robot la misma foto y pedirle que la reconstruya usando seis "idiomas" diferentes (como Three.js, Unity o incluso un formato JSON especial).
  • La Sorpresa: El rendimiento del robot variaba enormemente dependiendo de qué idioma tenía que usar. En un idioma, era un maestro constructor; en otro, un aficionado torpe. Esto demostró que el "cerebro espacial" del robot estaba enredado con sus "hábitos de codificación".

2. La Primera Solución: "Code-CoT" (Pensar en Código Primero)

Dado que el robot es mejor escribiendo código que respondiendo preguntas, los investigadores probaron un nuevo truco llamado Code-CoT (Cadena de Pensamiento en Código).

  • La Analogía: Imagina que estás intentando resolver un problema matemático de palabras complicado. En lugar de intentar adivinar la respuesta inmediatamente, primero escribes la ecuación en un papel. Una vez que la ecuación está escrita, la respuesta se vuelve obvia.
  • Cómo funciona: Cuando se le hace una pregunta como "¿Está el cubo rojo a la izquierda de la esfera azul?", se obliga al robot a escribir primero el código para construir la escena. Una vez escrito el código, el robot "lee" su propio código para encontrar la respuesta.
  • El Resultado: Esto funcionó como un encanto para los robots que ya eran buenos codificando. Aumentó significativamente su precisión porque los obligó a usar su fuerte "cerebro de código" para resolver la "pregunta en inglés".

3. La Segunda Solución: "S3-FT" (El Robot que se Enseña a Sí Mismo)

¿Qué pasa con los robots que aún no son buenos codificando? No pueden usar el truco de "escribir código primero" porque su código es desordenado.

Los investigadores inventaron un método llamado S3-FT (Ajuste Fino Espacial Auto-supervisado).

  • La Analogía: Imagina a un estudiante que es malo dibujando. En lugar de contratar a un profesor, el estudiante dibuja una imagen, luego mira inmediatamente su propio dibujo para ver qué hizo bien y mal, y luego intenta dibujarlo de nuevo. Es su propio profesor.
  • Cómo funciona:
    1. El robot mira una imagen simple de formas geométricas (cubos, esferas).
    2. Intenta escribir código para reconstruir esa imagen.
    3. Los investigadores toman ese código y lo convierten automáticamente en una "chuleta" (una lista estructurada de hechos: "Hay un cubo rojo en la posición X").
    4. Le devuelven esta chuleta al robot como una lección, enseñándole a responder preguntas correctamente basándose en su propio código.
  • El Resultado: El robot aprendió a entender el espacio sin ningún profesor humano ni etiquetas costosas. Tomó el "conocimiento espacial" que tenía oculto dentro de su capacidad de codificación y lo transfirió a sus habilidades generales de conversación.

4. La Gran Conclusión

El artículo concluye que las formas geométricas 3D (primitivos) expresadas en código actúan como un "traductor universal" para estos robots.

  • Como Herramienta de Diagnóstico: Si un robot falla al responder una pregunta espacial pero tiene éxito escribiendo código, sabemos que el problema no es que "no vea" los objetos; es simplemente que no puede traducir su visión a palabras.
  • Como Vocabulario: Al obligar al robot a pensar en términos de "cubos, esferas y cilindros" a través del código, le damos un vocabulario estructurado para entender el mundo.

En resumen: Los investigadores descubrieron que estos modelos de IA saben más sobre el espacio de lo que dejan ver. Al hacerles "hablar" en el lenguaje de los bloques de construcción 3D (código), pueden desbloquear ese conocimiento oculto y responder preguntas simples correctamente, todo sin necesidad de que un humano les enseñe las respuestas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →