← Últimos artículos
💻 computer science

SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification

El artículo presenta SEER, una interfaz de inferencia en tiempo de ejecución sin entrenamiento para modelos de visión y lenguaje congelados que mejora la clasificación de relaciones espaciales mediante la construcción de vistas de evidencia específicas para la consulta con roles de sujeto/objeto explícitos y un contexto geomético complementario, reduciendo así significativamente los errores causados por vistas globales ambiguas o una selección incorrecta de instancias.

Autores originales: Feixiang Liu, Likun Wang, Qiang Qiu, Hui Xu, Huawei Shen, Xueqi Cheng

Publicado 2026-08-05
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Feixiang Liu, Likun Wang, Qiang Qiu, Hui Xu, Huawei Shen, Xueqi Cheng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un rompecabezas donde dos piezas deben encajar perfectamente. En el mundo de la inteligencia artificial, existen los "Modelos de Visión y Lenguaje" (VLM, por sus siglas en inglés)—cerebros informáticos superinteligentes que pueden mirar una imagen y leer una pregunta sobre ella. Son excelentes reconociendo objetos; si les muestras una foto de un gato y un perro, saben cuál es cuál. Pero aquí está la parte difícil: cuando les preguntas, "¿Está el gato a la izquierda del perro?", a veces se confunden. Pueden reconocer correctamente a los animales, pero confunden sus posiciones, o adivinan basándose en lo que han leído en libros en lugar de lo que realmente ven. Esto es como un estudiante que conoce las definiciones de "izquierda" y "derecha", pero sigue señalando la dirección equivocada al mirar un mapa. A los científicos les importa solucionar esto porque, si estos cerebros de IA no pueden entender las relaciones espaciales, no pueden ayudarnos con cosas como conducir coches, navegar con robots o leer diagramas complejos de forma segura.

Entra SEER, un truco ingenioso para estos cerebros de IA que no requiere enseñarles nada nuevo. Piensa en SEER como un sistema de "foco y etiqueta". En lugar de dejar que la IA contemple toda la imagen desordenada y adivine, SEER primero encuentra silenciosamente los dos elementos específicos de los que trata la pregunta (como el gato y el perro). Luego, crea una vista especial, con zoom, solo para esos dos elementos. Dibuja un cuadro rojo alrededor del sujeto y un cuadro azul alrededor del objeto, etiquetándolos claramente como "Sujeto" y "Objeto". Oculta las posibles respuestas (como "izquierda" o "derecha") durante este paso para que la IA no dependa de las opciones de respuesta para decidir hacia dónde mirar. Al obligar a la IA a concentrarse en una vista limpia y etiquetada de solo esos dos elementos, SEER ayuda a la IA a tomar una decisión mucho mejor. Los investigadores descubrieron que este método simple de "reenfocar y etiquetar" hizo que la IA fuera significativamente mejor para acertar las relaciones espaciales, mejorando su precisión aproximadamente un 4% de media en diferentes pruebas.

El Problema: El "Gran Desenfoque" de la IA

Imagina que estás en una habitación llena de gente y alguien te pregunta: "¿Está la persona con el sombrero rojo de pie a la izquierda de la persona con la camiseta azul?". Si solo echas un vistazo a toda la habitación, podrías equivocarte. Tal vez ves un sombrero rojo en el extremo izquierdo y una camiseta azul en el extremo derecho, pero las personas específicas de las que habla la pregunta están en realidad una al lado de la otra en el centro.

Los modelos de IA actuales suelen cometer este mismo error. Pueden ver los objetos, pero se pierden en la "vista global" de la imagen. Pueden depender de lo que creen que suele suceder (como "los gatos suelen estar a la izquierda") en lugar de comprobar realmente los lugares específicos en la imagen. Esto se llama una "alucinación" o un "fallo de anclaje" (failure to ground) de la respuesta en la evidencia visual adecuada. El artículo argumenta que el problema no es que la IA sea demasiado tonta para entender "izquierda" o "derecha", sino que está mirando la parte equivocada de la imagen o se confunde con demasiado ruido de fondo.

La Solución: La Linterna "Auto-Anclada" de SEER

Los autores de este artículo, trabajando en el Instituto de Tecnología de la Computación en China, idearon un método llamado SEER (Razonamiento de Evidencia Auto-Anclada para Entidades-Relación). Es como darle a la IA una linterna y un par de resaltadores, pero con una regla muy estricta: No mires la clave de respuestas todavía.

Así es como funciona SEER, paso a paso:

  1. La Búsqueda "Ciega": Cuando la IA recibe una pregunta como "¿Está la taza a la izquierda del libro?", SEER primero le pide a la IA que encuentre la taza y el libro en la imagen. Crucialmente, oculta las posibles respuestas (izquierda, derecha, arriba, abajo) durante esta búsqueda. Esto evita que la IA dependa de la palabra "izquierda" y luego simplemente encuentre una taza en el lado izquierdo de la imagen, independientemente de dónde esté realmente el libro.
  2. La Vista con "Zoom": Una vez que la IA encuentra la taza y el libro, SEER recorta una pequeña imagen que contiene solo esos dos elementos. Dibuja un cuadro rojo alrededor de la taza (el sujeto) y un cuadro azul alrededor del libro (el objeto). Los etiqueta claramente.
  3. La Verificación de "Rol Explícito": Ahora, la IA mira esta imagen limpia y con zoom. Ve: "Vale, el cuadro rojo es la taza, el cuadro azul es el libro. Ahora, ¿está el cuadro rojo a la izquierda del cuadro azul?". Debido a que el fondo ha desaparecido y los roles están etiquetados, es mucho menos probable que la IA se confunda.
  4. La "Doble Verificación" (Opcional): A veces, la IA aún podría no estar segura. SEER tiene un truco ingenioso llamado "consistencia recíproca". Intercambia los roles: "Vale, ahora finge que el libro es el sujeto y la taza es el objeto. ¿Está el libro a la derecha de la taza?". Si la respuesta de la IA tiene sentido en ambas direcciones (si A está a la izquierda de B, entonces B debe estar a la derecha de A), confirma la respuesta. Si las respuestas se contradicen, sabe que algo va mal e intenta de nuevo.

Lo que Mostraron los Experimentos

Los investigadores probaron este método en varios conjuntos de datos diferentes, que son como colecciones gigantes de pares de imagen y pregunta. Utilizaron un conjunto de prueba "congelado", lo que significa que eligieron las preguntas de prueba antes de comenzar a ejecutar los experimentos, para que no pudieran ajustar accidentalmente su método para simplemente memorizar las respuestas.

  • La Gran Victoria: En un conjunto de pruebas llamado GQA-Train900 (que tiene 900 imágenes únicas), SEER mejoró la precisión de la IA en un +3.94% en comparación con el simple hecho de mirar la imagen completa. Eso puede parecer poco, pero en el mundo de los benchmarks de IA, un salto de casi un 4% es algo enorme. Significa que la IA acertó casi 40 preguntas más de cada 1,000.
  • Diferentes Modelos, El Mismo Éxito: Probaron esto en diferentes tipos de cerebros de IA (como Qwen3 e InternVL3.5). Todos ellos mejoraron. Por ejemplo, en un test diferente llamado EmbSpatial, un modelo mejoró un masivo +11.79%.
  • Por qué Funciona: Los investigadores realizaron pruebas especiales para averiguar por qué funcionaba. Descubrieron que la magia no era solo "hacer zoom" (recortar la imagen). Eran las etiquetas. Cuando recortaban la imagen pero no etiquetaban cuál era el sujeto y cuál era el objeto, la IA no mejoraba tanto. Las etiquetas claras de "Cuadro Rojo = Sujeto" y "Cuadro Azul = Objeto" fueron la clave. Obligaron a la IA a prestar atención a los roles específicos de los objetos.
  • Lo que No Arregló: El método no es perfecto. Le costó un poco con la palabra "sobre" (como "la taza está sobre la mesa") porque "sobre" es difícil de distinguir de simplemente estar "encima" sin profundidad 3D. También no ayudó tanto cuando la IA tenía que adivinar "verdadero" o "falso" en preguntas binarias, lo que sugiere que el truco funciona mejor cuando hay opciones específicas para elegir.

La Conclusión

SEER demuestra que no siempre necesitas construir una IA más grande, más inteligente o más cara para resolver un problema. A veces, solo necesitas cambiar cómo le presentas el problema a la IA. Al ocultar las opciones de respuesta durante la búsqueda y luego presentar una vista limpia y etiquetada de solo los objetos relevantes, la IA puede dejar de adivinar y empezar a ver.

Los autores advierten que esto no es una varita mágica que resuelve todos los problemas espaciales. La IA todavía necesita ser buena encontrando los objetos en primer lugar. Pero cuando los objetos son encontrados, SEER actúa como un guía útil, asegurándose de que la IA mire lo correcto de la manera correcta. Es un recordatorio de que, en la carrera por una IA más inteligente, a veces la mejor actualización es una mejor interfaz.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →