Where To Look? : Causal Tracing of Vision Encoders in VLM
Este artículo emplea el rastreo causal para revelar que los modelos de visión y lenguaje a menudo dependen de tokens visuales fuera de las regiones objetivo y explotan pistas de apariencia para comprender la estructura, exponiendo una brecha fundamental entre sus descripciones de alto rendimiento y la localización espacial o el razonamiento estructural real de la información visual.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
El dilema del detective: ¿Cómo ven realmente los ojos de la IA?
Imagina que estás intentando enseñarle a un robot a entender el mundo. Le das una cámara y un cerebro, y le pides que describa la imagen de un perro. Durante años, los científicos se han quedado asombrados por la capacidad de estos "Modelos de Visión y Lenguaje" (VLM) para hacer esto con una precisión increíble. Pero una pregunta persistente ha quedado en el aire: ¿Cómo lo hacen realmente? ¿Realmente "ven" al perro de la misma forma que nosotros, o simplemente están adivinando basándose en pistas diminutas y ocultas?
Para responder a esto, los investigadores utilizan una técnica llamada rastreo causal (causal tracing). Piensa en esto como el escenario de un "qué pasaría si" de un detective. Si tomas una pieza específica de información del cerebro del robot y la reemplazas con una pieza diferente, ¿cambia la respuesta? Si la respuesta cambia drásticamente, esa pieza de información era "causalmente importante". Por lo general, asumimos que si un robot está hablando de un perro, la parte más importante de su cerebro debe estar mirando directamente al perro. Pero, ¿y si el robot en realidad está prestando atención a la hierba, al cielo o a las sombras, y simplemente está adivinando que el perro está ahí? Este artículo se sumerge en ese misterio, preguntándose si las partes de la IA que más importan están mirando realmente en el lugar correcto.
¿Dónde mirar? El gran engaño de la IA
En este estudio, los investigadores del Grupo de Investigación LINGO decidieron jugar a "encuentra las diferencias" con algunos de los modelos de IA más inteligentes del mundo. Querían saber: Cuando una IA responde a una pregunta sobre una imagen, ¿la parte de su cerebro que hace el trabajo pesado está mirando realmente al objeto en cuestión?
Para averiguarlo, utilizaron un truco ingenioso llamado parcheo de activación (activation patching). Imagina que el cerebro de la IA es una fábrica gigante con miles de trabajadores (llamados "tokens") pasando notas por una cinta transportadora.
- La ejecución limpia: Le muestran a la IA una foto clara y una pregunta, como "¿Dónde está la señora de la camisa azul?". La IA da una puntuación de qué tan bien entiende la imagen.
- La ejecución corrupta: Toman la misma foto y añaden un montón de ruido estático (como cuando la televisión tiene nieve) para que la IA se confunda y su puntuación baje.
- La ejecución con parche: Este es el paso mágico. Toman la foto ruidosa y "confundida", pero introducen sigilosamente una única nota limpia de la foto original en la línea de la fábrica. Si la IA de repente recuerda la respuesta y la puntuación vuelve a subir, ese token específico era el "héroe".
Los investigadores luego se hicieron una pregunta simple: ¿Ese token héroe provenía de la parte de la imagen que muestra a la señora de la camisa azul? Para medir esto, utilizaron una herramienta matemática llamada IoU (Intersección sobre Unión), que es solo una forma elegante de preguntar: "¿Cuánto se solapa esta nota con la señora real?".
El descubrimiento impactante: La IA está mirando en todas partes excepto en el lugar correcto
Los resultados fueron algo así como descubrir que tu mejor amigo resuelve un problema de matemáticas mirando al techo en lugar de a los números.
El equipo probó de todo, desde el clásico modelo CLIP hasta gigantes masivos y modernos como DeepSeek-VL, Qwen-2.5 y LLaVA. Esperaban encontrar que los tokens más "causales" (los héroes) estarían agrupados justo encima del objeto objetivo. En cambio, encontraron una conexión débil, casi inexistente.
- Los números no mienten: En el modelo CLIP, la correlación entre "ser importante" y "estar en el lugar correcto" fue de solo 0.062. Eso es prácticamente cero.
- El patrón se mantiene: Incluso en los modelos más grandes y más inteligentes, los números se mantuvieron bajos. Para DeepSeek-VL, la correlación fue de 0.0531 ± 0.0334 con un tipo de ruido y 0.0520 ± 0.0041 con otro. Para Qwen-2.5, fue de 0.0912 ± 0.0422.
- La sorpresa del "cero solapamiento": En un ejemplo específico, un token que tuvo una influencia masiva en la respuesta (una puntuación causal de 0.718) tenía casi ningún solapamiento con el objeto objetivo (un IoU de solo 0.049). Era como si la IA resolviera el rompecabezas mirando el fondo, no al sujeto.
Los autores sugieren que estos modelos son increíblemente buenos usando información visual, pero no están necesariamente anclados (grounded) en la ubicación específica de esa información. Podrían estar dependiendo de una red "distribuida" de pistas —como el color del cielo, la textura del suelo o la vibra general de la escena— en lugar de hacer zoom en el objeto específico.
¿Significa que ser más grande es mejor?
Podrías pensar: "Bueno, tal vez los modelos antiguos y más pequeños eran simplemente malos en esto, y las nuevas super-IAs lo han solucionado". Los investigadores también comprobaron esto. Observaron modelos desde 2023 hasta los últimos lanzamientos de 2025.
El veredicto: No. El patrón no cambió. Incluso los modelos más avanzados, que pueden responder preguntas complejas y seguir instrucciones perfectamente, siguen mostrando este desencuentro. Los autores señalan que el hecho de que un modelo obtenga una puntuación más alta en una prueba no significa que haya desarrollado un mejor "mapa espacial" de la imagen. Parece que un alto rendimiento no significa automáticamente que la IA esté mirando en el lugar correcto; solo significa que es muy buena adivinando la respuesta correcta usando cualquier pista que pueda encontrar.
La prueba de la "cuerda": ¿Entienden las formas?
Para profundizar aún más, el equipo planteó una pregunta diferente: Si quitas el "aspecto" de un objeto pero mantienes su forma, ¿lo sigue entendiendo la IA? Utilizaron una tarea que involucraba cuerdas (líneas) donde mantenían la geometría (la forma y las conexiones) igual, pero cambiaban la apariencia.
Descubrieron que los modelos explotan pistas visuales para entender las estructuras visuales. Cuando esas pistas basadas en la apariencia fueron eliminadas, los modelos tuvieron dificultades para mantener su comprensión de la estructura. Esto sugiere que la IA no está realmente "viendo" la forma de una manera estructural profunda e independiente de su aspecto; depende fuertemente de esos trucos de apariencia superficial para dar sentido a las conexiones. Cuando esos trucos desaparecen, la IA se pierde.
Lo que esto significa para el futuro
El artículo concluye con un mensaje claro, aunque ligeramente inquietante: Existe una brecha entre "ver" y "razonar".
Los modelos no están rotos; simplemente están trabajando de una manera que no esperábamos. Son como un detective que puede resolver un crimen al notar que el sospechoso siempre usa un sombrero rojo, sin siquiera mirar realmente el rostro del sospechoso. Las partes "causales" de su cerebro están haciendo el trabajo, pero no están necesariamente mirando al objetivo.
Los autores planean ahora observar aún más modelos y diferentes tipos de arquitecturas de cámara para ver si esta es una regla universal para toda la IA moderna o solo una peculiaridad de los modelos que probaron. Por ahora, sugieren que no debemos asumir que, porque una IA puede describir una imagen perfectamente, realmente está "mirando" el objeto de la forma en que creemos. La IA podría estar mirando toda la imagen, pero perdiendo de vista el punto específico que nos importa.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.