← Últimos artículos
💻 computer science

Logit Lens Supervision for Patch-Level Explanations in Vision-Language Models

Este artículo introduce Logit Lens Loss (LLL), un objetivo auxiliar ligero que mejora la explicabilidad a nivel de parche en los Modelos de Visión-Lenguaje al alinear las incrustaciones de los tokens visuales con sus conceptos textuales correspondientes, mejorando así la fundamentación y reduciendo las alucinaciones sin requerir cambios arquitectónicos o un reentrenamiento extensivo.

Autores originales: Parsa Esmaeilkhani, Longin Jan Latecki

Publicado 2026-08-12
📖 4 min de lectura☕ Lectura para el café

Autores originales: Parsa Esmaeilkhani, Longin Jan Latecki

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un amigo robot súper inteligente que puede mirar una imagen y contarte una historia sobre ella. Este robot está construido de dos partes muy diferentes: un par de "ojos" que ve la imagen como una cuadrícula de diminutos cuadrados de colores (parches), y un "cerebro" que es un experto en escribir historias usando palabras. Cuando le preguntas al robot: "¿Dónde está el gato?", sus ojos envían una señal por cada uno de los cuadrados de la foto a su cerebro. El cerebro luego mezcla estas señales de la imagen con sus propias señales de palabras para descubrir la respuesta.

El problema es que, a medida que las señales de la imagen viajan a través del cerebro, se pierden un poco entre la multitud. El cerebro es tan bueno hablando que a veces empieza a ignorar los detalles específicos de los cuadrados de la imagen, o peor aún, empieza a mezclar las señales de la imagen tan profundamente con las señales de las palabras que el robot olvida qué cuadrado pertenece realmente al gato. Puede que adivine "gato" correctamente, pero solo está adivinando basándose en las palabras, no en el hecho de ver realmente al gato en la foto. Esto es algo importante porque si queremos confiar en estos robots, o si queremos saber por qué creen que hay un gato en una foto, necesitamos ser capaces de ver exactamente qué parte de la imagen están mirando. Si el robot no puede señalar al gato, podría estar alucinando: inventando cosas que no están ahí.

Este artículo aborda exactamente ese problema. Los autores, Parsa Esmaeilkhani y Longin Jan Latecki, notaron que en los modelos actuales de "Visión-Lenguaje" (VLM), la conexión entre un parche de imagen específico y la palabra que lo describe se vuelve débil y difusa a medida que los datos se mueven a través del sistema. Para solucionar esto, inventaron un nuevo truco de entrenamiento llamado Logit Lens Loss (LLL).

Piensa en el cerebro del robot como una biblioteca gigante donde cada libro representa una palabra. Normalmente, al robot solo se le enseña a elegir el libro correcto para decir a continuación (como responder a una pregunta). Los autores se dieron cuenta de que si el robot está mirando un parche de un gato, ese parche específico debería estar susurrando "gato" a la biblioteca, incluso antes de que el robot decida hablar. Crearon una nueva regla para el entrenamiento: cada vez que el robot ve un parche que contiene un gato, obligan a que ese parche prediga fuertemente la palabra "gato" en el vocabulario de la biblioteca. Llaman a esto "Logit Lens Loss" porque utilizan una herramienta llamada "Logit Lens" para echar un vistazo dentro del cerebro del robot y ver sobre qué palabras están pensando secretamente los parches de la imagen.

¿Lo mejor de todo? No tuvieron que reconstruir el robot ni añadirle ninguna parte nueva. Solo ajustaron las reglas de entrenamiento. Cuando probaron esta nueva regla en dos robots populares (LLaVA-v1.5 y Qwen2.5-VL), los resultados fueron como encender un reflector. Antes, el "mapa de confianza" del robot (un mapa de calor que muestra dónde cree que está el objeto) era borroso y disperso, como una ventana empañada. Después de usar su nueva regla, el mapa se volvió nítido y preciso, iluminando exactamente donde estaba el gato.

El artículo muestra que este simple arreglo hace un trabajo pesado. Hace que los robots sean mucho mejores encontrando objetos en imágenes (grounding), reduce las veces que inventan objetos que no están allí (alucinaciones) e incluso ayuda a señalar objetos en imágenes nuevas que nunca han visto antes. Sorprendentemente, no hizo que los robots fueran peores respondiendo preguntas o contando historias; de hecho, mantuvo sus habilidades lingüísticas igual de fuertes. Los autores sugieren que, al mantener las señales de la imagen ligadas a su significado original, los robots se vuelven tanto más inteligentes como más honestos sobre lo que están viendo. Es un poco como enseñar a un estudiante no solo a memorizar la respuesta, sino a entender realmente el mapa que está mirando.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →