← Últimos artículos
💻 computer science

CLIP4VI-ReID: Learning Modality-shared Representations via CLIP Semantic Bridge for Visible-Infrared Person Re-identification

Este artículo propone CLIP4VI-ReID, una red novedosa que aprovecha la semántica de texto de CLIP como un puente para generar representaciones compartidas entre modalidades para la reidentificación de personas visible-infrarroja mediante la generación de texto a partir de imágenes visibles, la rectificación de características infrarrojas y el refinamiento de la alineación semántica de alto nivel para lograr un rendimiento cross-modal superior.

Autores originales: Xiaomei Yang, Xizhan Gao, Sijie Niu, Fa Zhu, Guang Feng, Xiaofeng Qu, David Camacho

Publicado 2026-08-05
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Xiaomei Yang, Xizhan Gao, Sijie Niu, Fa Zhu, Guang Feng, Xiaofeng Qu, David Camacho

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando encontrar a un amigo específico en una ciudad concurrida, pero tienes dos mapas muy diferentes. Un mapa es una foto a color de alta definición y vibrante tomada durante el día, que muestra la chaqueta roja brillante y las zapatillas azules de tu amigo. El otro mapa es una imagen térmica en blanco y negro, granulada, tomada de noche, donde tu amigo parece una mancha blanca resplandeciente contra un fondo oscuro. Este es el desafío diario para las cámaras de seguridad y los sistemas de visión artificial: emparejar a una persona vista en la luz del día (luz visible) con la misma persona vista en la oscuridad (infrarrojo). Mientras que los humanos podemos conectar fácilmente los puntos entre un rostro colorido y una firma de calor, las computadoras luchan por hacerlo porque el "vacío" entre estos dos tipos de imágenes es enorme. Se ven totalmente distintas, lo que hace difícil que una IA estándar se dé cuenta de que está viendo a la misma persona. Para resolver esto, los investigadores suelen utilizar un truco ingenioso que involucra a un "traductor universal" llamado CLIP. Piensa en CLIP como un bibliotecario superinteligente que ha leído millones de libros y visto millones de fotos; sabe que la palabra "zapatillas" conecta con la imagen de unos zapatos, incluso si la imagen es borrosa o está tomada en la oscuridad. Al usar las palabras como un puente, la computadora puede intentar emparejar la foto del día con la foto de la noche a través de su descripción compartida.

Sin embargo, hay un inconveniente. El "bibliotecario" (CLIP) fue entrenado principalmente con fotos coloridas y soleadas. Si le pides que describa una mancha de calor resplandeciente de una cámara nocturna, a menudo se confunde, produciendo descripciones vagas o ruidosas como "una persona vaga" en lugar de "una persona con una mochila". Esta confusión entorpece el proceso de emparejamiento, en lugar de facilitarlo. En este artículo, los autores proponen un nuevo método llamado CLIP4VI-ReID para solucionar este problema. En lugar de pedirle al bibliotecero confundido que describa directamente la foto nocturna, primero le piden que describa la foto clara del día. Luego, utilizan esa descripción precisa como una guía para "enseñar" a la computadora cómo ver la foto nocturna correctamente. Lo hacen en tres pasos: primero, generan descripciones de texto perfectas a partir de las fotos del día; segundo, usan esas palabras para corregir la comprensión de la computadora sobre las fotos nocturnas; y finalmente, ajustan todo el sistema para que las fotos del día, las fotos nocturnas y las descripciones de texto se alineen perfectamente. Los resultados muestran que este enfoque paso a paso es mucho mejor para encontrar a la persona correcta que los métodos anteriores, demostrando que usar el tipo de "palabras" adecuadas como puente puede ayudar a las computadoras a ver claramente, incluso en la oscuridad.

El Problema: El Gran Vacío de Modalidad

Imagina que intentas emparejar la tarjeta de identidad de un sospechoso (una foto clara a color) con la transmisión de una cámara de seguridad de un callejón oscuro (una imagen térmica en blanco y negro). En el mundo de la visión artificial, esto se llama Reidentificación de Personas Visible-Infrarrojo (VI-ReID). El objetivo es simple: encontrar a la misma persona a través de estos dos tipos de imágenes tan diferentes. Pero es increíblemente difícil porque las dos imágenes no se parecen en nada. La foto a color está llena de detalles como camisas rojas y jeans azules, mientras que la imagen térmica es solo una forma resplandeciente basada en el calor corporal.

Durante mucho tiempo, las computadoras intentaron resolver esto ya sea tratando de convertir la imagen térmica en una de color (lo que a menudo se ve falso y ruidoso) o intentando encontrar características comunes directamente entre las dos. Pero los autores de este artículo notaron una falla en la forma en que los modelos de IA más nuevos y más inteligentes (basados en algo llamado CLIP) manejaban esto. Estos modelos intentaban generar una descripción de texto tanto para la foto a color como para la foto térmica. ¿El problema? La IA fue entrenada con millones de fotos coloridas y soleadas. Cuando miraba una imagen térmica, no sabía qué decir. Generaba descripciones débiles e inexactas como "una persona difícil de ver" en lugar de detalles útiles como "usando un sombrero". Esta mala descripción hacía que fuera más difícil para la computadora emparejar a la persona, en lugar de facilitarlo.

La Solución: Un Puente de Tres Etapas

Para solucionar esto, los autores construyeron un nuevo sistema llamado CLIP4VI-ReID. En lugar de forzar a la IA a adivinar cómo se ve la imagen térmica en palabras, diseñaron un ingenioso proceso de tres etapas que actúa como un equipo de construcción construyendo un puente entre los dos mundos.

Etapa 1: Generación Semántica de Texto (TSG)
Primero, el equipo decidió dejar de pedirle a la IA que describiera la imagen térmica. En su lugar, solo le pidieron que describiera las fotos claras y a color. Utilizaron una técnica llamada "aprendizaje de prompts", que es como darle a la IA una oración para completar espacios en blanco: "Una foto de una persona [_____]". La IA aprende a llenar los espacios con detalles específicos (como "usando zapatillas" o "cargando una mochila") basándose solo en las fotos a color. Debido a que las fotos a color son claras, la IA genera descripciones de texto perfectas y detalladas. Estas descripciones se convierten en el "estándar de oro" o el puente.

Etapa 2: Incrustación de Características Infrarrojas (IFE)
Ahora que tienen las descripciones de texto perfectas de las fotos a color, usan estas para enseñar a la IA cómo mirar las imágenes térmicas. No le piden a la IA que genere nuevas palabras para la imagen térmica. En su lugar, le dicen: "Mira esta imagen térmica y trata de que sus características coincidan con el texto que ya escribimos para la foto a color". Esto es como mostrarle a un estudiante un mapa claro y luego pedirle que navegue por un camino con niebla usando ese mismo mapa como guía. La IA aprende a ajustar su comprensión de la imagen térmica para que se alinee con la descripción de texto precisa. Este paso "rectifica" o corrige las características de la imagen térmica, inyectando la información de identidad correcta en ellas.

Etapa 3: Alineación Semántica de Alto Nivel (HSA)
Finalmente, el equipo ajusta todo el sistema. Se aseguran de que las descripciones de texto no incluyan accidentalmente detalles que solo están en la foto a color (como colores específicos) y que no se comparten con la foto térmica. Quieren que el texto describa solo las cosas que son ciertas para ambas imágenes (como "una persona con una mochila"). También ajustan las partes de la IA que observan las imágenes a color y térmicas por separado para asegurarse de que estén captando los mejores detalles. Esta etapa final garantiza que la foto a color, la foto térmica y la descripción de texto apunten a la misma persona con alta precisión.

Lo Que Encontraron

Los autores probaron su nuevo sistema en dos conjuntos de datos famosos de personas en imágenes a color y térmicas: SYSU-MM01 y RegDB. Compararon su método con las mejores técnicas existentes.

  • En el conjunto de datos SYSU-MM01: Su método, CLIP4VI-ReID, logró una precisión de Rank-1 del 75.54% en la configuración de "Búsqueda Total" (donde el sistema tiene que encontrar a la persona entre muchas posibilidades). Esto fue mejor que el método anterior más avanzado, que obtuvo un 75.2%. En la configuración de "Búsqueda en Interiores", lograron una precisión de Rank-1 aún mayor del 83.98%, superando al siguiente mejor método por un margen significativo.
  • En el conjunto de datos RegDB: Los resultados fueron aún más impresionantes. En la prueba "Infrarrojo-a-Visible" (encontrar una foto a color a partir de una consulta térmica), alcanzaron una precisión de Rank-1 del 92.28%, la más alta entre todos los métodos probados. En la prueba "Visible-a-Infrarrojo", alcanzaron un 94.51% de precisión de Rank-1.

El artículo también incluyó pruebas visuales. Mostraron que, antes de su método, el "mapa mental" de la computadora para las imágenes a color y térmicas estaba en lugares completamente diferentes. Después de su proceso de tres etapas, las imágenes de la misma persona (ya sea a color o térmica) se agruparon estrechamente, mientras que las imágenes de diferentes personas se mantuvieron alejadas.

Por Qué Es Importante

La conclusión clave es que intentar forzar a una computadora a describir una imagen térmica directamente a menudo conduce a la confusión y los errores. Al usar la imagen a color clara para generar la descripción primero, y luego usar esa descripción para guiar la imagen térmica, el sistema evita el "ruido" y obtiene mejores resultados. Los autores sugieren que este enfoque "de grueso a fino" —comenzar con un alineamiento aproximado y luego refinarlo— es una forma poderosa de ayudar a las computadoras a ver a través de diferentes tipos de luz. Aunque el método requiere un poco más de tiempo de entrenamiento que los modelos más simples, la mejora en la precisión sugiere que es un intercambio que vale la pena para los sistemas de seguridad que necesitan funcionar las 24 horas del día, los 7 días de la semana, ya sea de día o de noche.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →