← Derniers articles
💻 computer science

CLIP4VI-ReID: Learning Modality-shared Representations via CLIP Semantic Bridge for Visible-Infrared Person Re-identification

Cet article propose CLIP4VI-ReID, un nouveau réseau qui exploite la sémantique textuelle de CLIP comme un pont pour générer des représentations partagées entre les modalités pour la réidentification de personnes visible-infrarouge en générant du texte à partir d'images visibles, en rectifiant les caractéristiques infrarouges et en affinant l'alignement sémantique de haut niveau afin d'atteindre une performance cross-modale supérieure.

Auteurs originaux : Xiaomei Yang, Xizhan Gao, Sijie Niu, Fa Zhu, Guang Feng, Xiaofeng Qu, David Camacho

Publié 2026-08-05
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xiaomei Yang, Xizhan Gao, Sijie Niu, Fa Zhu, Guang Feng, Xiaofeng Qu, David Camacho

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez de retrouver un ami spécifique dans une ville bondée, mais que vous disposez de deux cartes très différentes. L'une est une photo couleur haute définition et éclatante prise en plein jour, montrant la veste rouge vif et les baskets bleues de votre ami. L'autre est une image thermique en noir et blanc, granuleuse, prise de nuit, où votre ami ressemble à une tache blanche incandescente sur un fond sombre. C'est le défi quotidien des caméras de sécurité et des systèmes de vision par ordinateur : faire correspondre une personne vue en plein jour (lumière visible) avec la même personne vue dans l'obscurité (infrarouge). Si les humains peuvent facilement relier les points entre un visage coloré et une signature thermique, les ordinateurs, eux, peinent. Ils voient deux choses qui ne se ressemblent pas du tout, ce qui rend difficile pour une IA standard de réaliser qu'ils regardent la même personne. Pour résoudre cela, les chercheurs utilisent souvent une astuce ingénieuse impliquant un « traducteur universel » appelé CLIP. Considérez CLIP comme un bibliothécaire super intelligent qui a lu des millions de livres et vu des millions de photos ; il sait que le mot « baskets » relie l'image de chaussures, même si l'image est floue ou prise dans l'obscurité. En utilisant les mots comme un pont, l'ordinateur peut tenter de faire correspondre la photo de jour à la photo de nuit grâce à leur description commune.

Cependant, il y a un piège. Le « bibliothécaire » (CLIP) a été entraîné principalement sur des photos colorées et ensoleillées. Si vous lui demandez de décrire une tache de chaleur incandescente provenant d'une caméra de nuit, il se confond souvent, produisant des descriptions vagues ou bruitées comme « une personne vague » au lieu de « une personne avec un sac à dos ». Cette confusion fausse le processus de correspondance, au lieu de l'aider. Dans cet article, les auteurs proposent une nouvelle méthode appelée CLIP4VI-ReID pour corriger ce problème. Au lieu de demander au bibliothécaire confus de décrire directement la photo de nuit, ils lui demandent d'abord de décrire la photo claire de jour. Ensuite, ils utilisent cette description précise comme un guide pour « enseigner » à l'ordinateur comment voir correctement la photo de nuit. Ils procèdent en trois étapes : premièrement, ils génèrent des descriptions textuelles parfaites à partir des photos de jour ; deuxièmement, ils utilisent ces mots pour corriger la compréhension de l'ordinateur des photos de nuit ; et enfin, ils peaufinent l'ensemble du système pour que les photos de jour, les photos de nuit et les descriptions textuelles s'alignent parfaitement. Les résultats montrent que cette approche étape par étape est bien meilleure pour trouver la bonne personne que les méthodes précédentes, prouvant que l'utilisation du bon type de « mots » comme pont peut aider les ordinateurs à voir clairement, même dans l'obscurité.

Le Problème : Le Grand Écart de Modalité

Imaginez que vous essayiez de faire correspondre la carte d'identité d'un suspect (une photo couleur nette) avec un flux de caméra de sécurité provenant d'une ruelle sombre (une image thermique, en noir et blanc). Dans le monde de la vision par ordinateur, cela s'appelle la Ré-identification de Personne Visible-Infrarouge (VI-ReID). L'objectif est simple : trouver la même personne à travers ces deux types d'images très différents. Mais c'est incroyablement difficile car les deux images ne se ressemblent pas du tout. La photo couleur est pleine de détails comme des chemises rouges et des jeans bleus, tandis que l'image thermique n'est qu'une forme incandescente basée sur la chaleur corporelle.

Pendant longtemps, les ordinateurs ont tenté de résoudre cela soit en essayant de transformer l'image thermique en une image couleur (ce qui donne souvent un aspect faux et bruité), soit en essayant de trouver des caractéristiques communes directement entre les deux. Mais les auteurs de cet article ont remarqué une faille dans la manière dont les modèles d'IA plus récents et plus intelligents (basés sur ce qu'on appelle CLIP) gèrent cela. Ces modèles tentaient de générer une description textuelle pour à la fois la photo couleur et la photo thermique. Le problème ? L'IA a été entraînée sur des millions de photos ensoleillées et colorées. Lorsqu'elle regardait une image thermique, elle ne savait pas quoi dire. Elle générait des descriptions faibles et inexactes comme « une personne difficile à voir » au lieu de détails utiles comme « portant un chapeau ». Cette mauvaise description rendait la correspondance de la personne plus difficile, plutôt que plus facile.

La Solution : Un Pont en Trois Étapes

Pour corriger cela, les auteurs ont construit un nouveau système appelé CLIP4VI-ReID. Au lieu de forcer l'IA à deviner à quoi ressemble l'image thermique en mots, ils ont conçu un processus ingénieux en trois étapes qui agit comme une équipe de construction bâtissant un pont entre les deux mondes.

Étape 1 : La Génération Sémantique de Texte (TSG - Text Semantic Generation)
D'abord, l'équipe a décidé de ne plus demander à l'IA de décrire l'image thermique. À la place, ils ne lui ont demandé de décrire que les photos couleur claires. Ils ont utilisé une technique d'« apprentissage de prompt », qui est comme donner à l'IA une phrase à trous : « Une photo d'une personne [_____] ». L'IA apprend à remplir les blancs avec des détails spécifiques (comme « portant des baskets » ou « portant un sac à dos ») en se basant uniquement sur les photos en couleur. Comme les photos en couleur sont nettes, l'IA génère des descriptions textuelles parfaites et détaillées. Ces descriptions deviennent le « standard d'excellence » ou le pont.

Étape 2 : L'Incrustation de Caractéristiques Infrarouges (IFE - Infrared Feature Embedding)
Maintenant qu'ils ont les descriptions textuelles parfaites issues des photos en couleur, ils les utilisent pour enseigner à l'IA comment regarder les images thermiques. Ils ne demandent pas à l'IA de générer de nouveaux mots pour l'image thermique. Au lieu de cela, ils disent à l'IA : « Regarde cette image thermique, et essaie de faire en sorte que ses caractéristiques correspondent au texte que nous avons déjà écrit pour la photo en couleur. » C'est comme montrer à un étudiant une carte claire, puis lui demander de naviguer sur un chemin brumeux en utilisant cette même carte comme guide. L'IA apprend à ajuster sa compréhension de l'image thermique afin qu'elle s'aligne sur la description textuelle précise. Cette étape « rectifie » ou corrige les caractéristiques de l'image thermique, injectant l'information d'identité correcte dans celles-ci.

Étape 3 : L'Alignement Sémantique de Haut Niveau (HSA - High-level Semantic Alignment)
Enfin, l'équipe peaufine l'ensemble du système. Ils s'assurent que les descriptions textuelles n'incluent pas accidentellement des détails qui ne sont présents que dans la photo en couleur (comme des couleurs spécifiques) et qui ne sont pas partagés avec la photo thermique. Ils veulent que le texte décrive uniquement les choses qui sont vraies pour les deux images (comme « une personne avec un sac à dos »). Ils ajustent également les parties de l'IA qui analysent séparément les images en couleur et thermiques pour s'assurer qu'elles captent les meilleurs détails. Cette étape finale garantit que la photo en couleur, la photo thermique et la description textuelle pointent tous vers la même personne avec une grande précision.

Ce Qu'Ils Ont Trouvé

Les auteurs ont testé leur nouveau système sur deux ensembles de données célèbres de personnes en images couleur et thermiques : SYSU-MM01 et RegDB. Ils ont comparé leur méthode aux meilleures techniques existantes.

  • Sur l'ensemble de données SYSU-MM01 : Leur méthode, CLIP4VI-ReID, a atteint une précision de Rang-1 de 75,54 % dans le cadre « All-Search » (où le système doit trouver la personne parmi de nombreuses possibilités). C'était meilleur que la précédente meilleure méthode, qui atteignait 75,2 %. Dans le cadre « Indoor-Search », ils ont atteint une précision de Rang-1 encore plus élevée de 83,98 %, dépassant nettement la méthode suivante.
  • Sur l'ensemble de données RegDB : Les résultats sont encore plus impressionnants. Dans le test « Infrared-to-Visible » (trouver une photo couleur à partir d'une requête thermique), ils ont atteint une précision de Rang-1 de 92,28 %, la plus élevée de toutes les méthodes testées. Dans le test « Visible-to-Infrared », ils ont atteint 94,51 % de précision de Rang-1.

L'article comprenait également une preuve visuelle. Ils ont montré qu'avant leur méthode, la « carte mentale » de l'ordinateur pour les images couleur et thermiques se trouvait dans des endroits complètement différents. Après leur processus en trois étapes, les images de la même personne (qu'elle soit en couleur ou thermique) se regroupent étroitement, tandis que les images de personnes différentes restent éloignées.

Pourquoi Cela Importe

Le point essentiel est que forcer un ordinateur à décrire directement une image thermique mène souvent à la confusion et aux erreurs. En utilisant l'image en couleur claire pour générer la description d'abord, puis en utilisant cette description pour guider l'image thermique, le système évite le « bruit » et obtient de bien meilleurs résultats. Les auteurs suggèrent que cette approche « du grossier au fin » — commencer par un alignement approximatif, puis l'affiner — est une manière puissante d'aider les ordinateurs à voir à travers différents types de lumière. Bien que la méthode nécessite un peu plus de temps d'entraînement que les modèles plus simples, l'amélioration de la précision suggère que c'est un compromis qui en vaut la peine pour les systèmes de sécurité qui doivent fonctionner 24h/24 et 7j/7, de jour comme de nuit.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →