← 最新论文
💻 computer science

CLIP4VI-ReID: Learning Modality-shared Representations via CLIP Semantic Bridge for Visible-Infrared Person Re-identification

本文提出了 CLIP4VI-ReID,这是一种利用 CLIP 的文本语义作为桥梁来生成可见光-红外行人重识别中模态共享表示的新型网络,通过从可见光图像生成文本、纠正红外特征并优化高层语义对齐,从而实现卓越的跨模态性能。

原作者: Xiaomei Yang, Xizhan Gao, Sijie Niu, Fa Zhu, Guang Feng, Xiaofeng Qu, David Camacho

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaomei Yang, Xizhan Gao, Sijie Niu, Fa Zhu, Guang Feng, Xiaofeng Qu, David Camacho

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在拥挤的城市中寻找一位特定的朋友,但你手里有两张截然不同的地图。一张地图是白天的彩色高清照片,色彩鲜艳,展示了你朋友鲜红色的夹克和蓝色的运动鞋。另一张地图是夜晚的黑白热成像图像,颗粒感很重,你的朋友看起来就像黑暗背景中一个发光的白色光团。这就是监控摄像头和计算机视觉系统面临的日常挑战:将白天看到的(可见光)与黑夜看到的(红外线)同一个人进行匹配。虽然人类可以轻易地将彩色的脸庞与热信号联系起来,但计算机却很难做到,因为这两类图像之间的“鸿沟”巨大。它们看起来完全不同,这使得标准的 AI 很难意识到它们看到的是同一个人。为了解决这个问题,研究人员通常会使用一种巧妙的技巧,即使用一个被称为 CLIP 的“通用翻译器”。把 CLIP 想象成一位超级聪明的图书管理员,他读过数百万本书,看过数百万张照片;他知道“运动鞋”这个词会将图片与鞋子联系起来,即使图片很模糊或是在黑暗中拍摄的。通过使用文字作为桥梁,计算机可以尝试通过它们共同的描述来匹配白天的照片和夜晚的照片。

然而,这里有一个陷阱。这位“图书管理员”(CLIP)主要是基于色彩鲜艳、阳光充足的照片进行训练的。如果你要求它描述一张夜间摄像头的发光热团,它往往会感到困惑,产生模糊或带有噪声的描述,比如“一个模糊的人”,而不是“一个背着背包的人”。这种困惑会破坏匹配过程。在本文中,作者提出了一种名为 CLIP4VI-ReID 的新方法来解决这个问题。他们不再直接要求困惑的图书管理员去描述夜晚的照片,而是先让它描述清晰的白天照片。然后,他们利用那段准确的描述作为引导,来“教导”计算机如何正确地观察夜晚的照片。他们通过三个步骤来实现这一点:首先,从白天照片中生成完美的文本描述;第二,利用这些文字来纠正计算机对夜晚照片的理解;最后,微调整个系统,使白天照片、夜晚照片和文本描述完美地对齐。结果表明,这种循序渐进的方法在寻找正确目标方面比以往的方法表现得更好,证明了使用正确的“语言”作为桥梁可以帮助计算机在黑暗中看清事物。

问题所在:巨大的模态鸿沟

想象一下,你正试图将嫌疑人的身份证(一张清晰的彩色照片)与小巷里的监控录像(一张热成像黑白图像)进行匹配。在计算机视觉领域,这被称为可见光-红外行人重识别(VI-ReID)。目标很简单:在两种完全不同的图像类型中找到同一个人。但这非常困难,因为这两类图像看起来完全不同。彩色照片充满了细节,如红色的上衣和蓝色的牛仔裤,而热成像图像仅仅是一个基于人体热量的发光形状。

长期以来,计算机尝试通过将热成像图像转化为彩色图像(这通常看起来很假且充满噪声),或者尝试直接在两者之间寻找共同特征来解决这个问题。但本文的作者注意到,基于某种被称为 CLIP 的更智能的新型 AI 模型在处理此类问题时存在缺陷。这些模型试图为两者(彩色照片和热成像照片)都生成文本描述。问题在于,AI 主要是在数百万张色彩鲜艳、阳光充足的照片上训练的。当它观察热成像图像时,它不知道该说什么。它会生成微弱且不准确的描述,例如“一个难以看清的人”,而不是有用的细节,如“戴着帽子”。这种糟糕的描述不仅没有让匹配变得更容易,反而增加了难度。

解决方案:三阶段桥梁

为了修复这个问题,作者构建了一个名为 CLIP4VI-ReID 的新系统。他们没有强迫 AI 直接用文字描述热成像图像,而是设计了一个巧妙的三阶段过程,就像一支施工队正在这两类世界之间搭建一座桥梁。

第一阶段:文本语义生成 (TSG)
首先,团队决定不再要求 AI 描述热成像图像。相反,他们只要求它描述清晰的彩色照片。他们使用了一种称为“提示学习”(prompt learning)的技术,这就像给 AI 一个填空题:“一张 [_____] 人的照片。” AI 学习仅根据彩色照片在空格中填入具体的细节(如“穿着运动鞋”或“背着背包”)。因为彩色照片非常清晰,AI 会生成完美且详细的文本描述。这些描述成为了“金标准”或桥梁。

第二阶段:红外特征嵌入 (IFE)
现在,既然已经有了来自彩色照片的完美文本描述,他们就利用这些描述来教导 AI 如何观察热成像图像。他们并不要求 AI 为热成像图像生成新的词汇,而是告诉 AI:“观察这张热成像图像,并尝试让它的特征与我们为彩色照片编写的文本相匹配。” 这就像是给一名学生展示一张清晰的地图,然后要求他们在导航一条雾气缭绕的小径时,使用同一张地图作为指南。AI 学习调整其对热成像图像的理解,使其与准确的文本描述保持一致。这一步“纠正”或修复了热成像图像的特征,将正确的身份信息注入其中。

第三阶段:高层语义对齐 (HSA)
最后,团队对整个系统进行微调。他们确保文本描述不会意外包含仅存在于彩色照片中(如特定颜色)且不被热成像照片共享的细节。他们希望文本描述的是对两者都成立的事物(如“一个背着背包的人”)。他们还调整了分别观察彩色和热成像图像的 AI 部分,以确保它们能捕捉到最佳细节。这个最终阶段确保了彩色照片、热成像照片和文本描述都能以极高的精度指向同一个人。

研究发现

作者在两个著名的彩色与热成像行人数据集 SYSU-MM01RegDB 上测试了他们的新系统。他们将自己的方法与现有的最佳技术进行了对比。

  • 在 SYSU-MM01 数据集上: 他们的 CLIP4VI-ReID 方法在“全搜索”(All-Search)设置下(即系统必须从众多可能性中找到目标)实现了 75.54% 的 Rank-1 准确率。这优于之前的最佳方法(其准确率为 75.2%)。在“室内搜索”(Indoor-Search)设置下,他们达到了更高的 83.98% Rank-1 准确率,大幅领先于次优方法。
  • 在 RegDB 数据集上: 结果更加令人印象深刻。在“红外检索可见光”(Infrared-to-Visible,即通过热成像查询找到彩色照片)测试中,他们达到了 92.28% 的 Rank-1 准确率,是所有测试方法中最高的。在“可见光检索红外”(Visible-to-Infrared)测试中,他们达到了 94.51% 的 Rank-1 准确率

论文还提供了视觉证据。他们展示了在使用其方法之前,计算机对彩色和热成像图像的“心理地图”处于完全不同的位置。而在经过这三个阶段的处理后,同一人的图像(无论是彩色还是热成像)紧密地聚集在一起,而不同人的图像则保持较远距离。

为什么这很重要

核心结论是,强迫计算机直接描述热成像图像往往会导致困惑和错误。通过先利用清晰的彩色图像生成描述,再利用该描述来引导热成像图像,系统避免了“噪声”并获得了更好的结果。作者指出,这种“由粗到精”(coarse-to-fine)的方法——即从粗略的对齐开始,然后进行精细化处理——是帮助计算机跨越不同光照类型进行观察的一种强大方式。虽然该方法比简单的模型需要更多的训练时间,但准确性的提升表明,对于需要 24/7 全天候工作的安全系统来说,这是一个值得的权衡。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →