← 最新论文
💻 computer science

Learning Language-Driven Sequence-Level Modal-Invariant Representations for Video-Based Visible-Infrared Person Re-Identification

本文提出了语言驱动的序列级模态不变表示学习(LSMRL)方法,该方法通过集成由语言提示引导的时空特征学习、语义扩散和跨模态交互模块,有效解决了现有基于视频的可视光-红外行人重识别方法的局限性,并实现了最先进的性能。

原作者: Xiaomei Yang, Antai Liu, Xizhan Gao, Fa Zhu, Sijie Niu, Giancarlo Fortino

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaomei Yang, Antai Liu, Xizhan Gao, Fa Zhu, Sijie Niu, Giancarlo Fortino

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在拥挤人群中寻找特定目标的保安。你有两组监控摄像头:一组能看到彩色世界(就像你白天的眼睛所看到的);另一组则能看到热成像(就像红外夜视相机,能看到身体的热量)。

挑战在于:这个人在这两个屏幕上看起来完全不同。在彩色摄像头上,你看到的是一件蓝色夹克和一双红色鞋子;而在热成像摄像头上,你只看到一个发光的炽热团块。你的大脑很难将“蓝色夹克男”与“发光团块男”联系起来。

这篇论文介绍了一种名为 LSMRL 的新型 AI 系统,旨在解决这个难题。它就像是给了你的保安一项超能力:一个通用翻译器,帮助他们理解即使在光照变化(从白天到黑夜)的情况下,“蓝色夹克”和“发光团块”其实是同一个人。

以下是该系统的工作原理,通过日常类比分为三个简单的步骤:

1. “智能手表”(时空特征学习)

问题: 旧的 AI 系统就像是一个只拍单张照片的摄影师。它们会错过动作。如果一个人在行走、转身或挥手,单张照片可能会错过关键线索。此外,尝试分析整个视频通常需要超级计算机,这既慢又昂用。

解决方案: 作者构建了一个“智能手表”模块。它不仅仅是看一张静态帧,而是像看电影一样观察视频。

  • 工作原理: 它利用了一个已经能够识别数百万张照片中人物的预训练 AI(称为 CLIP)。他们并没有重建整个大脑,而只是微调了最后几层。
  • 诀窍: 他们将 AI 的注意力分为两组。一组专注于位置(空间),另一组专注于运动(时间)。
  • 类比: 想象你在看一场舞蹈。你大脑的一部分在观察舞者的姿态(空间),而另一部分在观察他们脚步的节奏(时间)。这个模块可以同时完成这两项工作,且不需要庞大的计算机,因此既快速又高效。

2. “通用翻译器”(语义扩散)

问题: 即使 AI 看到了运动,但“彩色人”和“热成像人”仍然说着不同的语言。AI 本身并不知道“正在走路的人”在彩色图像中和在热成像图像中是同一个概念。

解决方案: 他们引入了一个文本翻译器

  • 工作原理: 系统使用一段文本提示词,例如一句说:“一个在白天和黑夜条件下都被观察到的人。”
  • 诀窍: 这句话充当了桥梁。AI 将这句话的含义注入到彩色视频和热成像视频中。
  • 类比: 想象两个说着不同语言的人(彩色和热成像)试图就一个计划达成一致。你带来了一位使用“通用语言”(文本)的翻译员。翻译员向他们两人低声传达相同的指令,迫使他们的理解趋于一致。现在,彩色摄像头和热成像摄像头都在思考同一个“人”的概念。

3. “团队集会”(跨模态交互)

问题: 即便经过了翻译,可能仍存在细小的误解。彩色摄像头可能关注帽子,而热成像摄像头可能关注躯干。它们需要互相核对。

解决方案: 他们创建了一个“团队集会”模块,让两个摄像头直接进行交流。

  • 工作原理: 系统允许彩色特征和热成像特征相互观察并交换信息。
  • 类比: 想象彩色摄像头和热成像摄像头是两名侦探。侦探 A(彩色)说:“我看到一顶蓝色的帽子!”侦探 B(热成像)说:“我看到一个温暖的头部!”他们交换笔记。侦探 B 意识到:“啊,那个温暖的头部正好对应那顶蓝色的帽子!”他们结合线索,创造出一个单一且完美的嫌疑人描述。这一步消除了困惑,并创造了一个“模态不变”的表示——即一个适用于两种摄像头的描述。

“评分卡”(损失函数)

为了确保 AI 学习正确,研究人员给它制定了一套严格的评分系统(损失函数)。

  • 身份损失(Identity Loss): “确保你知道这是 A 人,而不是 B 人。”
  • 模态损失(Modality Loss): “确保无论你使用的是彩色摄像头还是热成像摄像头,对 A 人的描述看起来都是一样的。”
  • 结果: 如果 AI 认错了人,或者在两个摄像头下的描述不一致,它就会受到惩罚。

结果

研究人员在包含数千人的海量视频数据集中测试了这个系统。

  • 成果: 我们的新系统 (LSMRL) 击败了之前所有的最优方法。
  • 数据: 在一项测试中,与之前的最佳系统相比,它在寻找正确目标的准确率上提升了近 6%。在 AI 安防领域,这是一个巨大的飞跃。
  • 效率: 尽管完成了更复杂的任务,它并不需要超级计算机;它实际上比其他高科技方法更快、更轻量。

总结

简而言之,这篇论文提出了一种教导 AI 在不同类型的摄像头(白天 vs 黑夜)之间识别人的新方法。它通过以下方式实现:

  1. 像看电影一样观察视频,而不只是看照片。
  2. 使用一段文本句子来强制两种类型的摄像头对“人”的概念达成共识。
  3. 让两种类型的摄像头互相交流以修正任何剩余的错误。

其结果是一个更擅长在白天或黑夜寻找正确目标的安防系统,且无需昂贵的硬件。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →