← 最新论文
💻 computer science

Multi-Attribute guided Thermal Face Image Translation based on Latent Diffusion Model

本文提出了一种由自注意力 Mamba 模块增强的新型多属性引导潜在扩散模型,用于从热成像输入生成高质量可见光人脸图像,有效克服域偏移并保留身份特征,以提升红外人脸识别性能。

原作者: Mingshu Cai, Osamu Yoshie, Yuya Ieiri

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingshu Cai, Osamu Yoshie, Yuya Ieiri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,试图识别一名嫌疑人,但你手中唯一的照片是一张夜间拍摄的模糊黑白热成像图。你能看到面部的热信号,却无法分辨其肤色、年龄或性别。大多数现代的“面部识别”系统就像那些只懂得解读日光下清晰彩色照片的侦探。当你向他们展示热成像图时,他们会感到困惑并失败。

本文介绍了一种帮助这些侦探的新工具:一种智能翻译器,能将那些模糊的热成像热图转化为清晰的彩色照片,同时确保人物的身份完全不变。

以下是作者如何利用一些富有创意的类比来构建这一翻译器的:

问题所在:“模糊热成像”的鸿沟

现有方法试图将热成像图转换为可见光图像,但往往在两个方面失败:

  1. 旧方法(生成对抗网络 GANs):就像一位匆忙的画家,他们经常产生扭曲、怪异的面孔,看起来与真实人物毫无相似之处。
  2. 较新的方法(扩散模型):这些就像一位极其谨慎的艺术家,作画耗时极长。它们能生成高质量的图像,但经常弄错细节——将年轻男子画成老妇人,或赋予某人错误的肤色。它们在保持“身份”完整性方面存在困难。

解决方案:配备三种特殊工具的“智能翻译器”

作者基于**潜在扩散模型(LDM)**构建了一个新系统。可以将此模型想象为一位在“梦境空间”(潜在空间)中工作的 master 画家,在那里,它比在巨大画布上作画能更快、更高效地工作。

为了确保画作完美,他们添加了三种特殊工具:

1. “属性侦探”(多属性分类器)
在画家开始之前,这个工具就像一名侦探,观察热成像图并问道:“此人是男是女?是年轻还是年长?肤色如何?”

  • 工作原理:该系统经过训练,能够观察热成像图并准确猜测这些特征,其准确度与观察普通彩色照片时相当。
  • 类比:这就像给画家一张详细的便签,上面写着:“画一位 29 岁、拥有古铜色黄皮肤的男子。”这确保了最终的照片不仅看起来像一张脸,而且是具有正确特征的正确面孔。

2. “极速大脑”(自注意力 Mamba)
标准的 AI 模型就像一位图书管理员,必须一本一本地阅读图书馆里的每一本书才能找到特定事实。这很慢。

  • 创新点:作者用一种称为Mamba的机制替换了标准的“注意力”机制。
  • 类比:Mamba 就像一位能瞬间扫描整个图书馆并一次抓取正确书籍的图书管理员。它允许系统一次性理解整张脸(全局建模),而不会陷入困境,从而使转换过程更快,且对计算机内存的需求更低。

3. “身份守护者”(ID 损失)
即使有了好的描述,画家也可能无意中改变人物的鼻子或下颌线。

  • 修正方案:系统拥有一个“守护者”,不断将新照片与原始热成像图进行比对。如果新照片开始看起来像另一个人,守护者就会说:“停!修正下颌线!”这确保了人物独特的身份得以保留。

结果:更出色的肖像

作者在两个大型热成像和可见光人脸数据集上测试了这一新翻译器。他们将他们的方法与现有的最佳工具(包括“匆忙的画家”和“缓慢的艺术家”)进行了比较。

  • 质量:他们的照片更清晰,色彩更好,看起来更逼真(在图像质量指标中得分更高)。
  • 身份:他们的照片在保持人物真实身份方面表现更好。如果你将这些新照片输入到标准的人脸识别系统中,它识别出该人物的频率远高于其他方法生成的照片。
  • 速度:得益于“极速大脑”(Mamba),他们的系统比竞争对手显著更快,且使用的计算资源更少。

总结

本文提出了一种将夜视热成像人脸转化为清晰彩色肖像的新方法。通过结合一位用于猜测特征的侦探、一个用于快速处理图像的极速大脑,以及一位用于保护身份的守护者,他们创造了一个系统,其产生的结果比现有技术更清晰、更准确、更快速。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →