Multi-Attribute guided Thermal Face Image Translation based on Latent Diffusion Model
本文提出了一种由自注意力 Mamba 模块增强的新型多属性引导潜在扩散模型,用于从热成像输入生成高质量可见光人脸图像,有效克服域偏移并保留身份特征,以提升红外人脸识别性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,试图识别一名嫌疑人,但你手中唯一的照片是一张夜间拍摄的模糊黑白热成像图。你能看到面部的热信号,却无法分辨其肤色、年龄或性别。大多数现代的“面部识别”系统就像那些只懂得解读日光下清晰彩色照片的侦探。当你向他们展示热成像图时,他们会感到困惑并失败。
本文介绍了一种帮助这些侦探的新工具:一种智能翻译器,能将那些模糊的热成像热图转化为清晰的彩色照片,同时确保人物的身份完全不变。
以下是作者如何利用一些富有创意的类比来构建这一翻译器的:
问题所在:“模糊热成像”的鸿沟
现有方法试图将热成像图转换为可见光图像,但往往在两个方面失败:
- 旧方法(生成对抗网络 GANs):就像一位匆忙的画家,他们经常产生扭曲、怪异的面孔,看起来与真实人物毫无相似之处。
- 较新的方法(扩散模型):这些就像一位极其谨慎的艺术家,作画耗时极长。它们能生成高质量的图像,但经常弄错细节——将年轻男子画成老妇人,或赋予某人错误的肤色。它们在保持“身份”完整性方面存在困难。
解决方案:配备三种特殊工具的“智能翻译器”
作者基于**潜在扩散模型(LDM)**构建了一个新系统。可以将此模型想象为一位在“梦境空间”(潜在空间)中工作的 master 画家,在那里,它比在巨大画布上作画能更快、更高效地工作。
为了确保画作完美,他们添加了三种特殊工具:
1. “属性侦探”(多属性分类器)
在画家开始之前,这个工具就像一名侦探,观察热成像图并问道:“此人是男是女?是年轻还是年长?肤色如何?”
- 工作原理:该系统经过训练,能够观察热成像图并准确猜测这些特征,其准确度与观察普通彩色照片时相当。
- 类比:这就像给画家一张详细的便签,上面写着:“画一位 29 岁、拥有古铜色黄皮肤的男子。”这确保了最终的照片不仅看起来像一张脸,而且是具有正确特征的正确面孔。
2. “极速大脑”(自注意力 Mamba)
标准的 AI 模型就像一位图书管理员,必须一本一本地阅读图书馆里的每一本书才能找到特定事实。这很慢。
- 创新点:作者用一种称为Mamba的机制替换了标准的“注意力”机制。
- 类比:Mamba 就像一位能瞬间扫描整个图书馆并一次抓取正确书籍的图书管理员。它允许系统一次性理解整张脸(全局建模),而不会陷入困境,从而使转换过程更快,且对计算机内存的需求更低。
3. “身份守护者”(ID 损失)
即使有了好的描述,画家也可能无意中改变人物的鼻子或下颌线。
- 修正方案:系统拥有一个“守护者”,不断将新照片与原始热成像图进行比对。如果新照片开始看起来像另一个人,守护者就会说:“停!修正下颌线!”这确保了人物独特的身份得以保留。
结果:更出色的肖像
作者在两个大型热成像和可见光人脸数据集上测试了这一新翻译器。他们将他们的方法与现有的最佳工具(包括“匆忙的画家”和“缓慢的艺术家”)进行了比较。
- 质量:他们的照片更清晰,色彩更好,看起来更逼真(在图像质量指标中得分更高)。
- 身份:他们的照片在保持人物真实身份方面表现更好。如果你将这些新照片输入到标准的人脸识别系统中,它识别出该人物的频率远高于其他方法生成的照片。
- 速度:得益于“极速大脑”(Mamba),他们的系统比竞争对手显著更快,且使用的计算资源更少。
总结
本文提出了一种将夜视热成像人脸转化为清晰彩色肖像的新方法。通过结合一位用于猜测特征的侦探、一个用于快速处理图像的极速大脑,以及一位用于保护身份的守护者,他们创造了一个系统,其产生的结果比现有技术更清晰、更准确、更快速。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。